Sign in

tomo. (守岡 知彦)

@tomo.chise.org
40 followers 61 following 430 posts

CHISE project www.chise.org の中の人。 gitlab.chise.org/tomo github.com/chise twitter.com/CHISE_ja

PostsRepliesMedia
tomo. (守岡 知彦) @tomo.chise.org · 12h
(行きも横浜線の駅のホームにめっちゃ雪が積もってて、停車の度に車内に雪が吹き込んできて端に座ってたので寒かった(服にちょっと雪が積もったり)。モノレールの階段で滑ったり(帰りは止まってた)。その時のイメージがあって、多摩は冬に雪が降ると思ってたんだけど、京都からこちらに越してきてからあまりの雪の降らなさというか乾燥っぷりに驚いた。京都の今出川より北は日本海側的気候なので冬はめっちゃジメジメしててカビとの戦いだった)
010
tomo. (守岡 知彦) @tomo.chise.org · 12h
(この時は本当に大変だった。中央線が止まり、運転再開したと思ったら途中で運転打ち切りになり、山手線も途中で止まり、よくわからない雪道をトボトボ歩いて地下鉄の駅を探し、駅には駅員がいなくてダメもとで自動改札機にJRの切符を入れたら開いたので、なんとか東京に辿り着き、なんとか動かない新幹線の車内に入って座ってたら運転再開になってなんとか京都まで帰れたのだった)
111
tomo. (守岡 知彦) @tomo.chise.org · 29/09/2026
(U+3D320 chise.nijl.ac.jp/est/view/cha... が U+21B54 www.chise.org/est/view/cha... にマップされているが、このコードポイントはやや曖昧なので、普通に「小」の方が良かった気が)
chise.nijl.ac.jp
EsT character = rep.shuowen-jiguge=03200
000
tomo. (守岡 知彦) @tomo.chise.org · 25/09/2026
例としては、むしろ chise.nijl.ac.jp/est/view/cha... の方が良かったかな?
chise.nijl.ac.jp
EsT character = 𽀋
000
tomo. (守岡 知彦) @tomo.chise.org · 25/09/2026
(GlyphWiki も今の所 Unicode 小篆領域に登録できないので自前でフォント作るしかって感じだけど、今の切り出し字形綺麗じゃないしちょっと欠けてる部分もあって、作字に GlyphWiki 使えないし面倒。ただ、いずれ GlyphWiki でサポートされたら -var-ddd や -itaiji-ddd が作れるので、小篆 IDS の記述で棚上げしてる部分を解決できそうではある)
000
tomo. (守岡 知彦) @tomo.chise.org · 25/09/2026
(少し前から、Unicode 18.0 で入った小篆を CHISE の説文小篆や篆隷万象名義の篆文掲出字に紐付ける作業を始めているが、フォントがないので UCS 化した結果、小篆の字形が表示されない問題 例: chise.nijl.ac.jp/est/view/cha... の ←Zhouwen@shuowen の値 が発生して悩み中)
chise.nijl.ac.jp
EsT character = 𽀎
210
tomo. (守岡 知彦) @tomo.chise.org · 10/09/2026
(今日は国語研で「言語と不変性・同変性」 yokoi-lab.net/posts/otsuka... というセミナーに参加したが大変面白かった。 ギブソンのアフォーダンスを思い出したが、終わったあと道田さんにお伺いしたところ、アフォーダンスは同変性だよねっていう議論があるとのこと)
yokoi-lab.net
2026年9月10日(木) 国語研数理セミナー #3:大塚淳さん、道田蒼人さん、福水健次さん「言語と不変性・同変性」
9月10日(木)に「言語と不変性・同変性」というセミナーを国立国語研究所 @立川にて開催します。ZEN大学の大塚さん、京都大学の道田さんより「言語の合成性と同変性」について、統計数理研究所の福水さんより「同変性を用いた表現学習」について、それぞれご講演いただきます。
010
tomo. (守岡 知彦) @tomo.chise.org · 01/09/2026
(UniDic 使う場合、MeCab より BERT ベースの github.com/KoichiYasuok... とか、言語モデルベースの手法の方が賢いような気もする)
github.com
GitHub - KoichiYasuoka/SuPar-UniDic: Tokenizer POS-tagger Lemmatizer and Dependency-parser for modern and contemporary Japanese with BERT models
Tokenizer POS-tagger Lemmatizer and Dependency-parser for modern and contemporary Japanese with BERT models - KoichiYasuoka/SuPar-UniDic
000
tomo. (守岡 知彦) @tomo.chise.org · 01/09/2026
(圏論ネタになるが、テキスト構造と意味論の自然変換とか複数の分析間の自然変換をどう取りながら記述するかみたいな理論化を踏まえないと大規模かつ多粒度な汎用構造化テキスト化は行い難いと思う。ぶっちゃけ、以前言ってた数理論理学(少なくとも完全性定理まで)必須論よりも無理ゲーな感じはあるが、対応関係の記述は人文学の基礎という気もするので、AI時代の基礎今日として人文学のための圏論が要るってことなのかも)
000
tomo. (守岡 知彦) @tomo.chise.org · 01/09/2026
(実のところ、TEI は、多分、大規模テキスト化には向かないと思う。ただ、結果の固定には有用かもと思う。また、語彙には価値があると思う)
100
tomo. (守岡 知彦) @tomo.chise.org · 01/09/2026
(ただし、現行の「ローマ字のつづり方」(令和7年12月22日内閣告示)では www.bunka.go.jp/kokugo_nihon... にあるように、¯ が基本で、^ も許容するように変わった)
bunka.go.jp
000
tomo. (守岡 知彦) @tomo.chise.org · 01/09/2026
(ローマ字の長音表記に ISO 8859-1 の呪いが今も微妙にかかってるのは面白いが考えてみれば現代日本でもシフト JIS の呪いは残ってるのでそれほど不思議ではないか。だけど、そもそも旧「ローマ字のつづり方」(昭和29年内閣告示第1号・同訓令第1号)では www.bunka.go.jp/kokugo_nihon... にあるように長音は ¯ (MACRON) ではなく ^(CIRCUMFLEX ACCENT) を付けて表すことになってたので、â のような ISO 8859-1 にあるやつの方が正しかったのだった)
bunka.go.jp
文化庁 | 国語施策・日本語教育 | 国語施策情報 | 内閣告示・内閣訓令 | ローマ字のつづり方 | そえがき
100
tomo. (守岡 知彦) @tomo.chise.org · 01/09/2026
(フィンランド語は印欧語じゃないので英語中心主義のシステムでは苦労するというのは考えたことなかったがそうなのか)
100
tomo. (守岡 知彦) @tomo.chise.org · 01/09/2026
(EAJRS オンライン参加してるんだがそろそろ眠くなってきた。 ただ、さっきの Koizumi, Kiyoka (Leiden University) Fuse, Rie (University of Helsinki) Navigating Multiscriptual Challenges: A Case Study of an In-Class Workshop for Ex Libris University Library Search in Japanese という発表、とても面白かった)
100
tomo. (守岡 知彦) @tomo.chise.org · 22/08/2026
(大屋霊城の話が出てこなくてちょっと残念)
000
tomo. (守岡 知彦) @tomo.chise.org · 13/08/2026
(LLM ってもしかして制約論理プログラミング向き?)
000
tomo. (守岡 知彦) @tomo.chise.org · 28/07/2026
( hdl.handle.net/2433/241049 が8年前ってことは、CHISE をはじめとする漢字関連データベースの IPFS 化に取り組み始めてからすでに10年近く経ってるってことか)
hdl.handle.net
京都大学学術情報リポジトリKURENAI
京都大学学術情報リポジトリKURENAIでは、京都大学で日々創造される研究・教育成果をWebで公開しています。世界的に卓越した知的成果を社会へ還元することを目的として、2006年から図書館機構が運営している事業です。
000
tomo. (守岡 知彦) @tomo.chise.org · 28/07/2026
(DASL 版 CHISE では S 式なしに CHISE の構造を完璧に扱える見通しが立った気がする。ローカルの IPFS daemon を必須にするかは悩みどころだが、これを認めればオンデマンドにデータをとってくることもできるし、ローカルに上書きすることもでき、30年ほど前に夢見たことがようやく実現できる気がする。UI のこと考えると頭痛いけど)
000
tomo. (守岡 知彦) @tomo.chise.org · 28/07/2026
(DASL 版 CHISE では素性をいくつかのグループに分けて格納するようにしたのだが、これを隠蔽するかどうかちょっと悩んだ。結局、隠蔽せずこれを (feature-)section を名付けて陽に扱うことにした。従来でも、関係素性とか構造素性とか素性のタイプ的なものがあった訳で、これを明確化し、今後は素性の素性(素性属性)としてきちんと管理する方向で行こう)
100
tomo. (守岡 知彦) @tomo.chise.org · 28/07/2026
(IDS 自動認識器での認識率向上を図るにはやっぱ IDS のデータ処理が要ると思って、 gitlab.nijl.ac.jp/CHISE/chise-... を Python から使うモジュールを作り始めたのだが、Python 用の IPFS ライブラリを色々探して結局どれもピンとこず、結局、httpx で Kubo RPC API か IPFS gateway 叩くので十分という結論に達した。また、Python でも JSON 使うと文字化けしやすいことが分かり、libipld を使って DAG-CBOR (DRISL) を直接読み書きするのが吉という結論に達した)
gitlab.nijl.ac.jp
CHISE / CHISE-DASL-CID-data · GitLab
GitLab Community Edition
000
tomo. (守岡 知彦) @tomo.chise.org · 03/07/2026
(Qwen3.6-27B-Uncensored-Heretic-v2-MLX-6bit と Qwen3.6-27B-Uncensored-Heretic-v2-MLX-8bit を比べると、量子化 6bit の方が成績が良い場合がある。微妙な差だが。でもって、Qwen3.6-27B-Uncensored-Heretic-v2-MLX-8bit と Qwen3.5-27B-heretic-8bit を比べると、こちらははっきりと Qwen3.5-27B-heretic-8bit の方が良い感じ)
010
tomo. (守岡 知彦) @tomo.chise.org · 29/06/2026
(IPFS 環境(正確には、IPLD 周り)が快適になったのは、AI バブルのおかげで、というよりも、青空のおかげか?(不正確な表現だが)やっぱ、DASL での標準化が始まったのが良かった? できれば、RFC 化まで進むと良いな)
000
tomo. (守岡 知彦) @tomo.chise.org · 29/06/2026
(それにしても、(AI バブルのおかげで?)Web3 が下火になったら、以前の予想通り、IPFS が実用的なツールになって、自作の local VLM スクリプトではプロンプト管理用にもれなく IPFS を組み込んでたりする。Kubo も単独で upgrade できるようになったし、着々と便利になってる)
100
tomo. (守岡 知彦) @tomo.chise.org · 29/06/2026
(まあ、でも、考えようによっては、今時 AI エージェント向けの API があればそれで良いのかも知れない。でもって、これも今の IPFS ならサーバーもそんなに真面目に考えなくても良いような気も(流石に、今の手元の MacBook Pro がマスターってのはまずい気はするが))
110
tomo. (守岡 知彦) @tomo.chise.org · 29/06/2026
(あと、やっぱそろそろ Python-CHISE がないと辛くなってきた。CL-CHISE/IPLD もエンジンはほぼ完成したので、そろそろ真面目に引っ越しを考えたいところだが、UI がないのが辛いところ)
000
tomo. (守岡 知彦) @tomo.chise.org · 29/06/2026
(このところ、ずっと Qwen3.5-27B-heretic-8bit を使っていたが、メモリ 36GB な MacBook Pro で動かすために Qwen3.6-27B-Uncensored-Heretic-v2-MLX-6bit を試したところ、classical Hanzi の時に F 値 0.969 を出して、念の為、他のプロンプトの場合も調べてる。なんとなく Qwen3.6 は漢籍 OCR 系では Qwen 3.5 よりも良くないと思い込んでたので、意外な結果。全体的に調べ直した方が良いかも)
110
tomo. (守岡 知彦) @tomo.chise.org · 29/06/2026
(IDS 自動認識器用のプロンプトを、うまくいかない例を見ながら試行錯誤してたが、こういう時は計測ということで、認識率や適合率、再現率、F値等を計算するプログラムを書いてHNGの開成石経論語の結果を見てみたところ、どれも F 値 0.96 ぐらいで、まずまずか。英語での漢字の表現としては、Kanji が 0.967, Chinese character が 0.966, Hanzi が 0.962 で意外に Kanji が良かった。classical を付けるとそれぞれ 0.964, 0.963, 0.962 と悪化した(簡体字が減るので良いかと思ったが、やはりプロンプトは短い方が吉か))
100
tomo. (守岡 知彦) @tomo.chise.org · 26/06/2026
(IDS 自動認識器 gitlab.nijl.ac.jp/CHISE/ids-re... で大廣益會玉篇(宮内庁書陵部図書寮文庫本)の掲出字と開成石経論語のHNG代表字形とHNGの整理に使ったという大字典の掲出字を処理してるが、思ったよりも読むなあというのと、なんでそれ読めへんのというのが混じる。やはり、1文字だけ読むというのは言語的文脈が使えないのでLLMには厳しいゲームで、ノイズに弱くなる。また、位置関係はそこそこ理解してるのに、正確な座標が出せないので、後処理で頑張るのもむずい。本気でやるなら、(文字じゃなくて)部品のモデルをちゃんと作った方が良いのかも)
gitlab.nijl.ac.jp
CHISE / IDS recognizer · GitLab
GitLab Community Edition
000
tomo. (守岡 知彦) @tomo.chise.org · 25/06/2026
x.com/dankogai/sta... UTF-8 ネイティブな XEmacs CHISE (XEmacs UTF-2000) を作ったのは1999年だった。
x.com
Dan Kogai (小飼 弾) (@dankogai) on X
Java(Script)?が1995年、UTF-8の当初バージョン(2**31コードポイント)がRFCになったのが1998年。Unicodeは17*2**16と決まってUTF-8も4バイトまでとなったのが2003年。実質初のUTF-8ネイティブ言語Perl 5.8が2001年…
001
tomo. (守岡 知彦) @tomo.chise.org · 24/06/2026
(Qwen3.5 の出力に Ext G の文字が入ってのを見つけてちょっとびっくり)
000
tomo. (守岡 知彦) @tomo.chise.org · 23/06/2026
画質悪いと精度はそれなりという感じではあるけど、HDIC のマッピングと CHISE IDS から機械的に作った IDS のミスをいくつか拾えたので、道具としてはそれなりに有用かもしれない。
000
tomo. (守岡 知彦) @tomo.chise.org · 23/06/2026
Qwen3.5-27B-heretic-8bit を使って大廣益會玉篇(宮内庁書陵部図書寮文庫本)の掲出字を読んだ結果の失敗例をチェックしてる途中だけど、部品の外形部を読んで内部を読み損なってる例が結構あり、ある意味人間っぽい読み方をしてるのかなと思ったり。つまり、普通の OCR 処理では、視覚モーダルからは輪郭中心によく知ってる部品を認識して、言語的文脈で絞り込んでる?
100
tomo. (守岡 知彦) @tomo.chise.org · 22/06/2026
視覚言語モデルを使って漢字字形画像から IDS を自動生成するプログラムを作ってみました: gitlab.nijl.ac.jp/CHISE/ids-re... github.com/chise/ids-re... I made a program to generate IDS from Hanzi glyph-images automatically using VLM.
gitlab.nijl.ac.jp
CHISE / IDS recognizer · GitLab
GitLab Community Edition
002
tomo. (守岡 知彦) @tomo.chise.org · 22/06/2026
(Python-CHISE が欲しくなってきた。今作るとすれば、CHISE-DASL 版だと思うが、Kubo の ipfs daemon 必須でも良いかな?)
000
tomo. (守岡 知彦) @tomo.chise.org · 13/06/2026
(CL-Concord からの JSON 依存コードの除去作業がようやく完了した。全て CL-DASL を通して S 式から直接 DRISL (dCBOR42) に変換するようになり、BMP 外文字の文字化けがなくなった。今は CBOR を Kubo に投げて IPFS ネットワーク送出してるが、CID の計算だけなら Common Lisp だけでできるのだが、今後、car 化するコードを作るか、libp2p のバインディングを作るか、それとも libp2p 自体を実装するか?)
000
tomo. (守岡 知彦) @tomo.chise.org · 07/06/2026
無事復旧したようです。
000
tomo. (守岡 知彦) @tomo.chise.org · 04/06/2026
電気設備の点検に伴う計画停電のため、2026年6月7日8:00(JST)頃から国文学研究資料館で運用中のサーバー群 (*.nijl.ac.jp) が停止します。同日16〜17時頃には再開する見通しです。
110
tomo. (守岡 知彦) @tomo.chise.org · 30/05/2026
現状、問題はないです(外部 DB 上で Emacs Lisp と同じ意味論になるように辻褄合わせて、Common Lisp 上では case table を invert にしたシンボルか文字列で扱うことにしてます)。
020
tomo. (守岡 知彦) @tomo.chise.org · 30/05/2026
(CL-JSON は何も考えずに BMP 外の文字を突っ込むと 16bit の code unit にぶったぎられるので辛い(あと、超重い)。それで、現在、CL-Concord では CL-JSON 依存部分の除去作業をやってて、ようやく文字化け問題は解決した気がするが、完全 DRISL (dCBOR42) 化まではもう一息)
000
tomo. (守岡 知彦) @tomo.chise.org · 30/05/2026
確かにそれが正解だと思います。 私の場合、 gitlab.chise.org/CHISE/cl-chi... みたいな Emacs Lisp の S 式で作ったデータ(プログラム)を読み込む必要があって、今は安直に関数を定義して load してるんですが、将来的には形式を変えるのが良いかなと思っております。
gitlab.chise.org
data/char-defs · main · CHISE / CL-CHISE · GitLab
CHISE implementation based on Common Lisp
110
tomo. (守岡 知彦) @tomo.chise.org · 30/05/2026
(Common Lisp でシンボルの大文字と小文字を区別しつつ、既存のプログラムを小文字で呼び出すのって何気に面倒で、未だに正解がわからん)
000
tomo. (守岡 知彦) @tomo.chise.org · 15/05/2026
新幹線車内からオンライン研究班に参加しようとしたが N700S じゃないのでちょっと厳しかった。 ところで、Universal Dependencies 2.18 がリリースされた lindat.mff.cuni.cz/repository/i... が、イランのグループがやってた西イラン語群3言語がリタイヤになったとのことで残念。 cf. qiita.com/KoichiYasuok...
qiita.com
Universal Dependencies 2.18リリース - Qiita
Universal Dependencies 2.18がリリースされた、との連絡をいただいた。半年前のUniversal Dependencies 2.17と較べて、Assamese、Brahui、Gorontalo、Kadiwéu、Middle Armenian、Nepa...
000
tomo. (守岡 知彦) @tomo.chise.org · 24/04/2026
( gitlab.nijl.ac.jp/Kotenseki/it... Qwen3.6-27B-8bit を試してみたが、和漢古典籍用 OCR 用としては Qwen3.5-27B-heretic-8bit に比べて遅くて制御しづらい感じだったので、当面、量産用は Qwen3.5-27B-heretic-8bit に戻すことに。もう少し試行錯誤が必要か)
gitlab.nijl.ac.jp
nk3-segment_Qwen3.6-27B-8bit · main · Kotenseki / item / 100348356 松氏文草後編 · GitLab
GitLab Community Edition
000
tomo. (守岡 知彦) @tomo.chise.org · 23/04/2026
九大図書館 雅俗文庫に Qwen3.5-27B-heretic-8bit で OCR をかけたデータのハルシネーション箇所をチェックしてたら、国書BID:100348354 寿會詩文 gitlab.nijl.ac.jp/Gazoku/10034... の書き込み部分が何気に面白いことに気づく。 kokusho.nijl.ac.jp/api/iiif/100... これって漢字練習帳?
000
tomo. (守岡 知彦) @tomo.chise.org · 08/04/2026
(CL-CHISE では :with-ipld-cid モードで文字オントロジーを構築することができ、この場合、オブジェクト ID が DASL-CID になる。CID は(pin しておけば)永続化され、 CID を参照すれば包摂ポリシーの記述が得られる)
000
tomo. (守岡 知彦) @tomo.chise.org · 08/04/2026
(従来、CHISE では内部的に文字オブジェクト ID を連番で振っていたため、XEmacs CHISE をリビルドする度にオブジェクト ID が変化するという問題があった。CHISE は内部表現を隠蔽して ID 素性で参照するというお約束なのでこれでも良いはずなんだけど、何と何(と何...)を同一視しているかという包摂ポリシーの同値性が文字定義を見ないとわからないという問題と、IDSや重文(文字列)やその他 ID 素性を直接持たないオブジェクトの ID が永続化されないという問題があった)
100
tomo. (守岡 知彦) @tomo.chise.org · 08/04/2026
(CL-Concord gitlab.nijl.ac.jp/CHISE/cl-con... の CL-DASL (gitlab.nijl.ac.jp/CHISE/cl-dasl) 化(脱 JSON 化)を細々と進めているが、書き換え箇所(検証すべき箇所)が結構あって何気に面倒臭い)
gitlab.nijl.ac.jp
CHISE / CL-Concord · GitLab
GitLab Community Edition
000
tomo. (守岡 知彦) @tomo.chise.org · 05/04/2026
これに伴い、今年度から、総合研究大学院大学の教員になり、超久々にリレー講義を担当する他、後期に「文学情報論1」という授業科目を開く可能性があります。これは和漢古典籍を対象とした人文情報学研究のための理論とスキルを身につけてもらおうというもので、もし万が一3人以上の受講者がいれば開講されるとのことですが多分開講されないはず。
020
tomo. (守岡 知彦) @tomo.chise.org · 05/04/2026
今年度から准教授として大学共同利用機関法人 人間文化研究機構 国文学研究資料館に着任しました。といっても、昨年度まで特任准教授だったので研究室もそのままで、全くフレッシュではないのですが。
120
tomo. (守岡 知彦) @tomo.chise.org · 05/04/2026
(今は CL-DASL で DRISL 形式 dasl.ing/drisl.html にした後、その CBOR バイナリーを Kubo に RPC API で渡すようにしてるが、将来的には自前のストレージに入れて、ゲートウェイとなる IPFS ノードにデータを送り込むための最低限のネットワーク機能を付けれた方が良い気がする。ネットワーク機能が要らなければ既に自前で DASL CID を計算する関数は実装してるので、CAR 形式でダンプして渡すのでも良いがこれも面倒か)
dasl.ing
DASL: DRISL — Deterministic Representation for Interoperable Structures & Links
DRISL is a serialization format that is deterministic (so that the same data will have the same CID) and that features native support for using CIDs as links. It is based on CB...
000