Sign in

tomo. (守岡 知彦)

@tomo.chise.org
39 followers 61 following 430 posts

CHISE project www.chise.org の中の人。 gitlab.chise.org/tomo github.com/chise twitter.com/CHISE_ja

PostsRepliesMedia
tomo. (守岡 知彦) @tomo.chise.org · 7h
(この時は本当に大変だった。中央線が止まり、運転再開したと思ったら途中で運転打ち切りになり、山手線も途中で止まり、よくわからない雪道をトボトボ歩いて地下鉄の駅を探し、駅には駅員がいなくてダメもとで自動改札機にJRの切符を入れたら開いたので、なんとか東京に辿り着き、なんとか動かない新幹線の車内に入って座ってたら運転再開になってなんとか京都まで帰れたのだった)
100
tomo. (守岡 知彦) @tomo.chise.org · 29/09/2026
(U+3D320 chise.nijl.ac.jp/est/view/cha... が U+21B54 www.chise.org/est/view/cha... にマップされているが、このコードポイントはやや曖昧なので、普通に「小」の方が良かった気が)
chise.nijl.ac.jp
EsT character = rep.shuowen-jiguge=03200
000
tomo. (守岡 知彦) @tomo.chise.org · 25/09/2026
(少し前から、Unicode 18.0 で入った小篆を CHISE の説文小篆や篆隷万象名義の篆文掲出字に紐付ける作業を始めているが、フォントがないので UCS 化した結果、小篆の字形が表示されない問題 例: chise.nijl.ac.jp/est/view/cha... の ←Zhouwen@shuowen の値 が発生して悩み中)
chise.nijl.ac.jp
EsT character = 𽀎
210
tomo. (守岡 知彦) @tomo.chise.org · 10/09/2026
(今日は国語研で「言語と不変性・同変性」 yokoi-lab.net/posts/otsuka... というセミナーに参加したが大変面白かった。 ギブソンのアフォーダンスを思い出したが、終わったあと道田さんにお伺いしたところ、アフォーダンスは同変性だよねっていう議論があるとのこと)
yokoi-lab.net
2026年9月10日(木) 国語研数理セミナー #3:大塚淳さん、道田蒼人さん、福水健次さん「言語と不変性・同変性」
9月10日(木)に「言語と不変性・同変性」というセミナーを国立国語研究所 @立川にて開催します。ZEN大学の大塚さん、京都大学の道田さんより「言語の合成性と同変性」について、統計数理研究所の福水さんより「同変性を用いた表現学習」について、それぞれご講演いただきます。
010
tomo. (守岡 知彦) @tomo.chise.org · 01/09/2026
(UniDic 使う場合、MeCab より BERT ベースの github.com/KoichiYasuok... とか、言語モデルベースの手法の方が賢いような気もする)
github.com
GitHub - KoichiYasuoka/SuPar-UniDic: Tokenizer POS-tagger Lemmatizer and Dependency-parser for modern and contemporary Japanese with BERT models
Tokenizer POS-tagger Lemmatizer and Dependency-parser for modern and contemporary Japanese with BERT models - KoichiYasuoka/SuPar-UniDic
000
tomo. (守岡 知彦) @tomo.chise.org · 01/09/2026
(実のところ、TEI は、多分、大規模テキスト化には向かないと思う。ただ、結果の固定には有用かもと思う。また、語彙には価値があると思う)
100
tomo. (守岡 知彦) @tomo.chise.org · 01/09/2026
(EAJRS オンライン参加してるんだがそろそろ眠くなってきた。 ただ、さっきの Koizumi, Kiyoka (Leiden University) Fuse, Rie (University of Helsinki) Navigating Multiscriptual Challenges: A Case Study of an In-Class Workshop for Ex Libris University Library Search in Japanese という発表、とても面白かった)
100
tomo. (守岡 知彦) @tomo.chise.org · 22/08/2026
(大屋霊城の話が出てこなくてちょっと残念)
000
tomo. (守岡 知彦) @tomo.chise.org · 13/08/2026
(LLM ってもしかして制約論理プログラミング向き?)
000
tomo. (守岡 知彦) @tomo.chise.org · 28/07/2026
( hdl.handle.net/2433/241049 が8年前ってことは、CHISE をはじめとする漢字関連データベースの IPFS 化に取り組み始めてからすでに10年近く経ってるってことか)
hdl.handle.net
京都大学学術情報リポジトリKURENAI
京都大学学術情報リポジトリKURENAIでは、京都大学で日々創造される研究・教育成果をWebで公開しています。世界的に卓越した知的成果を社会へ還元することを目的として、2006年から図書館機構が運営している事業です。
000
tomo. (守岡 知彦) @tomo.chise.org · 28/07/2026
(DASL 版 CHISE では素性をいくつかのグループに分けて格納するようにしたのだが、これを隠蔽するかどうかちょっと悩んだ。結局、隠蔽せずこれを (feature-)section を名付けて陽に扱うことにした。従来でも、関係素性とか構造素性とか素性のタイプ的なものがあった訳で、これを明確化し、今後は素性の素性(素性属性)としてきちんと管理する方向で行こう)
100
tomo. (守岡 知彦) @tomo.chise.org · 28/07/2026
(IDS 自動認識器での認識率向上を図るにはやっぱ IDS のデータ処理が要ると思って、 gitlab.nijl.ac.jp/CHISE/chise-... を Python から使うモジュールを作り始めたのだが、Python 用の IPFS ライブラリを色々探して結局どれもピンとこず、結局、httpx で Kubo RPC API か IPFS gateway 叩くので十分という結論に達した。また、Python でも JSON 使うと文字化けしやすいことが分かり、libipld を使って DAG-CBOR (DRISL) を直接読み書きするのが吉という結論に達した)
gitlab.nijl.ac.jp
CHISE / CHISE-DASL-CID-data · GitLab
GitLab Community Edition
000
tomo. (守岡 知彦) @tomo.chise.org · 29/06/2026
(まあ、でも、考えようによっては、今時 AI エージェント向けの API があればそれで良いのかも知れない。でもって、これも今の IPFS ならサーバーもそんなに真面目に考えなくても良いような気も(流石に、今の手元の MacBook Pro がマスターってのはまずい気はするが))
110
tomo. (守岡 知彦) @tomo.chise.org · 29/06/2026
(あと、やっぱそろそろ Python-CHISE がないと辛くなってきた。CL-CHISE/IPLD もエンジンはほぼ完成したので、そろそろ真面目に引っ越しを考えたいところだが、UI がないのが辛いところ)
000
tomo. (守岡 知彦) @tomo.chise.org · 29/06/2026
(IDS 自動認識器用のプロンプトを、うまくいかない例を見ながら試行錯誤してたが、こういう時は計測ということで、認識率や適合率、再現率、F値等を計算するプログラムを書いてHNGの開成石経論語の結果を見てみたところ、どれも F 値 0.96 ぐらいで、まずまずか。英語での漢字の表現としては、Kanji が 0.967, Chinese character が 0.966, Hanzi が 0.962 で意外に Kanji が良かった。classical を付けるとそれぞれ 0.964, 0.963, 0.962 と悪化した(簡体字が減るので良いかと思ったが、やはりプロンプトは短い方が吉か))
100
tomo. (守岡 知彦) @tomo.chise.org · 26/06/2026
(IDS 自動認識器 gitlab.nijl.ac.jp/CHISE/ids-re... で大廣益會玉篇(宮内庁書陵部図書寮文庫本)の掲出字と開成石経論語のHNG代表字形とHNGの整理に使ったという大字典の掲出字を処理してるが、思ったよりも読むなあというのと、なんでそれ読めへんのというのが混じる。やはり、1文字だけ読むというのは言語的文脈が使えないのでLLMには厳しいゲームで、ノイズに弱くなる。また、位置関係はそこそこ理解してるのに、正確な座標が出せないので、後処理で頑張るのもむずい。本気でやるなら、(文字じゃなくて)部品のモデルをちゃんと作った方が良いのかも)
gitlab.nijl.ac.jp
CHISE / IDS recognizer · GitLab
GitLab Community Edition
000
tomo. (守岡 知彦) @tomo.chise.org · 25/06/2026
x.com/dankogai/sta... UTF-8 ネイティブな XEmacs CHISE (XEmacs UTF-2000) を作ったのは1999年だった。
x.com
Dan Kogai (小飼 弾) (@dankogai) on X
Java(Script)?が1995年、UTF-8の当初バージョン(2**31コードポイント)がRFCになったのが1998年。Unicodeは17*2**16と決まってUTF-8も4バイトまでとなったのが2003年。実質初のUTF-8ネイティブ言語Perl 5.8が2001年…
001
tomo. (守岡 知彦) @tomo.chise.org · 24/06/2026
(Qwen3.5 の出力に Ext G の文字が入ってのを見つけてちょっとびっくり)
000
tomo. (守岡 知彦) @tomo.chise.org · 23/06/2026
Qwen3.5-27B-heretic-8bit を使って大廣益會玉篇(宮内庁書陵部図書寮文庫本)の掲出字を読んだ結果の失敗例をチェックしてる途中だけど、部品の外形部を読んで内部を読み損なってる例が結構あり、ある意味人間っぽい読み方をしてるのかなと思ったり。つまり、普通の OCR 処理では、視覚モーダルからは輪郭中心によく知ってる部品を認識して、言語的文脈で絞り込んでる?
100
tomo. (守岡 知彦) @tomo.chise.org · 22/06/2026
視覚言語モデルを使って漢字字形画像から IDS を自動生成するプログラムを作ってみました: gitlab.nijl.ac.jp/CHISE/ids-re... github.com/chise/ids-re... I made a program to generate IDS from Hanzi glyph-images automatically using VLM.
gitlab.nijl.ac.jp
CHISE / IDS recognizer · GitLab
GitLab Community Edition
002
tomo. (守岡 知彦) @tomo.chise.org · 22/06/2026
(Python-CHISE が欲しくなってきた。今作るとすれば、CHISE-DASL 版だと思うが、Kubo の ipfs daemon 必須でも良いかな?)
000
tomo. (守岡 知彦) @tomo.chise.org · 13/06/2026
(CL-Concord からの JSON 依存コードの除去作業がようやく完了した。全て CL-DASL を通して S 式から直接 DRISL (dCBOR42) に変換するようになり、BMP 外文字の文字化けがなくなった。今は CBOR を Kubo に投げて IPFS ネットワーク送出してるが、CID の計算だけなら Common Lisp だけでできるのだが、今後、car 化するコードを作るか、libp2p のバインディングを作るか、それとも libp2p 自体を実装するか?)
000
tomo. (守岡 知彦) @tomo.chise.org · 04/06/2026
電気設備の点検に伴う計画停電のため、2026年6月7日8:00(JST)頃から国文学研究資料館で運用中のサーバー群 (*.nijl.ac.jp) が停止します。同日16〜17時頃には再開する見通しです。
110
tomo. (守岡 知彦) @tomo.chise.org · 30/05/2026
(CL-JSON は何も考えずに BMP 外の文字を突っ込むと 16bit の code unit にぶったぎられるので辛い(あと、超重い)。それで、現在、CL-Concord では CL-JSON 依存部分の除去作業をやってて、ようやく文字化け問題は解決した気がするが、完全 DRISL (dCBOR42) 化まではもう一息)
000
tomo. (守岡 知彦) @tomo.chise.org · 30/05/2026
(Common Lisp でシンボルの大文字と小文字を区別しつつ、既存のプログラムを小文字で呼び出すのって何気に面倒で、未だに正解がわからん)
000
tomo. (守岡 知彦) @tomo.chise.org · 15/05/2026
新幹線車内からオンライン研究班に参加しようとしたが N700S じゃないのでちょっと厳しかった。 ところで、Universal Dependencies 2.18 がリリースされた lindat.mff.cuni.cz/repository/i... が、イランのグループがやってた西イラン語群3言語がリタイヤになったとのことで残念。 cf. qiita.com/KoichiYasuok...
qiita.com
Universal Dependencies 2.18リリース - Qiita
Universal Dependencies 2.18がリリースされた、との連絡をいただいた。半年前のUniversal Dependencies 2.17と較べて、Assamese、Brahui、Gorontalo、Kadiwéu、Middle Armenian、Nepa...
000
tomo. (守岡 知彦) @tomo.chise.org · 24/04/2026
( gitlab.nijl.ac.jp/Kotenseki/it... Qwen3.6-27B-8bit を試してみたが、和漢古典籍用 OCR 用としては Qwen3.5-27B-heretic-8bit に比べて遅くて制御しづらい感じだったので、当面、量産用は Qwen3.5-27B-heretic-8bit に戻すことに。もう少し試行錯誤が必要か)
gitlab.nijl.ac.jp
nk3-segment_Qwen3.6-27B-8bit · main · Kotenseki / item / 100348356 松氏文草後編 · GitLab
GitLab Community Edition
000
tomo. (守岡 知彦) @tomo.chise.org · 23/04/2026
九大図書館 雅俗文庫に Qwen3.5-27B-heretic-8bit で OCR をかけたデータのハルシネーション箇所をチェックしてたら、国書BID:100348354 寿會詩文 gitlab.nijl.ac.jp/Gazoku/10034... の書き込み部分が何気に面白いことに気づく。 kokusho.nijl.ac.jp/api/iiif/100... これって漢字練習帳?
000
tomo. (守岡 知彦) @tomo.chise.org · 08/04/2026
(従来、CHISE では内部的に文字オブジェクト ID を連番で振っていたため、XEmacs CHISE をリビルドする度にオブジェクト ID が変化するという問題があった。CHISE は内部表現を隠蔽して ID 素性で参照するというお約束なのでこれでも良いはずなんだけど、何と何(と何...)を同一視しているかという包摂ポリシーの同値性が文字定義を見ないとわからないという問題と、IDSや重文(文字列)やその他 ID 素性を直接持たないオブジェクトの ID が永続化されないという問題があった)
100
tomo. (守岡 知彦) @tomo.chise.org · 08/04/2026
(CL-Concord gitlab.nijl.ac.jp/CHISE/cl-con... の CL-DASL (gitlab.nijl.ac.jp/CHISE/cl-dasl) 化(脱 JSON 化)を細々と進めているが、書き換え箇所(検証すべき箇所)が結構あって何気に面倒臭い)
gitlab.nijl.ac.jp
CHISE / CL-Concord · GitLab
GitLab Community Edition
000
tomo. (守岡 知彦) @tomo.chise.org · 05/04/2026
今年度から准教授として大学共同利用機関法人 人間文化研究機構 国文学研究資料館に着任しました。といっても、昨年度まで特任准教授だったので研究室もそのままで、全くフレッシュではないのですが。
120
tomo. (守岡 知彦) @tomo.chise.org · 05/04/2026
(cbor.lisp を改造して作った CL-DASL のテスト&デバッグをしながら CL-Concord の脱 JSON 化を進めているのだが、結果的にボトルネックが Valkey に移ってきた感じ。やっぱ XEmacs CHISE 内臓のインメモリーデータベースより遅いので、同様に Common Lisp 内部のインメモリーデータベースを持つべきか?)
100
tomo. (守岡 知彦) @tomo.chise.org · 02/04/2026
AT Protocol に基づく Git コラボレーションプラットフォームである Tangled に CHISE 漢字情報データベース (CHISE-IDS) の Git リポジトリを作ってみました: tangled.org/tomo.chise.o...
000
tomo. (守岡 知彦) @tomo.chise.org · 28/03/2026
(https://x.com/yhkondo/status/2037170780765597952 フィクション論的な問題を扱ってるような気がする。つまり、命題ではなく様相演算子付きの命題。虚構的指示の問題を古典論理における真偽で語るべからず)
110
tomo. (守岡 知彦) @tomo.chise.org · 27/03/2026
(久々に IPFS をいじったところ、手元で突っ込んだデータがすぐに ipfs.io のゲートウェイでも見れてちょっとびっくりするなど。まあ、そうじゃないと実用性はないんだけど、ようやく実用的になってきたっぽい)
ipfs.io
About the IPFS.io Public Gateway
IPFS.io Public Gateway - Free public service to access IPFS content through your web browser. Bridge between HTTP and decentralized IPFS protocol without installing software.
000
tomo. (守岡 知彦) @tomo.chise.org · 27/03/2026
DASL CID 版の CHISE 文字オントロジーのデータセットを gitlab.nijl.ac.jp/CHISE/chise-... に置いてみました。
gitlab.nijl.ac.jp
CHISE / CHISE-DASL-CID-data · GitLab
GitLab Community Edition
110
tomo. (守岡 知彦) @tomo.chise.org · 13/03/2026
(その昔、認知科学/AI方面において、計算主義 vs. 環境主義という論争があった。前者は物理記号仮説というものを前提に知能というものを外界から入った情報を内部表現化しそれを計算して出力するものと捉えるのに対し、後者は知能の一部(あるいは大半)は環境とのインタラクションに依存したものと捉える。昔の記号推論系AIやニューラルネットは前者、ロボット掃除機などは後者で、生成AIは大量の計算を要することから見ても前者の例だと考えられる)
100
tomo. (守岡 知彦) @tomo.chise.org · 13/03/2026
(AI 驚き屋的な言い方になってしまうけど、2025年は視覚言語モデルの実用化で少なくとも漢字屋にとって一つの分水嶺を超えたというか、少なくとも識別というタスクにおいて古典的OCRやマルチモーダルでないLLMの延長線上に未来はなさそうということが見えた年だったと思う。漢籍を学んだ最近の VLM はハルシネーションを起こさなければ人間よりも上手く異体字の使い分けをするので、人間の見落としを拾えるケースが増えてきてる)
110
tomo. (守岡 知彦) @tomo.chise.org · 12/03/2026
(Qwen3.5-27B-heretic-8bit はハルシネーションぐるぐるがなくなって Qwen3.5-27B-4bit と比べても Qwen3-VL 32B と比べてもすごく速くなったが、それ故にか難しいところはあっさり諦めるような傾向もあるようで Qwen3-VL 32B と併用しないとダメな感じだが、素の Qwen3.5-27B-8bit だと改善したりするだろうか?)
000
tomo. (守岡 知彦) @tomo.chise.org · 12/03/2026
(mlx-community/Qwen3.5-27B-heretic-8bit を試してみたところ、Qwen3.5-27B-4bit より OCR の精度が高く座標ハルシネーションも少なめで速度もすごく速くて良かった。量子化の差が効いてるのかそれとも heretic 版が良いのか。思うに、Qwen3.5 はデフォで Thinking するのを切ったつもりで切れてなかったのが heretic 版ではデフォで Thinking 切ってあるおかげかも)
100
tomo. (守岡 知彦) @tomo.chise.org · 11/03/2026
(詩經を読んでて、父方の祖母の名前の出典が采蘋であることに気づく。ひいおじいちゃんは国漢の先生だったからか)
000
tomo. (守岡 知彦) @tomo.chise.org · 01/03/2026
(墨俣一夜城のあたり gitlab.nijl.ac.jp/Kokusho/2000... kokusho.nijl.ac.jp/api/iiif/200... )
000
tomo. (守岡 知彦) @tomo.chise.org · 25/02/2026
(mlx-community/Qwen3.5-27B-4bit が出たので MacBook Pro (2023) メモリー 36GB で試したら動いた。ただ漢籍用 OCR としてはなかなか癖強で、推論モード切ってるはずなのに謎の推論過程を出してきてなかなか JSON で座標位置と文字列を吐いてくれない。試行錯誤の末、呂覽の本文行を JSON で出すことに成功した。試しに1枚やった結果を見たら Qwen3-VL-32B と比べて結果が良かった。まあ、Qwen3-VL-32B-8bit 相当がメモリー 36GB 環境で動くのは良い)
000
tomo. (守岡 知彦) @tomo.chise.org · 24/02/2026
(それはさておき、これで gitlab.nijl.ac.jp/Kotenseki/it... にも国書 WID:4440598 kokusho.nijl.ac.jp/work/4440598 が記載できるようになった)
gitlab.nijl.ac.jp
Kotenseki / item / Zinbun-Toho-A024 淮南書局4次様本説文解字 · GitLab
GitLab Community Edition
000
tomo. (守岡 知彦) @tomo.chise.org · 24/02/2026
( doi.org/10.20730/300... と kokusho.nijl.ac.jp/biblio/10031... の著作IDがともに「段/玉裁註」の「説文解字」(WID 4420014) という謎なものになってたので担当者に連絡したところ、「徐/鉉 訂」の「説文解字」 kokusho.nijl.ac.jp/work/4440598 (大徐本相当)が新設され、 kokusho.nijl.ac.jp/work/4420014 の統一書名も「説文解字注」に変わった。他にも漢籍関係微妙な箇所がいくつかあるような気がするので気づいたら連絡すべきか?(みなかったことにしがちだが))
kokusho.nijl.ac.jp
国書データベース:国文学研究資料館
000
tomo. (守岡 知彦) @tomo.chise.org · 24/02/2026
(改正音訓 詩經用に NDL古典籍OCRv3 と Qwen3-VL 32B を使ったハイブリッド OCR スクリプトを作ったので、改正音訓の残りの4つにも試そうと思ったら版面構造が違ってて使えなさそう。残念)
000
tomo. (守岡 知彦) @tomo.chise.org · 24/02/2026
(はじめてシラバスというものを書いてるが、多分、受講者集まらなくて開講されないと思うので、俺が考えた最強の人文情報学入門みたいなのを適当に書けば良いはず)
000
tomo. (守岡 知彦) @tomo.chise.org · 24/02/2026
(Qwen-3.5 試したいと思いつつ手持ちの機械では動かないので Qwen3-VL 32B を3台のマシンで動かす今日この頃)
100
tomo. (守岡 知彦) @tomo.chise.org · 31/01/2026
現在、www.chise.org のサーバーが立ち上がらない状態になっています。CHISE IDS 漢字検索は chise.nijl.ac.jp/ids-find も利用できますのでお急ぎの方はこちらをどうぞ。
chise.nijl.ac.jp
CHISE IDS Find
010
Reposted by tomo. (守岡 知彦)
FUKUSIMA,Yukihiro @archivistkyoto.bsky.social · 10/01/2026
デジタルアーカイブ学会学会賞授与式が昨日開催されました。 今回は以下の17件に授与されました。みなさま、本当におめでとうございます! awards.digitalarchivejapan.org/awards/7thaw...
012