AnthropicがClaudeの思考過程を覗き見た研究の解説記事です。
一層の内部表現の観察(AIのブラックボックスを開くことはできるか⑥:文学者は金門橋を渡ることができるか㉔)|浅間香織 @KaoriAsama note.com/kaori_asama/...
note.com
一層の内部表現の観察(AIのブラックボックスを開くことはできるか⑥:文学者は金門橋を渡ることができるか㉔)|浅間香織
前回
2023年にBrickenらが発表した研究論文は「単義性に向けて:辞書学習による言語モデルの分解。スパースオートエンコーダを用いて、1層トランスフォーマーから多数の解釈可能な特徴を抽出する」である。これは前章で述べた「玩具モデル」論文が提示した第二の方向性、過完備基底の事後抽出を用いて行う内部表現の把握を、スパース・オートエンコーダ(SAE)によって実装し、その有効性を実証した研究であ...