データセットの中に納められた情報がどのように管理されているか分からないけど、一字一句完全な状態で元の本が出せるようにはなってないはず。
出来るならハルシネーションももっと起こりづらいはずだし、復元を可能にするにはもっと膨大な量のタグ付けが必要になる気がする。
それに、開示請求で著作物侵害の証拠が容易に出せるのを防ぎそうなのであえてやってなさそう。
それは推進派が言うような「AIに保存することでいらなくなった本も有効活用できる」とはならない。
なんせぐちゃぐちゃにミキサーされて元の意図とは違うものとしてしか出力されないのだから、自炊してアーカイブ化するのとはまったく違う話。