schmalenstroer.net
Mit dem LLM zum WriterDeck aus Papier
In den letzten beiden Blogbeiträgen habe ich über meinen Versuch geschrieben, ein möglichst portables Schreibsetup zu erlangen und über KI-Modelle, die mittlerweile brauchbare Ergebnisse in der Transkription historischer Handschriften liefern.
Was eine passende Gelegenheit, das beides zusammenzubringen! Gibt es ein portableres Schreibsetup als einen kleinen Notizblock und einen Stift? Wohl kaum. Wenn ein KI-Modell historische Handschriften entschlüsseln kann, wie sieht es dann mit meiner modernen Sauklaue aus? Wenn das klappt, könnte ich einfach einen Stift und ein kleines Notizbuch auf meine Radtouren mitnehmen, den Text im Anschluss einscannen und transkribieren lassen.
Lasst uns daher zusammen auf eine Erkundungstour zwischen moderner Technik und Jahrtausende alter Kulturtechnik gehen!
Ich habe zum Testen ein Blatt Papier mit verschiedenen Sätzen und Wörtern besudelt. Ich habe verschiedene Stifte benutzt, einen Lamy Safari, einen Pilot G2-Tintenroller, einen Bleistift und einen Kugelschreiber. Ich habe größtenteils meine normale Handschrift benutzt, aber auch einen Satz in Druckschrift geschrieben. Sprachmodelle arbeiten ja, indem sie einem das nächste wahrscheinliche Wort ausgeben und daher bescheißen sie bei der Texterkennung gerne. Dann erkennen sie den Text nicht wirklich, aber sie liegen beim Raten richtig. Ich habe daher ein paar zufällige Wörter eingebaut und dazu auch absichtlich einige Wörter mit offensichtlichen Rechtschreibfehlern platziert. Die Erwartung ist, dass die Rechtschreibfehler im erfassten Text auftauchen.
Nach allem, was man so liest, sollen die neueren Gemini-Modelle von Google in diesem Bereich führend sein [**Stand: Dezember 2025** , wenn du diesen Artikel später liest, wird das definitiv anders sein]. Daher habe ich für den Start das „Thinking mit 3 Pro“-Modell verwendet. Das Ergebnis:
Das ist schon erschreckend, denn es ist erschreckend genau. Im Kern scheitert Gemini nur ganz unten am absichtlich von mir miese hingeschmierten Text.
Daran scheitern auch nicht-künstliche Intelligenzen.
Das Ergebnis ist wirklich beeindruckend. Moderne Technik kann also meine Handschrift in brauchbarer Qualität transkribieren.
Der Test in der OCR Arena hat weitere Ergebnisse gebracht – die Unterschiede zwischen den Modellen sind durchaus enorm und es daher leider nötig, vor dem großen OCR-Lauf etwas zu experimentieren.
Das eröffnet ganz neue Möglichkeiten: Ich schreibe gerne per Hand, aber ich mag den Output nicht, weil man so wenig damit anfangen kann. Ich habe hier irgendwo noch die Vorlesungsmitschriften aus dem Studium herumliegen. Will ich aus diesen eine bestimmte Information, dann muss ich zuerst den Text selbst suchen. Er liegt in irgendeinem Ordner in irgendeiner Kiste irgendwo. Der Ordner ist im Zweifelsfall mit WS08/09 beschriftet. Ich muss also wissen, in welchem Semester ich welche Vorlesung besucht habe. Dann müsste ich unter zig Zetteln suchen, wo die Info sich denn versteckt. Danach darf ich dann alles wieder wegräumen – eine moderne Volltextsuche hat schon ihre Vorteile.
Daraus lässt sich sicherlich auch ein ordentlicher Workflow gießen und weil wir gerade am Testen sind, hier die Idee:
Ein kleiner Notizblock mit perforierten Seiten. Dieser kann dann bequem mitgeführt werden. Ist etwas geschrieben, wird es aus dem Notizblock gerissen und eingescannt. Ob der Einzugscanner A6-Seiten kann, ist noch zu testen. Die beschriebenen Seiten kommen in irgendeine Ablage _[die noch zu finden ist]_. Das gescannte Bild wird _[irgendwie automatisiert]_ durch die KI gejagt und der Output erstmal in die Metadaten des Bildes geschrieben und dann in eine Textdatei abgelegt.