Sign in

Marcel Pauly

@marcelpauly.de
1K followers 207 following 82 posts

Data journalist with @spiegel.de www.marcelpauly.de

PostsRepliesMedia
Marcel Pauly @marcelpauly.de · 02/07/2026
Die Bundesregierung konkretisiert, wie sie die Informationsfreiheit einschränken will: Unter anderem sollen die Ausnahmegründe im IFG erweitert und Gebühren erhöht werden.
051
Marcel Pauly @marcelpauly.de · 22/06/2026
Seht ihr das auch so? Und vor allem: Wird KI solche Qualitätsansprüche langfristig verändern? Und wäre das ein Problem, wenn die Fehlerquote niedriger ausfällt als bei einem halb-manuellen Ansatz? 18/18
200
Marcel Pauly @marcelpauly.de · 22/06/2026
Ist „sehr gut“ gut genug? Ich würde sagen: Um als Journalist in diesem Datensatz nach interessanten Fällen zu suchen und diese anschließend auszurecherchieren, reicht es völlig aus. Die Einkunftssumme pro MdB ohne weiteren Abgleich zu veröffentlichen, fände ich aber problematisch. 17/18
100
Marcel Pauly @marcelpauly.de · 22/06/2026
Ein Mensch hätte hier erkannt, dass die erste der beiden markierten Einkünfte wohl mit Beginn der zweiten geendet hat. Für einen derartigen Sonderfall haben wir nun einen Check eingebaut. Aber was ist mit anderen Sonderfällen und Ungenauigkeiten, auf die der Parser in der Zukunft treffen wird? 16/18
100
Marcel Pauly @marcelpauly.de · 22/06/2026
Abgeordnetenwatch hat auch diesmal auf ein teils regelbasiertes, teils händisches Verfahren gesetzt. Durch den Abgleich konnten wir Abweichungen überprüfen. In einem einzigen Fall hat unser Parser eine Zahlung unvollständig erfasst, weil das Enddatum nicht, wie üblich, angegeben wurde. 15/18
110
Marcel Pauly @marcelpauly.de · 22/06/2026
Wir machen unsere Auswertungen zu den Nebeneinkünften seit vielen Jahren gemeinsam mit @abgeordnetenwatch.de. Und wir machen hier tatsächlich stets doppelte Arbeit: Abgeordnetenwatch scrapet und parset, der SPIEGEL scrapet und parset. Und das ist bei derart messy Daten wahnsinnig hilfreich. 14/18
110
Marcel Pauly @marcelpauly.de · 22/06/2026
Zahlreiche stichprobenartige Checks bestätigten die am Ende dieses Entwicklungs- und Verbesserungsprozesses hohe Qualität unseres Parsings. Und doch hätten wir Bauchschmerzen gehabt, unsere Auswertung allein darauf zu stützen. Vielleicht haben sich ja irgendwo doch noch Fehler eingeschlichen … 13/18
100
Marcel Pauly @marcelpauly.de · 22/06/2026
LLMs waren ursprünglich nicht dafür gebaut, Substrings originalgetreu wiederzugeben. Daher haben wir die extrahierten Infos mit dem Original abgeglichen: Findet sich z.B. der vom LLM erkannte Geldbetrag wirklich so im Originalstring? Die aktuellen Modelle machten hier tatsächlich keine Fehler. 12/18
100
Marcel Pauly @marcelpauly.de · 22/06/2026
Bei unterschiedlichen Ergebnissen wurde eine Angabe an das nächstbessere Modell gegeben und schließlich bei weiterhin bestehenden Unterschieden händisch geprüft. 11/18
100
Marcel Pauly @marcelpauly.de · 22/06/2026
Außerdem stellten wir fest: Wenn eine Angabe zu Fehlern führt, dann in wiederholten Durchläufen fast immer zu unterschiedlichen (!) Fehlern. Daher haben wir jede Angabe dreimal ans LLM geschickt. Stimmen die Ergebnisse exakt überein, ist das ein sehr starkes Indiz für ein korrektes Parsing. 10/18
100
Marcel Pauly @marcelpauly.de · 22/06/2026
Komplexität meint hier bspw. die Länge einer Angabe, die Anzahl der darin genannten Geldbeträge – Dinge also, die sich leicht regelbasiert erkennen lassen und als Weiche fungieren können. 9/18
100
Marcel Pauly @marcelpauly.de · 22/06/2026
So fanden wir heraus, welche Modellauswahl und Prompt-Änderungen zu Verbesserungen im Ergebnis führen. Wir stellten bspw. fest, dass für die meisten Angaben OpenAIs günstigstes Modell (gpt-5-nano) ausreicht, wir ab einer gewissen Komplexität aber auf das nächststärkere Modell wechseln müssen. 8/18
100
Marcel Pauly @marcelpauly.de · 22/06/2026
Das anfängliche „Rumprobieren und Sehen, was passiert“ ist einem systematischen Testen gewichen: Wir haben eine quotierte Stichprobe mit Dutzenden Angaben sämtlicher Typen und unterschiedlicher Komplexitätsstufen gezogen. Für diese haben wir definiert, was wir als richtige Zieldaten erwarten. 7/18
100
Marcel Pauly @marcelpauly.de · 22/06/2026
Prompt(s) und Datenformat sind über mehrere Monate immer ausgefeilter geworden. Wir sind weg vom Ansatz „One Prompt Fits All“. Je nach Tätigkeitskategorie geben wir dem LLM unterschiedliche Kontextinformationen und Anweisungen mit. 6/18
100
Marcel Pauly @marcelpauly.de · 22/06/2026
Technisch geschieht das in Python. Für die Kommunikation mit dem LLM nutzen wir Pydantic AI. Zudem definieren wir mit einem Pydantic-Modell das erwünschte Zielformat. Pydantic AI akzeptiert nur Antworten, die dem Zielformat entsprechen, und besteht ggf. auf eine neue, überarbeitete Antwort. 5/18
100
Marcel Pauly @marcelpauly.de · 22/06/2026
Das grundlegende Set-up habe ich schon vergangenes Jahr bei der SciCar und der DataJConf vorgestellt: Wir schicken eine Tätigkeitsangabe, eingebettet in einen Prompt, via API an ein LLM. Der Prompt beschreibt u.a., welche Informationen potenziell enthalten sind. github.com/marcelpauly/... 4/18
100
Marcel Pauly @marcelpauly.de · 22/06/2026
Gleichzeitig besteht das Risiko, dass einzelne Informationen falsch zugeordnet werden, dass etwas weggelassen, hinzugedichtet oder verändert wird. Mit verschiedenen Methoden haben wir sichergestellt, dass das nicht passiert. 3/18
100
Marcel Pauly @marcelpauly.de · 22/06/2026
Die Grundidee: LLMs sind in der Lage, Informationen aus Fließtext zu extrahieren und in einem definierten Zielformat zurückzugeben. Gerade in von Menschen bearbeiteten Texten, die zwar ungefähr, aber doch nicht immer exakt einer definierten Struktur folgen, sind LLMs sogar robuster als Regex. 2/18
100
Marcel Pauly @marcelpauly.de · 22/06/2026
Wir haben mal wieder die Nebeneinkünfte der Bundestagsabgeordneten ausgewertet: www.spiegel.de/politik/deut... In der Vergangenheit lief das so: regelbasiertes Parsing der Freitextangaben, viel Regex, viel Fluchen. Diesmal haben wir ein LLM-gestütztes Parsing genutzt – und sehr viel gelernt. 1/18
spiegel.de
(S+) Gehälter, Gewinne, Mieteinnahmen: Wie viel verdient Ihr Bundestagsabgeordneter nebenbei?
Insgesamt mehr als zehn Millionen Euro haben die Parlamentarier seit Beginn der Wahlperiode neben ihrer politischen Arbeit verdient. Kommen sich Nebenjobs und Volksvertretung in die Quere?
1106
Marcel Pauly @marcelpauly.de · 20/05/2026
Ann-Kathrin Leclère über die mutmaßlich geklauten NSDAP-Daten bei Correctiv und Katapult: „Datenjournalismus muss ausgebaut und finanziert werden. Gute Datenrecherchen entstehen nicht nebenbei. Sie brauchen Fachwissen, technische Infrastruktur und genügend Zeit für Kontrolle.“ taz.de/NSDAP-Mitgli...
taz.de
Correctiv und NSDAP-Mitgliederkartei: Copy and Waste
Katapult und Correctiv wollten die Suche im NSDAP-Archiv schnell zugänglich machen – ohne Bezahlschranke. Dabei haben sie die Quellenprüfung vergessen.
021
Marcel Pauly @marcelpauly.de · 16/05/2026
Ja, wir sammeln Texterkennungsfehler unter nazikartei@spiegel.de und entwickeln das Tool weiter.
130
Marcel Pauly @marcelpauly.de · 16/05/2026
Korrekt.
110
Marcel Pauly @marcelpauly.de · 14/05/2026
Und warum es legitim ist, dass Medienhäuser Geld für ihre Aufbereitung verlangen, hat mein Kollege Felix Bohr heute kommentiert: www.spiegel.de/geschichte/m... 12/12
spiegel.de
(S+) Meinung: NSDAP-Mitgliederdatei: Gebt die Nazi-Akten frei!
Die Nazi-Kartei zeigt, wie Aufarbeitung im Internet aussehen kann. Das wäre eigentlich Aufgabe des Bundesarchivs.
0150
Marcel Pauly @marcelpauly.de · 14/05/2026
Wer eine noch smartere Suchfunktion verwenden und gleichzeitig weitere Datenquellen (z. B. Entnazifizierungsakten und Kriegsverbrecherurteile) durchsuchen will, wird beim SPIEGEL fündig: www.spiegel.de/geschichte/n... (Geschenklink, die ersten zehn Aufrufe führen kostenlos zu unserem Tool.) 11/12
spiegel.de
(S+) NSDAP-Archiv: Finden Sie heraus, was Ihre Familie unter Hitler getan hat
Der SPIEGEL hat Millionen Mitgliedskarten der NSDAP für Sie aufbereitet. Hier können Sie die Kartei durchsuchen – und sich ein persönliches Dossier erstellen.
2273
Marcel Pauly @marcelpauly.de · 14/05/2026
Wer eine Suchfunktion nutzen möchte und dafür zu zahlen bereit ist, wird bei der Zeit fündig: www.zeit.de/wissen/2026-... 10/12
zeit.de
NSDAP-Mitgliederkartei: War Ihre Familie in der NSDAP? Recherchieren Sie in neuen Dokumenten
Die ZEIT hat ihr Recherchetool noch einmal verbessert. Millionen weitere Akten der Mitgliederkartei sind nun durchsuchbar. Spüren Sie Ihrer Familiengeschichte nach.
2181
Marcel Pauly @marcelpauly.de · 14/05/2026
Wer nach Hinweisen auf eine NS-Vergangenheit der eigenen Vorfahren suchen will, kann das kostenlos und unkomfortabel beim US-Nationalarchiv tun: catalog.archives.gov/id/12044361 9/12
catalog.archives.gov
The online portal to the records held at the National Archives, and information about those records.
2292
Marcel Pauly @marcelpauly.de · 14/05/2026
Correctiv und Katapult schreiben nun, ihnen seien die Parallelen erst aufgefallen, nachdem die Zeit sie darauf hingewiesen hat. Das Tool ist jetzt wieder offline: correctiv.org/in-eigener-s... 8/12
correctiv.org
Veröffentlichung von digitaler NSDAP-Mitgliederkartei
Katapult und CORRECTIV haben gemeinsam eine frei zugängliche Datenbank zur NSDAP-Mitgliederkartei veröffentlicht. Wir haben die Datenbank vorläufig offline genommen, da der Verdacht berechtigt, dass e...
1190
Marcel Pauly @marcelpauly.de · 14/05/2026
So etwas muss beim Überprüfen der Daten auffallen. Liegen mehrere Quellen vor, liegt ein Abgleich auf der Hand. Mit sehr begrenztem Aufwand ließen sich zahlreiche Hinweise finden, dass das „Brown Archive“ Daten enthielt, die ganz offensichtlich von der Zeit abgegriffen worden waren. 7/12
1140
Marcel Pauly @marcelpauly.de · 14/05/2026
Für ein solches Vorgehen war die Qualität der aufbereiteten Daten bemerkenswert. Geradezu identisch mit der Qualität der geschätzten Zeit-Kolleg:innen: OCR-Fehler stimmten überein, sogar die vermuteten Ortsnamen hinter Abkürzungen – obwohl sich im Prompt keine Anweisung fand, diese zu schätzen. 6/12
SPIEGELZeitCorrectiv/Katapult
1160
Marcel Pauly @marcelpauly.de · 14/05/2026
Der Betreiber des „Brown Archive“ behauptete, mit dem Skript von zwei Schweizer Forschern gearbeitet zu haben. In seinem inzwischen nicht mehr aufrufbaren GitHub-Account fand sich ein entsprechendes geforktes Repo. Das Skript verwendet ein lokales LLM und einen einzigen, relativ simplen Prompt. 5/12
1130
Marcel Pauly @marcelpauly.de · 14/05/2026
SPIEGEL und Zeit haben Aufwand und Geld in eine komplexe Methodik investiert, um die Personendaten aus den Mikrofilmaufnahmen zu extrahieren: Karteikarten wurden je nach Typ vorsortiert und anschließend mit passgenauen Prompts an KI-Sprachmodelle übergeben: www.spiegel.de/geschichte/n... 4/12
spiegel.de
(S+) NSDAP-Mitgliederkartei: Die wichtigsten Fakten über die Nazidatenbank
Woher kommen die Daten? Was bedeuten die Treffer? Welche Fehler gibt es? Und was verrät das Eintrittsdatum über die Verstrickung ins Hitler-Regime? Hier finden Sie die Antworten auf die wichtigsten Fr...
2120
Marcel Pauly @marcelpauly.de · 14/05/2026
Die Medienhäuser verwendeten die Daten des „Brown Archive“, einer privaten Website eines Programmierers aus Osnabrück. Wären Correctiv und Katapult ihrer Sorgfaltspflicht nachgekommen, wäre ihnen aufgefallen, dass diese Daten mindestens in großen Teilen sehr wahrscheinlich geklaut waren. 3/12
1180
Marcel Pauly @marcelpauly.de · 14/05/2026
Correctiv und Katapult stellten eine komfortable Suchfunktion für die Kartei bereit. Sie warben damit, dass diese im Gegensatz zu den Tools von SPIEGEL und Zeit kostenlos nutzbar sind. Das wäre völlig legitim – würden hinter der Suchmaske Daten liegen, die in Eigenleistung aufbereitet wurden. 2/12
1220
Marcel Pauly @marcelpauly.de · 14/05/2026
Wer sich in den vergangenen Wochen etwas mit der NSDAP-Mitgliederkartei beschäftigt hat, musste irritiert sein vom Stunt von Correctiv und Katapult. Viel zu spät haben die Medienhäuser begriffen, was sie da am Dienstag rausgehauen haben. Nun mussten sie ihre Veröffentlichungen zurückziehen. 1/12
38825
Marcel Pauly @marcelpauly.de · 31/12/2025
Für unsere Serie „Die Geschichte hinter der Geschichte“ habe ich aufgeschrieben, wie wir im Mai das AfD-Gutachten des BfV digitalisiert haben – mit viel mehr Handarbeit, als man sich das als Datenjournalist wünscht: www.spiegel.de/politik/deut...
spiegel.de
AfD: Wie wir das Gutachten des Verfassungsschutzes durchsuchbar machten
In einem interaktiven Tool machten wir das AfD-Gutachten des Verfassungsschutzes durchsuchbar. Auf dem Weg dorthin stießen wir auf technische Hürden, die sich nur mit beispielloser Handarbeit überwind...
032
Marcel Pauly @marcelpauly.de · 07/08/2025
Politiker:innen und Parteien werden künftig kein Geld mehr für die Distribution ihrer Posts als Anzeigen ausgeben (können) und könnten mehr Geld in die Komposition und Produktion der Clips und Fotos stecken. Für uns nimmt damit die Bedeutung von Social-Scraping noch weiter zu. 5/5
000
Marcel Pauly @marcelpauly.de · 07/08/2025
Brauchbare APIs stellen die Social-Media-Plattformen schon lange nicht mehr bereit. Mit der Ankündigung von Meta, politische Anzeigen auf Facebook und Instagram abzuschaffen, verliert auch die Ad Library für uns jegliche Bedeutung. 4/5
100
Marcel Pauly @marcelpauly.de · 07/08/2025
Daher: Daten ziehen, scrollen, Daten ziehen, scrollen usw. – bis man das Ende eines Profils erreicht hat. Und ich befürchte, dieses langatmige Prozedere werden wir noch häufig anwenden müssen. 3/5
100
Marcel Pauly @marcelpauly.de · 07/08/2025
Wir haben dafür mit der Python-Library Playwright gearbeitet, mit der sich ein Browser fernsteuern lässt. Wichtig bei Plattformen mit Infinite-scrolling: Geladene Posts verschwinden beim Runterscrollen wieder, damit die gleichzeitig geladene Datenmenge für den Browser nicht zu groß wird. 2/5
100
Marcel Pauly @marcelpauly.de · 07/08/2025
Für unser Titelstück über Markus Söders Social-Media-Inszenierung haben wir unter anderem sein Instagram-Profil gescrapet. www.spiegel.de/politik/deut... 1/5
spiegel.de
(S+) Markus Söder und Social Media: Ihm schmeckt’s
Markus Söder hantiert wie kaum ein zweiter demokratischer Politiker mit den sozialen Netzwerken. Seine manchmal etwas peinlichen Inhalte erreichen Millionen, aber der langfristige Erfolg ist noch nich...
101
Marcel Pauly @marcelpauly.de · 23/07/2025
😬
110
Marcel Pauly @marcelpauly.de · 30/06/2025
The idea was to represent the electorates as two-dimensional shapes (an expansion to the right means female voters, to the left means male, upward means older, and downward means younger), making it possible to compare these shapes across years and between parties. But I see your point.
000
Marcel Pauly @marcelpauly.de · 27/06/2025
Glückwunsch!!!
010
Marcel Pauly @marcelpauly.de · 23/06/2025
The representative electoral statistics show how often each demographic group voted for different parties in the German federal election. This year, I’ve prepared the data as radar charts. What do you think: does this type of chart work well for this kind of data? www.spiegel.de/politik/deut...
44413
Marcel Pauly @marcelpauly.de · 23/06/2025
Wir haben im Team lange über die Darstellungsform diskutiert. Was meint ihr: Funktionieren hier Radar-Charts und ihre Schritt-für-Schritt-Erklärung im Artikel? Oder sind euch schnöde Balken- und Liniendiagramme lieber?
000
Marcel Pauly @marcelpauly.de · 23/06/2025
Wen die Technik hinter den Grafiken interessiert: Die Radar-Charts sind umfunktionierte Datawrapper-Scatterplots. Die Koordinaten der einzelnen Punkte und Linien sind vorab in Python berechnet. (Danke an Sinus, Cosinus und ChatGPT.)
100
Marcel Pauly @marcelpauly.de · 23/06/2025
Sehr interessant sind die Veränderungen in den jungen Altersgruppen, insb. bei AfD, Grünen und Linke. Und der Frauenüberhang, den die Wählerschaft der Union zu Merkels Zeiten noch hatte, ist unter Merz endgültig verschwunden. Mehr Details im Artikel.
100
Marcel Pauly @marcelpauly.de · 23/06/2025
Wer wählte wen bei der #btw25? Mit den Daten der Repräsentativen Wahlstatistik habe ich diesmal etwas Neues ausprobiert: die Wählerschaft einer Partei als zweidimensionale Form in einem Radar-Chart mit Männern, Frauen, Jungen, Alten. www.spiegel.de/politik/deut...
2217
Marcel Pauly @marcelpauly.de · 26/05/2025
Die interaktive Anwendung liegt tatsächlich vor der Paywall und ist ohne Abo nutzbar.
1454
Marcel Pauly @marcelpauly.de · 26/05/2025
Wir haben das AfD-Gutachten des Verfassungsschutzes digitalisiert und machen die Zitate durchsuchbar, die das BfV als Belege für die Bestrebungen der Partei gegen die freiheitliche demokratische Grundordnung heranzieht: www.spiegel.de/politik/deut...
651570678