ich hab mal zusammenfassen lassen was wir da machen: Aus „Ich katalogisiere mal meine Rollenspielsammlung mit KI“ ist inzwischen ein recht ernsthaftes Softwareprojekt geworden. Bei rund 8.000 Dateien kann ich nicht jede Beschreibung persönlich kontrollieren. Also brauchen wir einen Ablauf, der Fehler möglichst früh findet und nachvollziehbar hält, wie ein Ergebnis zustande gekommen ist. Die Grundarchitektur sieht mittlerweile so aus: 1. Originale als Grundlage Die Auswertung beginnt bei den tatsächlichen PDFs, Bildern und sonstigen Dateien. Vorhandene Beschreibungen werden erst anschließend zum Vergleich herangezogen. Sonst besteht die Gefahr, dass die KI lediglich alte Fehler hübscher formuliert. Datei-IDs, Versionen und Prüfsummen halten fest, auf welchen Quellen eine Auswertung beruht. Die Originale bleiben unverändert. 2. Ein zentraler Katalog Die Ergebnisse landen in einem strukturierten JSON-Katalog. Er verbindet Werke, Dateien, Bestandteile und Prüfbelege. Ein Buch mit mehreren Abenteuern soll beispielsweise als Paket erhalten bleiben, während die enthaltenen Abenteuer trotzdem einzeln auffindbar beschrieben werden können. Apple Notizen beziehungsweise Obsidian sind daraus abgeleitete Ansichten. Der aktuelle Neuaufbau dieser Ansichten steht noch aus. 3. Erstauswertung erhalten, Korrekturen separat dokumentieren Die erste Auswertung wird eingefroren. Finden wir später einen Fehler, wird diese Vergangenheit nicht stillschweigend überschrieben. Eine Korrektur braucht einen Quellenbeleg und einen nachvollziehbaren Änderungsnachweis. Auch eine später geschlossene Prüflücke bleibt damit als Entwicklung sichtbar. 4. Gemeinsamer Kern, unterschiedliche Profile Identitäten, Revisionen, Prüfbelege und Freigaben folgen gemeinsamen Regeln. Daneben unterscheiden wir Medienprofile und Fachprofile. Die Medienprofile sind bereits teilweise umgesetzt; die systematische Trennung der Fachprofile ist das Ziel für die weitere Verallgemeinerung. Medienprofile beschreiben beispielsweise, wie ein PDF, ein Bildpaket oder später vielleicht Audio geprüft wird. Bei PDFs geht es etwa um Seitenabdeckung, bei Bildpaketen um den belegten Umfang und die einzeln geprüften Bilder. Fachprofile sollen dagegen die Struktur der jeweiligen Rollenspielsysteme beschreiben. Midgard organisiert Werke und Editionen anders als beispielsweise Savage Worlds. Solche Unterschiede sollen nicht als „if Midgard“ oder „if Savage Worlds“ im allgemeinen Kern landen. Neue Inhalte innerhalb unterstützter Profile sollen möglichst nur neue Daten und Belege erzeugen. Neue Programmlogik sollte nur nötig werden, wenn tatsächlich eine neue allgemeine Fähigkeit hinzukommt. 5. Vier-Augen-Prinzip und technische Prüfungen Ein Agent wertet aus, ein anderer prüft unabhängig gegen die Quellen. Änderungen an der Prüfsoftware werden ebenfalls unabhängig gegengeprüft. Zusätzlich kontrolliert Code unter anderem Struktur, Prüfsummen, Dateizuordnungen, Abdeckung und die zulässigen Revisionsschritte. Die beiden Prüfarten ergänzen sich: Eine korrekte Prüfsumme sagt noch lange nicht, dass eine Beschreibung inhaltlich stimmt. Und eine überzeugend klingende Beschreibung beweist nicht, dass alle Dateien geprüft wurden. 6. Kontrollierte Übernahme Für die Übernahme werden genau bestimmte Ergebnisse und Prüfberichte gemeinsam festgelegt. Ein einzelner Schreiber prüft den aktuellen Katalogstand auf zwischenzeitliche Änderungen, sichert den bisherigen Stand und übernimmt den neuen. Danach werden die gespeicherten Daten zurückgelesen und mit dem erwarteten Ergebnis verglichen. Eine atomare Datenbanktransaktion ist das nicht; Fehler- und Rücksicherungsfälle müssen ausdrücklich behandelt werden. Dass wir die Gegenprüfung brauchen, hat sich gerade wieder gezeigt: Eine Bildprofil-Erweiterung bestand 150 Tests. Der unabhängige Prüfer fand trotzdem einen Weg, auf dem zwei geprüfte Bilder aus einem Dreierpaket fälschlich als vollständig gewertet wurden. Diese Version wurde deshalb nicht freigegeben. Die allgemeine Lehre daraus: Ein Paket darf durch fehlende Angaben niemals in eine schwächere Prüfung fallen. Vollständigkeit muss aus dem belegten Sollumfang und der tatsächlich geprüften Abdeckung entstehen. Aktuell stehen wir bei 191 Beschreibungen und 3.397 einzeln geprüften Dateien. Die letzten zwölf PDFs kamen bereits ohne Änderungen an Code, Schema oder Profil durch den Ablauf. Der Gesamtbestand ist noch nicht fertig. Mein Zwischenfazit: Die Grundstruktur hat sich in mehreren echten Durchläufen bewährt. Jetzt geht es darum, die verbleibenden Lücken zu schließen und daraus irgendwann einen unabhängig nutzbaren Skill zu machen. Weniger neue Programmlogik pro Paket wäre dabei ein gutes Zeichen. Auf die Prüfung der Ergebnisse werden wir trotzdem nicht verzichten können. Edit: Das ist irgendwie das Gegenteil von Vibe-Coding.