Archiv 13. Juli 2026

567-labs/instructor: structured outputs for llms - und hier die Alternative zu dottxt-ai/outlines: Structured Outputs, aber hinter dem LLM und nicht in der Generierung. Im Prinzip ist das die klassische Korrekturschleife für LLM Antworten, die man ständig baut. Also parsen, prüfen, validieren, konkrete Fehler zurückmelden und Prompt anpassen und wiederholen, bis es passt.

dottxt-ai/outlines: Structured Outputs - ein sehr spannendes Tooling das sich direkt in vLLM einhängt und Replies von LLMs gegen definierte Schemas für Antworten prüft und direkt in der Generierung illegale Token rejected und damit garantiert, dass der Output den erwarteten Formaten entspricht. Gerade für kleinere Modelle interessant die oft Schwächen bei Toolformaten haben. Gerade für stringente Workflows in denen man genau weiss, was das LLM antworten soll, kann das hilfreich sein.

datalab-to/marker: Convert PDF to markdown + JSON quickly with high accuracy - eine interessante Lösung für ein PDF Preprocessing, dass aus PDF Markdown macht, aber die Struktur und die Lesefolge berücksichtigt. Gerade für Dokumentenverständnis ist das essentiell, da Tabellen in ihrerer Anordnung eine Menge an Information transportieren und das tool dabei helfen kann.