juxt/allium: A language for sharpening intent alongside implementation. ist ein sehr spannendes Projekt. Und zwar eine Spezifikationssprache für Verhalten von Softwaresystemen. Eine Sprache, für die es keine Laufzeitumgebung oder Compiler gibt, außer der LLM. Implementiert als Agent Skills. Super spannend, weil es unter anderem auch ein Distill gibt, mit dem man bestehende Software analysieren und retroaktiv Spezifikationen aufbauen kann, oder im Interviewverfahren mit der KI eine Spezifikation ausarbeiten kann, die für ein LLM deutlich präziser verständlich ist als allgemeines Englisch. Witziges Detail am Rande: ich habe Allium mit Qwen3-Coder-Next ausprobiert, meinem derzeitigen Lieblingsmodell für lokales Hosting, in pi.dev. Ich konnte das binary für Allium (ein Syntaxchecker und Linter) nicht mit homebrew installieren, pi.dev hat einfach kurzerhand das Binary runtergeladen und selber installiert.
Archiv 27. März 2026
scitrera/cuda-containers: Scitrera builds of various CUDA containers for version consistency, starting primarily with NVIDIA DGX Spark Containers bin ja im Moment ein großer Fan von eugr/vllm-node als Basispaket, weil es immer aktuelle Versionen für vLLM bietet, aber wenn ich mal mit sglang spielen will, ist das hier vermutlich das ähnlichste Projekt. Mich interessiert da speziell EAGLE-3 spekulatives Dekodieren - im Prinzip werden dabei über ein sehr kleines Modell parallel Token generiert und das Hauptmodell guckt was passt und nimmt das, oder generiert selber wenn nötig. Dadurch kann man oft ein drittel der Token über ein viel schnelleres banales Modell im <3B Bereich generieren lassen und nur jedes dritte wirklich über das große Modell.
thushan/olla: High-performance lightweight proxy and load balancer for LLM infrastructure. Intelligent routing, automatic failover and unified model discovery across local and remote inference backend ist nach dem Debakel von LiteLLM (gehackte supply-chain mit Datenextraktor im Paket) vielleicht die bessere Wahl. Für mich auf jeden Fall interessant, weil ich einfach nur zwei Modelle betreiben will und diese unter einem Endpunkt verfügbar machen will, und da sind alle anderen Pakete deutlicher Overkill.