The Jev Situation - Eine neue Kuh wird durch's KI-Dorf getrieben
Stumme KI, laute Versprechen: Jev und die Anatomie eines KI-Hypes
Die KI-Nerdwelt ist schon wieder in Aufruhr. Diesmal heißt der Star Jev von Typesafe AI. Die Prämisse klingt bestechend: Man nimmt einem Large Language Model das Sprechen weg, streicht die teure, langsame Textgenerierung und trimmt es auf das bloße Treffen von Entscheidungen. Ein reinrassiges „System 1“-Modell, das Klassifizierungen und Wahrscheinlichkeiten in 70 bis 500 Millisekunden liefert – Output-Token kosten nichts, weil es keine gibt.
Clever, keine Frage. Die Ambiguität der Sprache wird radikal reduziert, die Ausgabe auf verwertbare Werte getrimmt. Man versucht sozusagen, das Probabilistische einer KI auszumerzen und sie deterministischer erscheinen zu lassen. Und genau bei diesem Wort – erscheinen – sollte man hellhörig werden.
Die Analyse: Was ist Jev wirklich?
Nüchtern betrachtet ist Jev eine KI, der man das Reden abgewöhnt hat. Statt Absätzen liefert sie Kategorien, Scores und Wahrscheinlichkeiten. Für Software-Automatisierung ist das ein durchaus sinnvolles Interface: Software braucht keine Poesie, sondern Werte, mit denen ein if-Statement etwas anfangen kann.
Aber – und hier beginnt die Problematik – der Hersteller behauptet, das Modell könne nicht halluzinieren. Das halte ich für Quatsch. Technisch stimmt es insofern, als das Modell die vorgegebene Struktur nicht durchbrechen kann: keine invalide Daten, keine erfundenen Kategorien. Inhaltlich bleibt es aber ein stochastisches System, das falsch abbiegen kann. Nur eben stumm und sehr schnell. Jev löst das Problem der Unvorhersehbarkeit nicht; es versteckt es lediglich hinter einer deterministischen Schnittstelle. Es ist die Verwechslung von Output-Format (was ausgegeben wird) mit Prozess-Logik (wie die Entscheidung zustande kommt)
Und das ist möglicherweise gefährlicher als das klassische Halluzinieren:
- Das plappernde LLM schreibt: "Der Kunde möchte kündigen, weil sein Hamster einen Kredit abgelehnt bekam." Jeder Mensch erkennt den Blödsinn sofort und greift ein. Die Halluzination trägt ihre eigene Warnweste.
- Das stumme Jev liefert:
Kategorie: Kontoauflösung, Konfidenz: 0.98. Keine Begründung, kein Kontext, kein erkennbarer Unsinn. Der automatisierte Prozess läuft weiter – und niemand merkt es, bis der Zug entgleist.
Eine falsche Entscheidung in deterministischer Verpackung ist schwerer zu erkennen als falscher Text. Das Probabilistische verschwindet nicht – es versteckt sich nur hinter einer Maske aus sauberen Zahlen.
Hinzu kommt:
Für viele der beworbenen Anwendungsfälle – Spam-Erkennung, Ticket-Routing, Klassifizierung – existieren in der klassischen IT längst bewährte, auf Determinismus getrimmte Lösungen.
Regelwerke, feingetunte Spezialmodelle, gute alte Heuristiken. Ob Jev diese tatsächlich schlägt oder nur eleganter aussieht, beantwortet bisher niemand mit belastbaren Daten.
Bevor wir die Komplexität einer stochastischen Entscheidungseinheit in unsere Kernprozesse injizieren, müssen wir uns fragen: Lösen wir hier ein Problem oder erkaufen wir uns nur eine modernere Ästhetik für eine Lösung, die wir mit einem einfachen if-else-Statement besser, billiger und sicherer hätten lösen können?
Die Anatomie des Hypes: Vom POC zur offenen Frage
Jev folgt einem Muster, das wir mittlerweile gut kennen – und das in „Die POC-Falle" bereits seziert wurde: "Interessantes Proof of Concept, sicherlich in manchen Szenarien nützlich – nur: wie setzt man so etwas produktiv ein?"
Jev ist die nächste Kuh, die durchs KI-Dorf getrieben wird. Ein Stealth-Startup, ein beeindruckendes Demo, jubelnde Timelines – und null belastbare Antworten auf die Fragen der Production Readiness. Wir stecken wieder mittendrin in der Proof-of-Concept-Dauerschleife: Die Tech-Branche wirft einen Prototypen über den Zaun, und wir dürfen als unbezahlte Versuchskaninchen herausfinden, wo er in der Praxis auseinanderfällt. Diesmal allerdings mit einem pikanten Unterschied: Bei einem plappernden Chatbot merken wir es wenigstens, wenn er auseinanderfällt. Bei einer stummen Entscheidungsmaschine merken wir es erst an den Folgen.
Die Frage nach dem produktiven Einsatz bleibt im aktuellen Jubel unbeantwortet. Und sie zerfällt bei näherem Hinsehen in mehrere unbequeme Teilfragen::
- Verantwortung: Wer haftet, wenn die stumme Entscheidung falsch war? Bei einem Text-Output gibt es wenigstens eine nachvollziehbare "Begründung" – bei einem nackten Konfidenzwert von 0.98 gibt es nichts zu auditieren.
- Kalibrierung: Typesafe AI wirbt mit "RLCD" für "kalibrierte Entscheidungen" (Reinforcement Learning for Calibrated Decisions - Klasse Marketingkauderwelsch!). Aber kalibriert auf wessen Daten? Ob die Konfidenzwerte auf Ihren Support-Tickets, Ihren Logs, Ihrer Domäne halten, weiß niemand – außer Sie testen es selbst, gründlich und fortlaufend.
- Abhängigkeit: Ein proprietäres Modell eines Stealth-Startups, dessen Architektur nicht öffentlich ist, als Entscheidungskomponente tief in Produktionsprozesse einzubauen – das ist Vendor Lock-in in Reinform. Was passiert, wenn Typesafe AI in 18 Monaten aufgekauft, umgepreist oder abgeschaltet wird?
- Regulierung: Ein System, das automatisiert Entscheidungen über Menschen trifft (Ticket-Priorisierung, PII-Erkennung, Risiko-Scores), landet schnell in den höheren Risikoklassen des EU AI Act. Wie dokumentiert man ein Modell, dessen Innenleben der Hersteller bewusst verschweigt?
Das sind keine rhetorischen Fragen, mit denen ich Jev abwatschen will. Es sind die Fragen, die vor jedem produktiven Einsatz beantwortet werden müssen – und die im Hype-Zyklus systematisch übersprungen werden.
Zurück zum Moving Target
Und damit sind wir wieder bei meiner These aus "AI as a Moving Target": Schon wieder eine interessante Weiterentwicklung, schon wieder Aufruhr in der Nerdwelt. Wer vor sechs Monaten ein Projekt gestartet hat, um ein BERT-Modell für exakt solche Klassifizierungsaufgaben zu trainieren, reibt sich heute die Augen. Und wer heute alles auf Jev setzt, wird sich in ein paar Monaten (Wochen?) die Augen reiben, wenn die Open-Source-Welle mit "System 1"-Klonen anrollt – was absehbar ist.
Weitere Entwicklungen stehen bevor, das ist die einzige Gewissheit. Wann und wie man solche Werkzeuge in eine saubere KI-Strategie einbettet, steht auf einem anderen Blatt – und das ist noch nicht geschrieben.
Das Fazit: Wachsamkeit – und das ewige Leitmotiv
Ich spreche hier bewusst wieder keine Empfehlung aus, weder für noch gegen Jev. Der Punkt ist ein anderer: Bleiben Sie wachsam gegenüber jedem KI-Hype.
Wenn ein Hersteller behauptet, sein Modell könne "nicht halluzinieren" (oder könnte die Menschheit vernichten), dann ist das kein technisches Faktum, sondern eine Marketing-Formulierung. Wenn ein beeindruckendes POC durch die Timelines rauscht, ist die richtige Reaktion nicht "einbauen!", sondern die nüchterne Frage: In welchem Szenario löst das ein Problem, das wir wirklich haben – und was kostet uns der Irrtum, wenn die stumme Entscheidung falsch ist? Oder anders gesagt: Lassen Sie sich nicht von den POCs der Tech-Industrie herumschubsen – bauen Sie Ihre eigenen, auf Ihren Daten, in Ihren Prozessen.
Denn eines gilt auch für Jev, wir für alle Tools: Eine KI, die schneller entscheidet, macht Fehler schneller. Und eine KI, die dabei schweigt, macht sie leiser. Wer Jev in einen komplexen, undokumentierten Workflow einbaut, hat keinen intelligenteren Prozess – er hat nur einen Prozess, der Murks jetzt in 70 Millisekunden produziert, mit einem Konfidenzwert von 0.98 als Gütesiegel obendrauf.
Ob plappernde oder stumme KI, ob System 1 oder System 2: Das Werkzeug ist nie die Strategie. Lassen sie die Hypes, Hypes sein, gehen Sie zurück ans Whiteboard und schauen Sie sich Ihre Prozesse an. Denn am Ende gilt, was immer gilt:
It's always the process, stupid!
Live long and prosper 😉🖖
Musicbezug 🎧