Zum Inhalt springen

Blog · August 2026

Ich spreche mit dem Computer und er arbeitet. Nur macht nicht die Stimme den Jarvis, sondern der Gegenspieler.

  • Jakub Liška · August 2026

OpenAI hat in die Desktop-App ChatGPT eine Stimme eingebaut, mit der sich mehrere Agenten gleichzeitig steuern lassen. Sie starten eine Aufgabe, unterbrechen sie, ordnen die Prioritäten neu, und das alles per Stimme.

OpenAI hat in die Desktop-App ChatGPT eine Stimme eingebaut, mit der sich mehrere Agenten gleichzeitig steuern lassen. Sie starten eine Aufgabe, unterbrechen sie, ordnen die Prioritäten neu, und das alles per Stimme.

Das setze ich mir seit ein paar Monaten von Hand zusammen, und die Stimme ist dabei der uninteressanteste Teil. Interessant ist die Frage, die daraus folgt: Wenn sich alles so schnell bauen lässt, wer merkt, dass es falsch ist? Ich zeige Ihnen einen Tag und am Ende die Antwort.

Morgens: zwanzig Minuten Fußweg

Die beste Aufgabe des Tages entsteht draußen. Nicht an der Tastatur.

Der Tag beginnt nicht am Computer. Er beginnt draußen, mit einem Kopfhörer im Ohr. Ich diktiere, was ich an dem Tag tun will, warum und wovor ich Angst habe. Ich formuliere nicht, ich hole es nur aus dem Kopf. Nach zwanzig Minuten Gehen ist daraus mehr Kontext geworden, als ich in einer Stunde schreiben würde, und ein besserer, weil ich in ganzen Gedanken spreche.

Die Transkription macht Fehler bei Namen und Zahlen, das gebe ich zu. Aber zum lauten Nachdenken funktioniert es besser als alles, was ich probiert habe.

Zwei Fenster nebeneinander, in einem die Sprachtranskription, im anderen der Bau

Vormittags: acht Terminals nebeneinander

Acht Läufe gleichzeitig. Nicht weil ich schnell bin, sondern weil ich nicht warte.

Am Schreibtisch läuft es dann anders. Jahrelang habe ich mir meine eigene Umgebung abgestimmt: acht Terminals nebeneinander, ein Raster, das sich von selbst aufbaut, über zweitausend Zeilen eigener Konfiguration und Helfer, die mir zuarbeiten. Was mir fehlte, habe ich mir dazugeschrieben.

Die praktische Folge: An einem Vormittag laufen fünf Dinge gleichzeitig. Eine Ausschreibungsunterlage für eine Logistikfirma, eine Vorlage für einen Partner, die Überarbeitung des eigenen Produkts, dazu Inhalte und interne Systeme, auf denen unser Unternehmen läuft. Ich warte nicht, bis das eine fertig ist, um das andere zu beginnen. Das ist kein Trick, das ist Kapazität. Ein Mensch erledigt, wofür früher fünf Spezialisten nötig waren.

Morgenspaziergang, bei dem die Aufgabe per Stimme diktiert wird

Die zweite Hälfte des Vormittags ist langweilig, und der Kunde sieht sie nie. In jedes Gespräch gehe ich erst, wenn ich alles gelesen habe, was dazu entstanden ist. Bei der letzten Partnerverhandlung waren es einhundertneunzehn Dateien, von der Transkription des ersten Gesprächs bis zum Testscan seines Produkts. Dadurch spreche ich nicht allgemein, sondern zu einem konkreten Satz, den die Gegenseite vor drei Wochen gesagt hat. Das ist der Unterschied zwischen einem Treffen, aus dem eine Entscheidung hervorgeht, und einem, nach dem eine Zusammenfassung verschickt wird.

Darüber hinaus teste ich gerade Orca, eine App, die diese Terminals als ein Ganzes steuert. Die Panels wissen endlich voneinander, und den Kontext zwischen ihnen muss nicht mehr der Mensch tragen. Ich nutze sie noch nicht lange, daher keine großen Schlüsse. Nach ein paar Wochen schreibe ich, wie sie sich bewährt hat und was mich an ihr stört.

Nachmittags: was an dem Tag tatsächlich entstanden ist

Nicht wie viele Stunden. Was aus ihnen herausgekommen ist.

Hier sieht man, was diese Arbeitsweise tatsächlich ermöglicht. Und genau hier beginnt zugleich das Problem, wegen dem ich den Artikel schreibe.

Mehrere Aufgaben, die parallel nebeneinander laufen

Drei Dinge aus den letzten Wochen, nicht aus dem ganzen Jahr.

Eine App in einem halben Tag. Im Sommer habe ich eine kleine Mac-App gebaut, die Termine im Auge behält. In einer Nacht vier Versionen, Tests von achtzehn auf zweiundfünfzig, zwei unabhängige Audits, Bewertung 9,2 von 10. Kostenlos und mit Quellcode, als öffentliche Beta. Inzwischen gibt es einige hundert Downloads, und ich bereite sie für Reddit und weitere Communities vor, wo mehr Leute sie kaputt machen können als ich allein. Was dabei herauskommt, werde ich weiter beschreiben. Die ganze Geschichte dieser ersten Nacht steht im Artikel „Ein halber Tag für die App, eineinhalb Tage, damit man sie fremden Leuten geben kann“.

Ein nachgemessener Anbieter. Bevor wir mit einem Partner die Zusammenarbeit unterschrieben haben, habe ich seinen Dienst mit 35 echten Transkriptionen aus unseren Gesprächen durchlaufen lassen. 35 von 35 ohne Fehler und 9,7-mal günstiger als unser bisheriges Modell. Er selbst warb mit 9,1-mal. Zum Termin kam ich mit Zahlen, nicht mit Eindrücken. Die ganze Messung samt Methodik steht im Artikel „9,7x günstiger als Claude Sonnet“.

Warum zwei Modelle und nicht eins: Das zweite Modell widerspricht dem ersten

Hunderte Artikel für eine Kundin. Ein Publikationssystem, das mit ihrer Stimme schreibt und das sie vom Handy aus freigibt. Ein Artikel für ein paar Euro, nicht für Tausende. Wie es aufgebaut ist, habe ich im Artikel „Ihre Website kann arbeiten, während Sie schlafen“ besprochen.

Am liebsten sind mir aber die Zahlen, die nicht ich nenne. Ein Kunde, eine Marketingagentur, hat ausgerechnet, dass ihm das System vierzig Stunden im Monat spart. Diese Zahl habe ich nicht gerechnet, sie kam von ihm. Und genau solche interessieren mich, weil man sie in seiner Aufstellung überprüfen kann, nicht in meiner Präsentation.

Hier geht es nicht um Schreibgeschwindigkeit. Es geht darum, dass man nicht wartet, mehrere Dinge gleichzeitig laufen und jedes Ergebnis gemessen wird. Hinter dieser Geschwindigkeit stehen fünfzehn Jahre Projekte und über fünftausend Stunden mit KI, sonst käme nichts Brauchbares heraus.

Die erste Fassung ist immer anständig und zu nichts nütze. Diesen Artikel habe ich dreimal verworfen und neu geschrieben, weil mir etwas nicht gepasst hat. Die Geschwindigkeit liegt nicht darin, dass der erste Versuch gelingt. Sie liegt darin, dass ich ihn erkenne und noch am selben Tag verwerfe.

Spracheingabe: was funktioniert und was nicht

Und genau hier ist die Frage vom Anfang. Wenn sich alles an einem Tag bauen lässt, wer merkt, dass es falsch ist? Bei mir ist die Antwort langweilig: fünfzehn Jahre derselben Fragen in verschiedenen Branchen. Ich erkenne in Sekunden, was am Freitagabend abstürzt, aber nicht, weil ich klüger wäre als das Modell. Sondern weil ich es schon abstürzen gesehen habe. Bei einem Brillenscharnier, das keine Haare ziehen darf. Bei einem Lager, das die Buchhaltung nicht anlügen darf. Bei einem Zahlungsgateway, wo ein Fehler in Transaktionen gezählt wird. Das Modell erzeugt einen Entwurf in Minuten, sagt aber nie von selbst „ich weiß es nicht“. Diese Entscheidung bleibt beim Menschen und lässt sich nur dann schnell treffen, wenn er viel Praxis hinter sich hat.

Nachmittags, zweite Hälfte: der Gegenspieler

Ein Fehler, der laut wird, ist eine gute Nachricht. Gefährlich ist der, der schweigt.

Eine Stunde Arbeit gegen ein Ergebnis, das sich messen lässt

Und jetzt der Teil, den fast jeder Anbieter auslässt. Genau dort verliert man Geld.

Doch nach sechs Stunden an einer Sache übersieht auch der erfahrenste Mensch einen blinden Fleck. Deshalb durchläuft alles, was an dem Tag entstanden ist, noch ein zweites Modell. Nicht dasselbe, ein anderes. Es bekommt eine eigene Aufgabe und sucht nach Lücken. Denn ein Modell widerspricht seiner eigenen Arbeit nicht. Es lobt sie. Immer.

Das ist nicht mein Eindruck. Zapier hat unabhängig messen lassen, wie sich Modelle bei 657 realen Geschäftsaufgaben schlagen, und bewertet wurde auch, ob sie die vorgegebenen Regeln einhalten. Die besten kamen unter 50 Prozent. Übersetzt: Ein Spitzenmodell erledigt eine reale Geschäftsaufgabe korrekt und regelkonform in etwa der Hälfte der Fälle. Ohne zweite Kontrolle sieht die andere Hälfte niemand.

Der Gegenspieler, der das Ergebnis des ersten Modells kontrolliert

Neben dem zweiten Modell läuft alles noch durch ein eigenes QA-Labor. Sechzehn Regeln, das Urteil „rauslassen oder nicht“, ohne Ausreden, dass es diesmal reicht. Außerdem wird die Website vor dem Einsatz automatisch auf fünf Breiten durchgespielt, nicht mit dem Auge. Dann folgen manuelles Durchklicken und die Prüfung der Produktion. Zuletzt fand es einen Link, der an eine Stelle führte, die es auf der Seite nicht gab.

Bei der App für Termine sah das so aus. Das zweite Modell lieferte keinen einzelnen Befund. Es lieferte vier Bedingungen, ohne die ich sie nicht hätte rauslassen dürfen. Zwei davon sind erwähnenswert.

Die Deinstallation löschte nach einer Namensmaske. Auf meinem Rechner passte das. Aber die Maske konnte auch die App von jemand anderem treffen. Die Korrektur war, die Kennung zu prüfen, nicht den Namen.

Wenn das Laden des Kalenders nicht gelang, gab die Funktion keinen Fehler zurück. Sie gab eine leere Liste zurück. Die App tat so, als hätten Sie keine Termine, und leuchtete ruhig grün. Das ist kein Absturz, den man bemerkt. Das ist Stille.

Der schlimmste Fehler ist nicht der Absturz. Der schlimmste ist die Stille, in der das System behauptet, es sei alles in Ordnung. Und das gilt für jedes System, das Ihnen jemand verkauft. Fragen Sie, wer ihm widersprochen hat.

Ein Audit, das das System selbst durchführt

Abends: das Protokoll

Das Letzte des Tages ist das Langweiligste, und fast jeder gibt es auf. Alles, was an dem Tag entschieden wurde und entstanden ist, wird aufgeschrieben. Nicht im Kopf, im System. Aus diesen Aufzeichnungen habe ich mir einen digitalen Zwilling gebaut: Er kennt meine Entscheidungsregeln und sagt mir, wo ich mir widerspreche. Manchmal früher als ein Mensch. Am nächsten Morgen fange ich nicht bei null an, und das Modell auch nicht, denn es kennt den Kontext aller Projekte, nicht den Durchschnitt aus dem Internet.

Ohne das ist jedes Setup nach drei Monaten ein toter Ordner. Mit ihm wächst der Nutzen von Tag zu Tag.

Haben Sie jemanden, der Ihrer KI sagt, dass sie sich irrt?

Was Sie daraus mitnehmen, wenn Sie kein Entwickler sind

Der Gedanke ist nicht technisch, auch wenn der Artikel so klingt. Jarvis ist kein kluger Assistent. Es sind drei Schichten: eine schnelle Eingabe, ein Gedächtnis, damit sich nichts wiederholt, und jemand, der sagt, dass es schlecht ist, bevor es der Kunde sieht. Die ersten beiden schafft sich heute jeder an einem Nachmittag an. Die dritte entscheidet.

Gemeinsames Audit: System und Mensch kontrollieren das Ergebnis

Und die dritte lässt fast jeder aus. Dann entstehen dreißigseitige Dokumente, die niemand gelesen hat, und Systeme, die grün leuchten, obwohl sie schweigen. Wenn Sie KI-Anbieter auswählen, ist das die Frage, die Sie stellen sollten: Wer widerspricht bei Ihnen dem, was Sie bauen?

Diese drei Schichten bauen wir auch für Unternehmen außerhalb der Softwareentwicklung. Wenn Sie interessiert, wie so ein Tag bei Ihnen aussähe, schreiben Sie mir, oder buchen Sie gleich ein 15-minütiges Erstgespräch: cal.com/transformuj.ai/30min

Der Artikel ist ursprünglich auf LinkedIn erschienen. Originalartikel auf LinkedIn

Hier beginnen

Ein 15-minütiges Erstgespräch genügt, und Sie wissen, ob es Sinn ergibt.

Sie sagen, was Ihnen unter den Nägeln brennt. Wir sagen, ob wir das können, was es ungefähr kostet und wo wir an Ihrer Stelle anfangen würden. Ohne Präsentation.

Adresse
Legerova 1820/39, Praha 2

Der Kalender wird von Cal.com (Drittanbieter) betrieben und erst nach dem Klick geladen.