OpenAI pustilo do desktopové aplikace ChatGPT hlas, kterým jde řídit víc agentů najednou. Spustíte úkol, přerušíte ho, přeskládáte priority, a to všechno pusou.
OpenAI pustilo do desktopové aplikace ChatGPT hlas, kterým jde řídit víc agentů najednou. Spustíte úkol, přerušíte ho, přeskládáte priority, a to všechno pusou.
Tohle si skládám ručně už pár měsíců a hlas je na tom ta nejmíň zajímavá část. Zajímavá je otázka, která z toho plyne: když jde všechno postavit takhle rychle, kdo pozná, že je to špatně? Ukážu vám jeden den a na konci odpověď.
Ráno: dvacet minut chůze
Nejlepší zadání dne vzniká venku. Ne u klávesnice.
Den nezačíná u počítače. Začíná venku, se sluchátkem v uchu. Diktuju, co chci ten den udělat, proč a čeho se bojím. Neformuluju, jen to dostávám z hlavy ven. Za dvacet minut chůze je z toho víc kontextu, než bych za hodinu napsal, a lepší, protože mluvím v celých myšlenkách.
Přepis chybuje na jménech a číslech, to přiznávám. Ale na přemýšlení nahlas to funguje líp než cokoli, co jsem zkusil.

Dopoledne: osm terminálů vedle sebe
Osm běhů najednou. Ne proto, že jsem rychlý, ale proto, že nečekám.
U stolu už to jede jinak. Roky jsem si ladil vlastní prostředí: osm terminálů vedle sebe, mřížka, která se postaví sama, přes dva tisíce řádků vlastního nastavení a pomocníků, kteří pracují po ruce. Co mi chybělo, dopsal jsem si.
Praktický důsledek: v jednom dopoledni běží pět věcí najednou. Zadání do výběrového řízení pro logistickou firmu, podklad pro partnera, úprava vlastního produktu, k tomu obsah a interní systémy, na kterých firma stojí. Nečekám, až jedno doběhne, abych začal druhé. To není trik, to je kapacita. Jeden člověk odbaví to, na co bylo dřív potřeba pět specialistů.

Druhá polovina dopoledne je nudná a klient ji nikdy neuvidí. Na každý hovor jdu tak, že mám přečtené všechno, co k tomu vzniklo. U posledního partnerského jednání to bylo sto devatenáct souborů, od přepisu prvního callu po testovací sken jeho produktu. Díky tomu nemluvím v obecné rovině, ale ke konkrétní větě, kterou protistrana řekla před třemi týdny. To je rozdíl mezi schůzkou, ze které vypadne rozhodnutí, a schůzkou, po které se posílá shrnutí.
Nad tím teď zkouším Orcu, aplikaci, která ty terminály řídí jako jeden celek. Panely o sobě konečně vědí a kontext mezi nimi nenosí člověk. Zatím ji mám krátce, takže žádné velké závěry. Až budu mít odjeté týdny, napíšu, jak dopadla i co mi na ní vadí.
Odpoledne: co za ten den reálně vzniklo
Ne kolik hodin. Co z nich vypadlo.
Tady je vidět, co ten provoz reálně umožňuje. A zároveň přesně tady začíná ten problém, kvůli kterému článek píšu.

Tři věci z posledních pár týdnů, ne za celý rok.
Aplikace za půl dne. V létě jsem postavil malou aplikaci pro Mac, která hlídá schůzky. Za noc čtyři verze, testy z osmnácti na dvaapadesát, dva nezávislé audity, hodnocení 9,2 z 10. Zdarma i se zdrojovým kódem, jako veřejná beta. Teď je za ní několik stovek stažení a chystám ji na Reddit a další komunity, kde ji rozbije víc lidí než já. O tom, co z toho vypadne, budu psát dál. Celý příběh té první noci je v článku Půl dne na appku, den a půl na to, aby ji šlo dát cizím lidem.
Přeměřený dodavatel. Než jsme s jedním partnerem podepsali spolupráci, protáhl jsem jeho službu 35 reálnými přepisy z našich hovorů. 35 z 35 bez chyby a 9,7krát levněji než náš dosavadní model. Oni sami inzeroval 9,1krát. Na call jsem přišel s čísly, ne s dojmy. Celé měření i s metodikou je v článku 9,7x levněji než Claude Sonnet.

Stovky článků pro jednu klientku. Publikační systém, který píše jejím hlasem, ona schvaluje z mobilu. Článek za koruny, ne za tisíce. Jak je celý postavený, jsem rozebral v článku Váš web může pracovat, i když spíte.
Nejraději mám ale čísla, která neříkám já. Jeden klient, marketingová agentura, si spočítal, že mu systém šetří čtyřicet hodin měsíčně. To číslo jsem nepočítal, přišlo od něj. A přesně takové mě zajímá, protože se dá ověřit v jeho výkazu, ne v mojí prezentaci.
Tohle není o rychlosti psaní. Je to o tom, že se nečeká, běží víc věcí najednou a každý výstup se měří. Za tou rychlostí je patnáct let projektů a přes pět tisíc hodin s AI, jinak by z toho nevypadlo nic použitelného.
První verze je vždycky slušná a k ničemu. Tenhle článek jsem třikrát zahodil a napsal znovu, protože mi něco nesedělo. Rychlost není v tom, že první pokus vyjde. Je v tom, že ho poznám a zahodím ještě týž den.

A přesně tady je ta otázka z úvodu. Když jde všechno postavit za den, kdo pozná, že je to špatně? U mě je odpověď nudná: patnáct let stejných otázek v různých oborech. Poznám za vteřiny, co v pátek večer spadne, ale ne proto, že bych byl chytřejší než model. Proto, že jsem to už viděl spadnout. U pantu k brýlím, který nesmí tahat vlasy. U skladu, který nesmí lhát účetnictví. U platební brány, kde se chyba počítá v transakcích. Model návrh vygeneruje za minuty, ale nikdy sám neřekne nevím. To rozhodnutí zůstává na člověku a jde udělat rychle jen tehdy, když má za sebou odpracovanou praxi.
Odpoledne, druhá půlka: oponent
Chyba, která zařve, je dobrá zpráva. Ta, která mlčí, je průšvih.

A teď ta část, kterou skoro každý dodavatel vynechá. Přesně tam se prodělává.
Jenže po šesti hodinách u jedné věci přehlédne slepé místo i ten nejzkušenější člověk. Proto všechno, co ten den vzniklo, projde ještě druhým modelem. Ne stejným, jiným. Dostane vlastní zadání a hledá díry. Protože jeden model si svoji práci neoponuje. Pochválí ji. Vždycky.
Není to můj dojem. Zapier nechal nezávisle změřit, jak si modely vedou na 657 reálných firemních úlohách, a hodnotilo se i to, jestli dodrží zadaná pravidla. Nejlepší se dostaly pod 50 procent. Přeloženo: špičkový model udělá reálnou firemní úlohu správně a podle pravidel zhruba v polovině případů. Bez druhé kontroly tu druhou polovinu nikdo nevidí.

Vedle druhého modelu jde všechno ještě přes vlastní QA laboratoř. Šestnáct pravidel, verdikt pustit ven nebo ne, bez výmluv, že tentokrát to stačí. Web se navíc před nasazením projede na pěti šířkách automaticky, ne okem. Pak ruční proklik a ověření produkce. Naposledy to našlo odkaz vedoucí na místo, které na stránce neexistovalo.
U té aplikace na schůzky to vypadalo takhle. Druhý model nevrátil jeden nález. Vrátil čtyři podmínky, bez kterých jsem to neměl pouštět ven. Dvě stojí za popsání.
Odinstalace mazala podle masky názvu. Na mém počítači to sedělo. Jenže ta maska mohla trefit i aplikaci někoho jiného. Oprava byla ověřit identifikátor, ne jméno.
Když se nepovedlo načíst kalendář, funkce nevrátila chybu. Vrátila prázdný seznam. Aplikace se tvářila, že žádné schůzky nemáte, a klidně si svítila zeleně. To není pád, kterého si všimnete. To je ticho.
Nejhorší chyba není pád. Nejhorší je ticho, kdy systém tvrdí, že je všechno v pořádku. A tohle platí pro každý systém, který vám kdo prodá. Ptejte se, kdo mu oponoval.

Večer: zápis
Poslední věc dne je nejnudnější a vzdá ji skoro každý. Všechno, co se ten den rozhodlo a vzniklo, se zapíše. Ne do hlavy, do systému. Z těch zápisů jsem si postavil digitální dvojče: zná moje rozhodovací pravidla a řekne mi, kde si protiřečím. Občas dřív než člověk. Druhý den ráno nezačínám od nuly a model taky ne, protože zná kontext všech projektů, ne průměr z internetu.
Bez toho je z každého setupu za tři měsíce mrtvá složka. S tím se to sčítá.
Máte u sebe někoho, kdo vaší AI řekne, že se plete?
Co si z toho vzít, když nejste vývojář
Ta myšlenka technická není, i když článek tak zní. Jarvis není jeden chytrý asistent. Jsou to tři vrstvy: rychlý vstup, paměť, aby se nic neopakovalo, a někdo, kdo řekne, že je to blbě, dřív než to uvidí klient. První dvě si dnes pořídí každý za odpoledne. Ta třetí rozhoduje.

A tu třetí vynechává skoro každý. Pak vznikají třicetistránkové dokumenty, které nikdo nečetl, a systémy, které svítí zeleně, i když mlčí. Až budete vybírat dodavatele AI, tohle je ta otázka, kterou položte: kdo u vás oponuje tomu, co postavíte?
Tyhle tři vrstvy stavíme firmám i mimo vývoj. Když vás zajímá, jak by takový den vypadal u vás, napište mi, nebo si rovnou si vezměte úvodních 15 minut: cal.com/transformuj.ai/30min
Článek původně vyšel na LinkedInu. Původní článek na LinkedInu

