OpenAI wprowadziło do aplikacji desktopowej ChatGPT głos, którym można sterować wieloma agentami naraz. Uruchamia się zadanie, przerywa je, przekłada priorytety, a to wszystko ustami.
OpenAI wprowadziło do aplikacji desktopowej ChatGPT głos, którym można sterować wieloma agentami naraz. Uruchamia się zadanie, przerywa je, przekłada priorytety, a to wszystko ustami.
Sam składam to ręcznie od kilku miesięcy i głos jest w tym najmniej interesującą częścią. Interesujące jest pytanie, które z tego wynika: skoro wszystko da się zbudować tak szybko, kto pozna, że jest źle? Pokażę jeden dzień, a na końcu odpowiedź.
Rano: dwadzieścia minut spaceru
Najlepsze zadanie dnia powstaje na dworze. Nie przy klawiaturze.
Dzień nie zaczyna się przy komputerze. Zaczyna się na dworze, ze słuchawką w uchu. Dyktuję, co chcę tego dnia zrobić, po co i czego się boję. Nie formułuję, po prostu wyrzucam to z głowy. W dwadzieścia minut spaceru powstaje z tego więcej kontekstu, niż napisałbym w godzinę, i lepszy, bo mówię pełnymi myślami.
Transkrypcja myli się na nazwiskach i liczbach, przyznaję. Ale do myślenia na głos działa lepiej niż cokolwiek, czego próbowałem.

Przedpołudnie: osiem terminali obok siebie
Osiem przebiegów naraz. Nie dlatego, że jestem szybki, ale dlatego, że nie czekam.
Przy biurku działa to już inaczej. Latami dostrajałem własne środowisko: osiem terminali obok siebie, siatka, która buduje się sama, ponad dwa tysiące linii własnej konfiguracji i pomocników, którzy pracują pod ręką. Czego mi brakowało, dopisałem sobie.
Praktyczny skutek: w jedno przedpołudnie działa pięć rzeczy naraz. Zapytanie ofertowe dla firmy logistycznej, materiał dla partnera, poprawki własnego produktu, do tego treści i wewnętrzne systemy, na których firma stoi. Nie czekam, aż jedno się skończy, żeby zacząć drugie. To nie sztuczka, to zdolność przerobowa. Jedna osoba załatwia to, do czego dawniej potrzeba było pięciu specjalistów.

Druga połowa przedpołudnia jest nudna i klient jej nigdy nie zobaczy. Na każdą rozmowę idę tak, że mam przeczytane wszystko, co do niej powstało. Przy ostatnim spotkaniu z partnerem było to sto dziewiętnaście plików, od transkrypcji pierwszej rozmowy po testowy skan jego produktu. Dzięki temu nie mówię ogólnikami, ale do konkretnego zdania, które druga strona powiedziała trzy tygodnie temu. To różnica między spotkaniem, z którego wychodzi decyzja, a spotkaniem, po którym wysyła się podsumowanie.
Nad tym próbuję teraz Orki, aplikacji, która steruje tymi terminalami jak jedną całością. Panele wreszcie o sobie wiedzą, a kontekstu między nimi nie nosi człowiek. Mam ją na razie krótko, więc żadnych dużych wniosków. Gdy będę miał za sobą tygodnie jazdy, napiszę, jak wypadła i co mi w niej przeszkadza.
Popołudnie: co realnie z tego dnia powstało
Nie ile godzin. Co z nich wyszło.
Tu widać, co ten tryb pracy realnie umożliwia. A jednocześnie dokładnie tu zaczyna się problem, z powodu którego piszę ten artykuł.

Trzy rzeczy z ostatnich kilku tygodni, nie z całego roku.
Aplikacja w pół dnia. Latem zbudowałem małą aplikację na Maca, która pilnuje spotkań. W jedną noc cztery wersje, testy z osiemnastu na pięćdziesiąt dwa, dwa niezależne audyty, ocena 9,2 na 10. Bezpłatnie i z kodem źródłowym, jako publiczna beta. Teraz stoi za nią kilkaset pobrań i przygotowuję ją na Reddit i inne społeczności, gdzie zepsuje ją więcej osób niż ja. O tym, co z tego wyjdzie, będę pisał dalej. Cała historia tej pierwszej nocy jest w artykule Pół dnia na aplikację, półtora dnia na to, żeby dało się ją oddać obcym ludziom.
Dostawca zmierzony. Zanim z jednym partnerem podpisaliśmy współpracę, przepuściłem jego usługę przez 35 prawdziwych transkrypcji z naszych rozmów. 35 z 35 bez błędu i 9,7 raza taniej niż nasz dotychczasowy model. Oni sami reklamowali 9,1 raza. Na rozmowę przyszedłem z liczbami, nie z wrażeniami. Cały pomiar wraz z metodologią jest w artykule 9,7 raza taniej niż Claude Sonnet.

Setki artykułów dla jednej klientki. System publikacji, który pisze jej głosem, a ona zatwierdza z telefonu. Artykuł za grosze, nie za tysiące. Jak jest zbudowany w całości, opisałem w artykule Państwa strona może pracować, nawet gdy Państwo śpią.
Najbardziej lubię jednak liczby, których nie podaję ja. Jeden klient, agencja marketingowa, policzył, że system oszczędza mu czterdzieści godzin miesięcznie. Tej liczby nie liczyłem ja, przyszła od niego. I właśnie takie mnie interesują, bo da się je sprawdzić w jego zestawieniu, nie w mojej prezentacji.
To nie jest o szybkości pisania. To o tym, że się nie czeka, wiele rzeczy działa naraz, a każdy wynik jest mierzony. Za tą szybkością stoi piętnaście lat projektów i ponad pięć tysięcy godzin z AI, inaczej nie wyszłoby z tego nic użytecznego.
Pierwsza wersja jest zawsze przyzwoita i do niczego. Ten artykuł wyrzuciłem trzy razy i napisałem od nowa, bo coś mi nie pasowało. Szybkość nie polega na tym, że pierwsza próba się uda. Polega na tym, że ją rozpoznam i wyrzucę jeszcze tego samego dnia.

I właśnie tu jest pytanie ze wstępu. Skoro wszystko można zbudować w jeden dzień, kto pozna, że jest źle? U mnie odpowiedź jest nudna: piętnaście lat tych samych pytań w różnych branżach. Poznaję w kilka sekund, co w piątek wieczorem się zawali, ale nie dlatego, że jestem mądrzejszy od modelu. Dlatego, że już widziałem, jak się to wali. Przy zawiasie do okularów, który nie może szarpać włosów. Przy magazynie, który nie może okłamywać księgowości. Przy bramce płatniczej, gdzie błąd liczy się w transakcjach. Model wygeneruje propozycję w kilka minut, ale nigdy sam nie powie nie wiem. Ta decyzja zostaje po stronie człowieka i da się ją podjąć szybko tylko wtedy, gdy ma się za sobą przepracowaną praktykę.
Popołudnie, druga połowa: oponent
Błąd, który krzyczy, to dobra wiadomość. Ten, który milczy, to kłopot.

A teraz ta część, którą pomija prawie każdy dostawca. Właśnie tam się traci pieniądze.
Ale po sześciu godzinach przy jednej rzeczy ślepą plamkę przeoczy nawet najbardziej doświadczony człowiek. Dlatego wszystko, co tego dnia powstało, przechodzi jeszcze przez drugi model. Nie ten sam, inny. Dostaje własne zadanie i szuka dziur. Bo jeden model nie oponuje własnej pracy. Chwali ją. Zawsze.
To nie moje wrażenie. Zapier zlecił niezależny pomiar, jak modele radzą sobie na 657 prawdziwych zadaniach firmowych, a oceniano także to, czy przestrzegają zadanych reguł. Najlepsze zeszły poniżej 50 procent. Przełożone: czołowy model wykonuje prawdziwe zadanie firmowe poprawnie i zgodnie z regułami mniej więcej w połowie przypadków. Bez drugiej kontroli tej drugiej połowy nikt nie widzi.

Obok drugiego modelu wszystko przechodzi jeszcze przez własne laboratorium QA. Szesnaście reguł, werdykt: wypuścić czy nie, bez wymówek, że tym razem wystarczy. Stronę przed wdrożeniem przepuszcza się ponadto automatycznie przez pięć szerokości ekranu, nie na oko. Potem ręczne przeklikanie i weryfikacja produkcji. Ostatnio znalazło to odnośnik prowadzący w miejsce, które na stronie nie istniało.
W tej aplikacji do spotkań wyglądało to tak. Drugi model nie zwrócił jednego ustalenia. Zwrócił cztery warunki, bez których nie powinienem był tego wypuszczać. Dwa warto opisać.
Odinstalowanie usuwało według maski nazwy. Na moim komputerze to działało. Ale ta maska mogła trafić także w aplikację kogoś innego. Poprawka polegała na sprawdzaniu identyfikatora, nie nazwy.
Gdy nie udało się wczytać kalendarza, funkcja nie zwracała błędu. Zwracała pustą listę. Aplikacja udawała, że nie ma żadnych spotkań, i spokojnie świeciła na zielono. To nie jest awaria, którą się zauważa. To jest cisza.
Najgorszy błąd to nie awaria. Najgorsza jest cisza, w której system twierdzi, że wszystko jest w porządku. I dotyczy to każdego systemu, który ktoś Państwu sprzeda. Warto pytać, kto mu oponował.

Wieczór: zapis
Ostatnia rzecz dnia jest najnudniejsza i poddaje się jej prawie każdy. Wszystko, co tego dnia zostało rozstrzygnięte i powstało, zapisuje się. Nie w głowie, w systemie. Z tych zapisów zbudowałem sobie cyfrowego bliźniaka: zna moje reguły decyzyjne i mówi mi, gdzie sobie przeczę. Czasem wcześniej niż człowiek. Następnego dnia rano nie zaczynam od zera i model też nie, bo zna kontekst wszystkich projektów, a nie średnią z internetu.
Bez tego każdy setup jest po trzech miesiącach martwym folderem. Z tym wszystko się sumuje.
Czy jest u Państwa ktoś, kto powie AI, że się myli?
Co z tego wynika, gdy nie jest się programistą
Ta myśl nie jest techniczna, chociaż artykuł tak brzmi. Jarvis to nie jeden mądry asystent. To trzy warstwy: szybkie wejście, pamięć, żeby nic się nie powtarzało, i ktoś, kto powie, że jest źle, zanim zobaczy to klient. Pierwsze dwie zdobędzie dziś każdy w jedno popołudnie. Trzecia rozstrzyga.

A tę trzecią pomija prawie każdy. Potem powstają trzydziestostronicowe dokumenty, których nikt nie czytał, i systemy, które świecą na zielono, chociaż milczą. Przy wyborze dostawcy AI to jest pytanie, które warto zadać: kto u Państwa oponuje temu, co zostanie zbudowane?
Te trzy warstwy budujemy firmom także poza programowaniem. Jeśli interesuje Państwa, jak taki dzień wyglądałby u Państwa, proszę napisać do mnie albo od razu wziąć wstępne 15 minut: cal.com/transformuj.ai/30min
Artykuł pierwotnie ukazał się na LinkedInie. Oryginalny artykuł na LinkedInie

