PRZECZYTAJ STRESZCZENIE ×

Nie każdy problem wymaga ChatGPT: przy mailach, leadach i ticketach często wystarczy szybki model decyzyjny do klasyfikacji, scoringu i routingu. W demo Jeff odpowiadał w 0,4 s, a klasyczny model w 23 s, co może ograniczyć koszty i opóźnienia. Zacznij od 100-200 historycznych wiadomości, ustal kryteria, próg pewności i kontrolę człowieka. Najpierw testuj jeden proces, dbając o błędy, uprawnienia i prywatność danych.

Przez długi czas widziałem ten sam błąd u siebie i u ludzi, z którymi rozmawiam o automatyzacji: próbujemy rozwiązać każdy problem wielkim modelem językowym. A potem jesteśmy zdziwieni, że coś działa wolno, kosztuje za dużo i produkuje odpowiedzi długie jak instrukcja składania szafy, chociaż tak naprawdę potrzebowaliśmy tylko prostego „tak”, „nie” albo „priorytet 8/10”.

Ja to szczególnie mocno zauważyłem przy pracy z mailami, zgłoszeniami i różnymi inboxami. Jeśli dziennie wpada Ci kilkadziesiąt albo kilkaset wiadomości, to nie potrzebujesz poety. Potrzebujesz bardzo szybkiego portiera, który stoi przy drzwiach i mówi: „to ważne”, „to spam”, „to do sprzedaży”, „to do supportu”, „to można olać na razie”.

[https://www.youtube.com/watch?v=$](https://www.youtube.com/watch?v=$){videoId}

I właśnie dlatego zainteresował mnie model decyzyjny taki jak Jeff od TypeSafe. Nie dlatego, że ma zastąpić ChatGPT. Wręcz przeciwnie. Dla mnie to jest dowód, że w AI zaczyna wygrywać specjalizacja. Zamiast jednego młotka do wszystkiego, dostaję osobne narzędzie do klasyfikacji, scoringu i priorytetyzacji. To ma sens biznesowy, bo nie płacę za gadanie, kiedy potrzebuję tylko werdyktu.

Jeśli chcesz wdrożyć coś podobnego u siebie, to pokażę Ci, jak ja na to patrzę: gdzie taki model ma sens, gdzie nie ma, na co uważać i jak nie zrobić sobie automatyzacji, która wygląda mądrze, a psuje robotę po cichu.

Problem nie leży w modelu. Problem leży w źle postawionym zadaniu

Największy przełom, jaki zauważyłem w pracy z AI, nie polegał na odkryciu „najmądrzejszego” modelu. Chodziło raczej o to, że przestałem zadawać modelom pytania, których nie powinny dostawać.

Jeśli pytam klasycznego LLM-a o ocenę maila, to on często chce mi pisać uzasadnienie, kontekst, wyjątki, a czasem jeszcze dorzuci własną twórczość. To jest fajne, gdy robię research albo tworzę treść. Ale jeśli moim celem jest tylko ustalenie, czy wiadomość jest pilna i do kogo ją przypisać, to taki model jest jak tir wysłany po bułki.

W modelach decyzyjnych podoba mi się właśnie ta prostota. Daję kryteria, wrzucam tekst i odbieram wynik: etykietę, procent, ocenę od 1 do 10 albo decyzję „tak/nie”. Bez ornamentów. Bez eseju. Bez pół strony JSON-a, w którym najważniejsza informacja siedzi zakopana jak skarpeta pod łóżkiem nastolatka.

W pokazanym porównaniu Jeff miał odpowiedzieć w 0,4 sekundy, a klasyczny model Sol w 23 sekundy. Nawet jeśli potraktuję takie demo ostrożnie, bo marketing lubi sobie zaokrąglać rzeczy w swoją stronę, to sama idea jest bardzo sensowna: jeśli zawężysz problem do klasyfikacji, możesz dostać ogromny zysk na czasie i koszcie.

Ja zawsze wolę patrzeć na modele przez liczby, a nie przez hasła z landing page’a. Dlatego polecam Ci ten tekst, jeśli chcesz porównywać accuracy, koszt błędu i realną przepustowość zamiast zachwycać się samą obietnicą szybkości.

Kliknij, aby przeczytać artykuł: Claude Fable 5 już jest. Co ten model naprawdę zmienia dla freelancerów, zespołów i budżetów AI?

Gdzie taki model daje mi realną przewagę

Ja widzę największy sens tam, gdzie mam dużo krótkich decyzji do podjęcia i gdzie odpowiedź musi być spójna. Nie genialna. Nie kreatywna. Po prostu wystarczająco dobra, szybka i tania.

W praktyce najczęściej myślę o takich zastosowaniach:

  • sortowanie maili: czy to lead, spam, partnerstwo, support czy wiadomość „do przeczytania kiedyś”;
  • priorytetyzacja ticketów: skala od 1 do 10, poziom frustracji klienta, pilność reakcji;
  • ocena leadów sprzedażowych: czy temat pasuje do oferty i czy warto w ogóle go ruszać;
  • filtrowanie newsów i treści: czy to jest istotne dla mojej niszy, czy tylko kolejny szum;
  • routing w zespole: do kogo ma trafić sprawa, żeby nie odbijała się jak piłeczka od ściany do ściany.

To jest ten rodzaj roboty, który zjada mnóstwo energii, chociaż pojedynczo wydaje się błahy. Jedna decyzja trwa chwilę. Sto takich decyzji dziennie zamienia się w bagno.

Jeśli do tego dochodzi system agentowy, robi się jeszcze ciekawiej. Wspomniany Radar działał tak, że uruchamiał 9 agentów równolegle, zbierał wyniki z wielu źródeł, a potem warstwa decyzyjna ustalała znaczenie zadań i nadawała im priorytet od 1 do 10. Dla mnie to jest bardzo sensowny kierunek: niech różne agenty zbierają dane, ale ktoś musi jeszcze powiedzieć, co z tego naprawdę wymaga uwagi. I właśnie tam model decyzyjny robi porządek.

To nie jest magia. To jest dobrze ustawiony bramkarz

Ludzie często patrzą na AI tak, jakby każda automatyzacja miała być małym geniuszem. Ja wolę patrzeć bardziej przyziemnie. W wielu firmach nie potrzebuję geniusza. Potrzebuję dobrego bramkarza na wejściu.

Taki model nie musi pisać pięknych odpowiedzi ani analizować świata jak filozof po trzech kawach. On ma rozpoznać wzorzec i podjąć prostą decyzję według reguł, które mu podałem. Jeśli robi to szybko i stabilnie, to już daje ogromną wartość.

W moim przypadku najlepiej sprawdza się myślenie warstwowe. Na pierwszej linii stoi tani i szybki klasyfikator. On filtruje, oznacza, nadaje priorytet. Dopiero później, jeśli coś przekroczy próg ważności, odpalam cięższy model do głębszej analizy albo do wygenerowania odpowiedzi. Dzięki temu nie przepalam budżetu na rzeczy, które od początku były mało istotne.

To jest trochę jak z ochroniarzem w klubie. Nie zapraszasz właściciela lokalu do sprawdzania każdego dowodu przy wejściu. Najpierw ktoś odsiewa oczywiste przypadki, a dopiero trudniejsze sprawy idą wyżej.

Jeśli chcesz budować takie warstwy rozsądnie, to koniecznie przeczytaj o human in the loop. Ja się już nauczyłem, że automatyzacja bez miejsca na korektę człowieka wcześniej czy później zaczyna podejmować głupie decyzje z bardzo poważną miną.

Kliknij, aby przeczytać artykuł: Human in the loop w agentach AI: jak zbudować automatyzację, która nie psuje biznesu

Gdzie sam bym uważał, zanim podłączę to do firmy

Tu zaczyna się ta mniej sexy część, ale właśnie ona decyduje, czy wdrożenie ma sens. Bo szybkość to jedno, a jakość decyzji to drugie.

Jeśli model decyzyjny źle oceni frustrację klienta, priorytet zgłoszenia albo ryzyko oszustwa, to automatyzacja nie oszczędza czasu. Ona tylko szybciej dostarcza problem pod właściwy adres. I robi to na skalę.

Dlatego ja nigdy nie wdrażałbym czegoś takiego na zasadzie: podpinam API i liczę, że będzie dobrze. Najpierw potrzebuję zestawu kryteriów, potem próbki danych, potem testów na historycznych wiadomościach, a na końcu mechanizmu korekty. Muszę wiedzieć, kiedy model się myli, w jakich przypadkach się myli i ile kosztuje mnie ta pomyłka.

Właśnie dlatego ostrożnie podchodzę do deklaracji typu „200 razy szybciej” albo „400-440 razy taniej”. To mogą być prawdziwe liczby dla bardzo konkretnego typu zadań klasyfikacyjnych. Ale dla mnie finalny koszt wdrożenia zawsze obejmuje też konfigurację, poprawki, monitoring, wyjątki i czas człowieka, który to potem ogarnia. Sam abonament czy koszt zapytania to tylko wierzchołek góry lodowej. A pod wodą siedzi cała reszta, zębami do góry.

Bezpieczeństwo i prywatność: temat nudny tylko do pierwszego wycieku

Jeśli taki model ma czytać maile, leady, tickety albo dane z CRM-a, to od razu zapala mi się lampka. Nie dlatego, że jestem paranoikiem. Po prostu widziałem już zbyt wiele wdrożeń robionych na hurra, gdzie sekret API leżał w złym miejscu, uprawnienia były zbyt szerokie, a nikt nie wiedział, co dzieje się z danymi po drodze.

Jeśli planujesz własne środowisko, pojawia się temat VPS-a, integracji przez API, konfiguracji narzędzi typu OpenClaw czy Hermes i sensownego ograniczenia dostępu. Wspomniane przykłady mówiły nawet o tanim VPS-ie za 23 zł miesięcznie albo mocniejszym planie za 35 zł, z konfiguracją rzędu 2 rdzeni, 8 GB RAM i 100 GB przestrzeni. Fajnie, że wejście jest tanie. Tylko ja bym nigdy nie oceniał projektu po cenie serwera, bo najdroższa bywa nieuwaga.

Dla mnie zasada jest prosta: agent ma widzieć tylko to, co naprawdę musi widzieć. Minimum danych, minimum uprawnień, sensowna retencja, kontrola logów i zero wrzucania w taki system rzeczy, których sam nie chciałbym przypadkiem wyświetlić obcej osobie na ekranie podczas prezentacji.

Jeśli grzebiesz przy agentach, API i danych klientów, to ten temat przestaje być dodatkiem. Ja polecam ten artykuł, bo porządkuje kwestie uprawnień, retencji danych i zabezpieczenia wdrożenia, zanim zrobisz sobie kłopot na własne życzenie.

Kliknij, aby przeczytać artykuł: Agent AI i wyciek sekretów: jak zabezpieczyć kod, repozytorium i wdrożenie, zanim będzie za późno

Jak ja bym to wdrożył bez pakowania się w chaos

Gdybym dziś stawiał taki system od zera, nie zaczynałbym od wielkiej architektury. Najpierw wybrałbym jeden proces, który boli mnie najbardziej. Na przykład klasyfikację maili przychodzących albo priorytetyzację ticketów supportowych.

Potem zrobiłbym prosty eksperyment na danych historycznych. Biorę 100-200 prawdziwych wiadomości, ręcznie oznaczam oczekiwany wynik i dopiero wtedy sprawdzam, jak model sobie radzi. Nie obchodzi mnie wtedy, czy wygląda nowocześnie. Obchodzi mnie, ile razy trafia dobrze i w których miejscach odpływa.

Dopiero po takim teście przeszedłbym do integracji przez API i stopniowego wpuszczania ruchu. Najpierw tylko rekomendacje dla mnie albo dla zespołu. Potem półautomatyczne przekierowanie. Na końcu pełna automatyzacja tylko tam, gdzie ryzyko błędu jest niskie albo dobrze opanowane.

  • Zdefiniowałbym 3-5 kryteriów decyzji, bez rozmywania tematu.
  • Przetestowałbym model na historycznych danych i policzył najczęstsze błędy.
  • Ustawiłbym próg pewności, poniżej którego decyzja trafia do człowieka.
  • Dopiero potem podłączyłbym automatyczne akcje: tagowanie, routing, priorytet lub odrzucenie.

To podejście jest mniej widowiskowe niż wrzucenie wszystkiego do jednego agenta, ale za to działa. A ja już dawno przestałem mieć słabość do automatyzacji, które świetnie wyglądają na diagramie, a potem rozbijają się o pierwszy poniedziałek o 8:13.

Jeśli chcesz uczciwie policzyć, ile naprawdę kosztuje takie wdrożenie poza samym API, to ten materiał dobrze sprowadza na ziemię. Ja lubię takie liczby, bo od razu widać, czy oszczędzasz, czy tylko przenosisz koszt w inne miejsce.

Kliknij, aby przeczytać artykuł: Agent głosowy AI bez kodowania: szybki start to dopiero początek biznesu

Co teraz powinieneś zrobić?

Ja patrzę na takie modele bardzo pragmatycznie: nie mają zachwycać, tylko odciążać. Jeśli AI potrafi w ułamku sekundy powiedzieć mi, co jest ważne, a co nie, to kupuję ten kierunek. Nie dlatego, że to futurystyczne, tylko dlatego, że szkoda mi życia na ręczne przesiewanie cyfrowego gruzu.

Jednocześnie nie daję się uwieść samym hasłom o szybkości i taniości. Dla mnie liczy się cały układ: trafność decyzji, koszt błędu, bezpieczeństwo danych i to, czy człowiek nadal ma kontrolę tam, gdzie naprawdę trzeba ją mieć. Właśnie wtedy taka technologia przestaje być zabawką i zaczyna pracować na biznes.

Jeśli dziś miałbym dać Ci jedną radę, to nie pytaj najpierw „jaki model wybrać?”, tylko „jakie proste decyzje podejmuję codziennie setki razy?”. Tam zwykle leży największa dźwignia.

  • Nie każdy problem wymaga klasycznego LLM-a i długiej odpowiedzi.
  • Modele decyzyjne mają sens tam, gdzie liczy się szybka klasyfikacja, scoring i routing.
  • Demo z czasem 0,4 s kontra 23 s jest ciekawe, ale ja i tak sprawdziłbym wszystko na własnych danych.
  • Największe ryzyko nie leży w samym modelu, tylko w błędnych decyzjach, złych uprawnieniach i braku kontroli jakości.
  • Najlepsze wdrożenia zaczynają się od jednego procesu, małego testu i stopniowego zwiększania automatyzacji.

Next Step: wybierz jeden typ wiadomości, który dziś ręcznie sortujesz, i spisz 3 konkretne etykiety oraz 3 kryteria decyzji, jakich używasz w głowie. To wystarczy, żeby zacząć budować pierwszą sensowną warstwę decyzyjną.

A u Ciebie gdzie jest największy chaos: w mailach, leadach, ticketach czy może w zalewie treści do ogarnięcia?