lukxban.

Szkoła świadomego właściciela produktu

Harness

Nie musisz być programistą, żeby prowadzić profesjonalny produkt AI.

Po przejściu tej ścieżki nie będziesz pisał całego systemu sam. Będziesz wiedział, jakie decyzje należą do Ciebie, co oddelegować AI i po czym poznać, że praca została wykonana dobrze.

Zacznij od kontraktu
7lekcji
90 minutwe własnym tempie
bez kodowaniadecyzje i dowody

00 / Twoja nowa rola

Nie musisz zastępować programisty. Masz prowadzić jakość.

01

Ty definiujesz rezultat

Mówisz, co ma być prawdą dla użytkownika i czego system nigdy nie może zrobić.

02

AI wykonuje pracę

Przygotowuje specyfikację, kod, testy, analizę błędów i dokumentację.

03

Dowód zamyka zadanie

Build, test, log, zrzut lub odpowiedź systemu potwierdzają wynik. Sam komunikat nie wystarcza.

Twoja przewaga nie polega na tym, że znasz składnię. Polega na tym, że potrafisz nazwać właściwy rezultat, granicę ryzyka i wymagany dowód.
01

Matt Pocock

Kontrakty zamiast domysłów

Skąd system wie, że dostał poprawne dane i konfigurację?

Zasada

Typ opisuje oczekiwany kształt. Walidacja sprawdza, czy rzeczywistość naprawdę do niego pasuje.

Po ludzku

Program nie powinien zgadywać, czy dostał adres bazy, właściwy klucz albo zgodę użytkownika. Ma sprawdzić to na wejściu i zatrzymać się, jeśli coś się nie zgadza.

Wyobraź to sobie

Lista pasażerów nie dowodzi, że wszyscy weszli do samolotu. Potrzebna jest kontrola przy bramce. TypeScript tworzy listę, a walidacja sprawdza obecność.

Tak wygląda to w AIOS Brain

  • Staging nie uruchomi się z adresem produkcyjnej bazy.
  • Narzędzie zwraca jeden z jawnych stanów: wykonano i sprawdzono, potrzebna zgoda albo błąd.
  • Każdy agent otrzymuje user_id, module_id i dozwolony zakres kontekstu.

Twoje decyzje

  • Jakie stany wyniku są dopuszczalne?
  • Które braki mają zatrzymać system?
  • Które działania zawsze wymagają zgody?

Praca dla AI

  • Tworzy schematy Zod i typy TypeScript.
  • Dodaje walidację zmiennych środowiskowych.
  • Pisze testy odrzucające błędne wejścia.

Dowód wykonania

  • Build celowo nie przechodzi bez wymaganej konfiguracji.
  • Test pokazuje, że staging odrzuca produkcyjny adres.
  • Każdy wynik narzędzia ma status i identyfikator dowodu.

Prompt do użycia w AIOS Brain

Zmapuj granice danych tej funkcji. Dla każdej podaj schemat wejścia, możliwe wyniki, warunki zatrzymania i test negatywny. Nie implementuj, dopóki kontrakt nie będzie jednoznaczny.

Sprawdź rozumienie

TypeScript pokazuje, że DATABASE_URL ma typ string. Czy to dowodzi, że zmienna istnieje na serwerze?

02

Kent C. Dodds

Testuj zachowanie, nie liczbę linijek

Jak sprawdzić, czy produkt naprawdę działa dla użytkownika?

Zasada

Największą pewność dają testy obejmujące współpracę kilku części systemu, uzupełnione małą liczbą krytycznych testów od początku do końca.

Po ludzku

Nie chodzi o tysiąc drobnych testów. Chodzi o potwierdzenie całej ważnej historii: użytkownik pisze, agent rozumie kontekst, wybiera narzędzie, wykonuje zadanie i pokazuje prawdziwy rezultat.

Wyobraź to sobie

Możesz osobno sprawdzić silnik, hamulce i światła. Klient nadal potrzebuje jazdy próbnej całym samochodem.

Tak wygląda to w AIOS Brain

  • Test integracyjny sprawdza chat, bazę, RAG i zapis historii razem.
  • Playwright przechodzi krytyczne ścieżki tak jak użytkownik.
  • RLS jest testowane na prawdziwej bazie stagingowej, nie tylko przez mock.

Twoje decyzje

  • Jakie trzy historie użytkownika są krytyczne?
  • Jaki błąd niszczy zaufanie do produktu?
  • Co musi działać przed każdym wdrożeniem?

Praca dla AI

  • Pisze testy jednostkowe dla czystej logiki.
  • Buduje testy integracyjne dla pełnych przepływów.
  • Automatyzuje kilka najważniejszych ścieżek E2E.

Dowód wykonania

  • Raport pokazuje nazwę i wynik każdej krytycznej ścieżki.
  • Test potrafi wykryć celowo wprowadzony błąd.
  • Wdrożenie jest blokowane, gdy krytyczny test nie przechodzi.

Prompt do użycia w AIOS Brain

Zaprojektuj Testing Trophy dla tej funkcji. Zacznij od zachowania użytkownika. Wskaż testy statyczne, jednostkowe, integracyjne i maksymalnie dwa E2E. Uzasadnij, jaki rodzaj ryzyka łapie każdy test.

Sprawdź rozumienie

Który test daje najlepszy dowód, że użytkownik odzyska kontekst rozmowy z Telegrama w aplikacji webowej?

03

Hamel Husain i Shreya Shankar

Evale są testami jakości AI

Jak mierzyć odpowiedzi, które za każdym razem mogą wyglądać trochę inaczej?

Zasada

Najpierw analizujesz prawdziwe błędy, potem tworzysz z nich zestaw przypadków i dopiero wtedy mierzysz poprawę.

Po ludzku

Klasyczny test wie, czy dwa plus dwa daje cztery. Eval sprawdza bardziej ludzkie kryteria: czy odpowiedź użyła właściwego kontekstu, podała źródło, wykonała zadanie i nie zmyśliła rezultatu.

Wyobraź to sobie

To nie egzamin z jedną odpowiedzią. To karta oceny rozmowy sprzedażowej: kilka kryteriów, przykłady dobrych i złych zachowań oraz człowiek kalibrujący ocenę.

Tak wygląda to w AIOS Brain

  • Każdy agent ma własny zestaw realnych scenariuszy regresyjnych.
  • Błędy trafiają do taksonomii, a nie do folderu z przypadkowymi promptami.
  • Zmiana modelu lub promptu jest porównywana z poprzednią wersją.

Twoje decyzje

  • Jak wygląda dobra odpowiedź w tym zadaniu?
  • Które błędy są krytyczne, a które tylko irytujące?
  • Jaki minimalny wynik pozwala wdrożyć zmianę?

Praca dla AI

  • Buduje zestaw evali z realnych przypadków.
  • Grupuje porażki według przyczyn.
  • Uruchamia porównanie starej i nowej wersji.

Dowód wykonania

  • Każdy scenariusz ma oczekiwane zachowanie i kryteria oceny.
  • Raport pokazuje regresje, nie tylko średnią ocenę.
  • Ocena automatyczna jest okresowo porównywana z oceną człowieka.

Prompt do użycia w AIOS Brain

Zbuduj pierwszy eval set dla tego agenta na podstawie 20 realnych zadań. Najpierw zaproponuj taksonomię błędów i rubrykę oceny. Nie używaj jednej ogólnej oceny jakości.

Sprawdź rozumienie

Agent uzyskał średnio 92 procent, ale dwa razy wysłał wiadomość bez zgody. Czy może wejść na produkcję?

04

Simon Willison

Przerwij niebezpieczne połączenie

Kiedy agent z dostępem do danych staje się realnym zagrożeniem?

Zasada

Największe ryzyko powstaje, gdy jeden agent widzi prywatne dane, czyta niezaufaną treść i może wysyłać informacje na zewnątrz.

Po ludzku

Złośliwa instrukcja może być ukryta w mailu, dokumencie albo stronie. Model może potraktować ją jak polecenie. Sam lepszy prompt nie jest wystarczającą barierą.

Wyobraź to sobie

Nie dajesz jednej osobie klucza do sejfu, prawa do czytania anonimowych poleceń i możliwości wysyłania paczek bez kontroli.

Tak wygląda to w AIOS Brain

  • Dostęp do danych jest ograniczony przez module_id i RLS przed wywołaniem modelu.
  • Narzędzia zapisu mają poziom ryzyka i bramkę zatwierdzenia.
  • Agent czytający niezaufane treści nie otrzymuje nieograniczonej komunikacji wychodzącej.

Twoje decyzje

  • Jakie dane są prywatne lub wrażliwe?
  • Które źródła są niezaufane?
  • Jakie działania zewnętrzne mają wymagać zatwierdzenia?

Praca dla AI

  • Tworzy threat model dla funkcji.
  • Klasyfikuje narzędzia według ryzyka.
  • Pisze testy odmowy dostępu i prób prompt injection.

Dowód wykonania

  • Test pokazuje odmowę dostępu do obcego modułu.
  • Wysokie ryzyko nie może ominąć approval gate.
  • Audit log zapisuje próbę oraz ostateczną decyzję.

Prompt do użycia w AIOS Brain

Przeprowadź threat model tej funkcji metodą Lethal Trifecta. Zmapuj prywatne dane, niezaufane wejścia i kanały wyjściowe. Zaproponuj zmianę architektury, która przerywa co najmniej jedno połączenie.

Sprawdź rozumienie

Agent czyta maile klientów, widzi CRM i może sam wysyłać wiadomości. Co jest właściwą ochroną?

05

Anthropic Engineering

Workflow przed agentem

Kiedy potrzebujesz autonomii, a kiedy zwykłego procesu?

Zasada

Jeśli znasz kolejne kroki, zapisz je w kodzie. Agent jest potrzebny tam, gdzie droga zależy od nieprzewidywalnej sytuacji.

Po ludzku

Agent brzmi atrakcyjnie, ale kosztuje więcej, działa wolniej i trudniej go przewidzieć. Faktura, usunięcie danych lub wysłanie maila powinny przejść przez określony proces, nawet jeśli AI pomaga podjąć część decyzji.

Wyobraź to sobie

Pociąg jedzie po torach, gdy cel i trasa są znane. Terenówka ma sens dopiero tam, gdzie drogi naprawdę nie ma.

Tak wygląda to w AIOS Brain

  • Import pliku jest deterministycznym pipeline z retry i idempotency.
  • Model klasyfikuje intencję, ale kod sprawdza uprawnienia i wykonuje mutację.
  • Agent-builder może proponować, lecz użytkownik zatwierdza utworzenie i harmonogram agenta.

Twoje decyzje

  • Gdzie elastyczność modelu tworzy realną wartość?
  • Gdzie rezultat musi być zawsze przewidywalny?
  • Jaki jest maksymalny koszt i czas wykonania?

Praca dla AI

  • Rozpisuje proces na kroki deterministyczne i probabilistyczne.
  • Dodaje retry, timeout oraz idempotency key.
  • Ogranicza liczbę narzędzi dostępnych agentowi.

Dowód wykonania

  • Diagram pokazuje, które decyzje podejmuje model, a które kod.
  • Ponowne uruchomienie nie wykonuje tej samej mutacji drugi raz.
  • Przekroczenie czasu lub budżetu kończy zadanie kontrolowanym błędem.

Prompt do użycia w AIOS Brain

Rozdziel ten proces na workflow i decyzje modelu. Wszystkie znane kroki zapisz deterministycznie. Autonomię zostaw tylko tam, gdzie nie da się z góry opisać właściwej ścieżki.

Sprawdź rozumienie

Który element powinien być deterministycznym workflow?

06

Charity Majors i OpenTelemetry

Zobacz całą drogę zadania

Jak znaleźć przyczynę błędu, którego wcześniej nie przewidziałeś?

Zasada

Każde wykonanie powinno zostawiać spójny ślad od intencji użytkownika do zweryfikowanego rezultatu.

Po ludzku

Gdy agent zawiedzie, nie wystarczy informacja, że API zwróciło błąd. Musisz zobaczyć: jaki agent działał, jaki miał zakres, co pobrał, jakie narzędzie wybrał, ile to kosztowało i gdzie dokładnie zatrzymał się proces.

Wyobraź to sobie

Numer przesyłki pozwala prześledzić całą drogę paczki. Trace ID robi to samo z zadaniem agenta.

Tak wygląda to w AIOS Brain

  • Jeden trace_id łączy chat, retrieval, model, narzędzia, Inngest i finalną weryfikację.
  • Każdy agent_run zapisuje wersję promptu, modelu i użytych źródeł.
  • Logi nie przechowują sekretów ani pełnej treści wrażliwych danych.

Twoje decyzje

  • Jakie pytania chcesz móc zadać po awarii?
  • Które dane wolno logować?
  • Jak długo przechowujemy ślady wykonania?

Praca dla AI

  • Dodaje trace i span do kolejnych etapów.
  • Buduje dashboard kosztu, czasu i skuteczności agentów.
  • Redaguje wrażliwe pola przed zapisem.

Dowód wykonania

  • Z jednego trace_id można odtworzyć pełną historię zadania.
  • Dashboard rozdziela wyniki według agenta, modelu i środowiska.
  • Test potwierdza, że sekret nie trafia do logów.

Prompt do użycia w AIOS Brain

Zaprojektuj ślad wykonania dla tego agent_run. Pokaż span dla retrieval, wywołania modelu, każdego narzędzia, approval i verification. Wskaż pola, które trzeba zredagować ze względu na prywatność.

Sprawdź rozumienie

Co jest najlepszym punktem startu po zgłoszeniu: agent czasem odpowiada źle?

07

Google SRE i Martin Fowler

Reguły architektury muszą działać automatycznie

Skąd wiesz, że system jest gotowy do dalszego rozwoju?

Zasada

Ustal poziom niezawodności, mierz go i zamień najważniejsze decyzje architektoniczne w automatyczne testy.

Po ludzku

Dokument z zasadami jest dobrym początkiem. Profesjonalny system sam blokuje zmianę, która łamie izolację danych, używa produkcyjnego klucza na stagingu albo pozwala narzędziu ominąć zatwierdzenie.

Wyobraź to sobie

Przepisy budowlane są skuteczne dopiero wtedy, gdy konstrukcja przechodzi pomiary i odbiór. Sama deklaracja architekta nie utrzyma budynku.

Tak wygląda to w AIOS Brain

  • SLO obejmują dostępność, czas pierwszego tokenu, skuteczność agent_run i opóźnienie kolejki.
  • Error budget określa, kiedy zatrzymujemy nowe funkcje i naprawiamy niezawodność.
  • Fitness functions sprawdzają RLS, module_id, approval, staging isolation i verification.

Twoje decyzje

  • Jaki poziom jakości obiecujesz użytkownikowi?
  • Które naruszenie blokuje wszystkie wdrożenia?
  • Kiedy zespół przestaje rozwijać funkcje i naprawia fundament?

Praca dla AI

  • Automatyzuje SLI i raport SLO.
  • Tworzy fitness functions dla reguł architektury.
  • Przygotowuje rollback, runbook i szablon postmortem.

Dowód wykonania

  • Dashboard pokazuje aktualne SLO i pozostały error budget.
  • Złamanie inwariantu blokuje merge lub deploy.
  • Rollback został przećwiczony, a nie tylko opisany.

Prompt do użycia w AIOS Brain

Zamień zasady tej funkcji na mierzalne SLI, jedno realistyczne SLO i automatyczne fitness functions. Dodaj warunek zatrzymania wdrożeń oraz procedurę rollbacku.

Sprawdź rozumienie

System przekroczył error budget przez powtarzające się błędy. Co robimy?

Plan zastosowania

Nie ucz się wszystkiego naraz. Przeprowadź jeden przepływ przez całą pętlę.

Tydzień 101

Zamknij kontrakty

Wybierz jeden przepływ AIOS Brain. Opisz oczekiwany rezultat, granice danych, stany wyniku oraz działania wymagające zgody.

Tydzień 202

Zdefiniuj dowody

Wskaż trzy krytyczne historie użytkownika. Dla każdej określ test, eval i dowód zamykający zadanie.

Tydzień 303

Przerwij ryzyko

Zrób threat model Lethal Trifecta. Rozdziel dostęp do danych, niezaufane wejścia i komunikację zewnętrzną.

Tydzień 404

Uruchom pętlę jakości

Podłącz trace, wybierz pierwsze SLO i ustal jedną fitness function, która automatycznie blokuje złamanie architektury.

Słownik operatora

Dwanaście pojęć, które wystarczą do prowadzenia rozmowy technicznej.

Kontrakt
Jawna umowa o tym, jakie dane wchodzą, co może się wydarzyć i jaki wynik wychodzi.
Walidacja
Sprawdzenie, czy prawdziwe dane spełniają kontrakt.
Test integracyjny
Test sprawdzający współpracę kilku części systemu.
Eval
Powtarzalna ocena jakości odpowiedzi lub działania AI.
RLS
Reguły bazy danych ograniczające rekordy widoczne dla danego użytkownika.
Workflow
Z góry określona sekwencja kroków wykonywana przez kod.
Agent
Model, który sam wybiera kolejne kroki i narzędzia w ramach nadanych granic.
Trace
Połączony zapis całej drogi jednego zadania przez system.
SLI
Metryka pokazująca rzeczywiste zachowanie systemu.
SLO
Docelowy poziom tej metryki, który obiecujemy utrzymać.
Error budget
Dopuszczalna ilość zawodności wynikająca z przyjętego SLO.
Fitness function
Automatyczny test sprawdzający, czy architektura nadal spełnia swoje zasady.

Najważniejszy wniosek

Nie musisz wiedzieć, jak napisać system. Musisz wiedzieć, kiedy nie wolno go jeszcze uznać za gotowy.

Zacznij od jednej lekcji. Odpowiedz na pytanie, skopiuj prompt i zastosuj go do jednego realnego przepływu AIOS Brain.

Wróć do początku kursu