JJHovor
Spolehlivost

Automatizace,které nemusíte hlídat.

Největší obava u AI a automatizace je, že se to zblázní a udělá škodu. Beru to vážně, a proto spolehlivost neřeším až když se něco stane, ale stavím ji do smyčky od začátku. Takhle hlídám, aby se chyby nedělaly, a takhle poctivě říkám, co dělám, když se přesto něco pokazí.

01Návrhové principyČtyři principy

Bezpečnost je zadrátovaná, ne dopsaná v promptu

Smyčku stavím tak, aby špatný běh nenapáchal škodu, i kdyby se něco pokazilo. Kritická pravidla nejsou prosba v textu pro model, ale pevná součást architektury. Když si nejste jistí, jestli automatizaci věřit, tady je základ, na kterém spolehlivost stojí.

01

Člověk na poslední kontrole

Tam, kde jde o něco citlivého, nerozhoduje smyčka sama. Připraví návrh a poslední slovo i odeslání nechává na vás.

02

Suchý běh první

Než cokoli poběží naostro, projede se nanečisto na reálných datech. Chyby se odchytí dřív, než napáchají škodu, ne až potom.

03

Idempotence

Opakovaný běh nezaloží věc dvakrát a nerozešle to samé znovu. Když něco spadne v půlce, dá se to bezpečně spustit znovu.

04

Selhává bezpečně

Při pochybnosti smyčka radši nic neudělá a položku odloží ke kontrole. Nic destruktivního se ve výchozím stavu neděje samo.

02Validace a bezpečné selháníBezpečné selhání

Když si smyčka není jistá, radši počká

Každý vstup se ověřuje předtím, než s ním smyčka něco udělá. Když jedna položka neprojde, běh se kvůli tomu nezhroutí, ta položka se odloží do fronty ke kontrole a zbytek pokračuje. Ve výchozím stavu smyčka nic nemaže ani nepřepisuje nevratně, protože bezpečná varianta je vždycky raději nechat rozhodnutí na člověku než něco zkazit.

03Monitoring a alertyAlerty

O výpadku se dozvím dřív než vy

Každý běh se loguje, takže je zpětně vidět, co se dělo. Když něco selže, přijde mi alert, a nezjišťujete výpadek vy z toho, že něco přestalo chodit. Zdraví smyčky se hlídá průběžně a na vyžádání vám můžu posílat pravidelný přehled o tom, co smyčka odvedla.

  • Logování běhů, aby se dalo zpětně dohledat, co se stalo.

  • Alert operátorovi při selhání, žádné tiché umírání.

  • Průběžné health checky nad tím, jestli smyčka žije.

  • Volitelný pravidelný přehled pro vás o odvedené práci.

04Co se stane, když se něco pokazíRozhodovací řetězec

Tohle je nejdůležitější část. Automatizace se občas o něco zadrhne, důležité je, co se stane potom. Smyčka nepadá naslepo, prochází tímhle rozhodovacím řetězcem.

01

Běh

Smyčka se spustí podle plánu nebo události a začne zpracovávat.

02

Chyba?

Každý krok se ověřuje. Když projde, pokračuje se dál bez zásahu.

03

Transientní chyba

Dočasný výpadek, třeba API chvíli nedostupné. Zkusí se znovu s postupně delší pauzou.

04

Permanentní chyba

Něco nesedí trvale. Položka jde do fronty ke kontrole a mně přijde alert.

05

Vyřešeno

Opravím to a díky idempotenci bezpečně spustím znovu, bez duplikátů.

Nic destruktivního se ve výchozím stavu neděje samo.
05Řízení změnVerzované a vratné

Změny jsou verzované a vratné

Kód každé smyčky je pod verzovací kontrolou v Gitu, takže je vidět, co se kdy změnilo a proč. Než změna půjde naostro, projede se v preview nebo staging prostředí jako suchý běh. Když se něco nechová, jak má, jde se vrátit na předchozí funkční verzi. Změny, které se dotýkají vašeho provozu, vám dopředu řeknu.

  • Verzování v Gitu, každá změna má stopu.

  • Suchý běh v preview nebo staging prostředí před ostrým nasazením.

  • Rollback na poslední funkční verzi, když se něco pokazí.

  • Změny, které se vás dotýkají, komunikuju předem.

06Poctivě o dostupnostiBez SLA, ale poctivě

Nemám smluvní SLA a řeknu proč

Nebudu vám slibovat smluvní SLA s garantovanou dostupností. Jsem jeden člověk, ne noční směna na telefonu, a takový závazek bych férově nepokryl 24 hodin denně. Co ale řeknu poctivě, je tohle. Samotná smyčka běží na spravované cloudové infrastruktuře (Vercel, Railway), která má vlastní redundanci a vlastní dostupnost na úrovni velkých poskytovatelů, přičemž jejich stav si můžete kdykoli ověřit na jejich status stránkách. Na incidenty reaguju v pracovní době rychle, mimo ni podle nejlepšího úsilí. Výhoda malého provozu je, že se dozvíte pravdu a víte přesně, na koho se obrátit.

  • Žádné smluvní SLA, které by jeden člověk férově neuhlídal nonstop.
  • Podkladová infrastruktura (Vercel, Railway) běží v redundantním cloudu s vlastní dostupností a veřejnými status stránkami.
  • Reakce na incidenty rychlá v pracovní době, mimo ni podle nejlepšího úsilí.
07Zálohy a obnovaZdroj pravdy u vás

Vaše systémy zůstávají zdrojem pravdy

Smyčka sedí vedle vašich nástrojů, nenahrazuje je. Data dál žijí ve vašem CRM, schránce a fakturaci, takže kdyby smyčka ze dne na den zmizela, vaše data nezmizí s ní. Máte je pořád u sebe a jde se k nim vrátit i ručně. Provozní stav a konfiguraci smyčky drží platformy, na kterých běží, se svými vlastními zálohami.

08Ukončení a předáníČistý odchod

Žádná data jako rukojmí

Když spolupráci ukončíme, odeberete přizvané přístupy a rotujete klíče a tokeny na své straně. Předám dokumentaci k tomu, jak smyčka fungovala, a nedržím si žádná vaše data ani přístup. Odchod je čistý a rychlý, protože zdroj pravdy byl celou dobu u vás.

  • Přístupy odeberete a klíče rotujete vy, na své straně.

  • Předám dokumentaci, jak smyčka fungovala.

  • Nedržím si žádná vaše data ani přístup.

09Časté otázkyČtyři odpovědi
01Dáváte garantované SLA na dostupnost?

Ne a je to vědomé rozhodnutí. Smluvní SLA s garantovaným časem odezvy 24 hodin denně bych jako jeden člověk férově nepokryl, takže ho neslibuju. Podkladová infrastruktura přitom běží na redundantním cloudu s vlastní dostupností a na incidenty reaguju v pracovní době rychle, mimo ni podle nejlepšího úsilí.

02Co se stane, když smyčka spadne uprostřed běhu?

Smyčky stavím jako idempotentní, takže opakovaný běh nezaloží věc dvakrát ani nerozešle to samé znovu. Když něco spadne v půlce, opravím to a bezpečně spustím znovu, bez duplikátů.

03Jak se dozvím, že se něco pokazilo?

Primárně to řeším já, protože při selhání mi přijde alert. Na vyžádání vám navíc můžu posílat pravidelný přehled o tom, co smyčka odvedla a jestli něco šlo do fronty ke kontrole.

04Co když automatizace udělá chybu a něco odešle špatně?

Proto u citlivých kroků nechávám poslední slovo a odeslání na člověku a proto se všechno nejdřív testuje suchým během. Nic destruktivního se ve výchozím stavu neděje samo, sporné případy jdou do fronty ke kontrole, místo aby se odeslaly naslepo.

Kontakt

Ozvěte se.

Aktuálně otevřený pro

  • AI agent sprinty s pevným rozsahem (4 až 8 týdnů)
  • Spravovaná AI automatizace, kterou postavím a provozuju za vás
  • Poradenství pro netechnické zakladatele, kteří stavějí s AI

Každá zpráva chodí přímo mně, ne do žádného ticketing systému. Čtu je všechny a odpovídám sám.