Cognitive SLA: dlaczego dostępność na poziomie 99,9% nie wystarcza, gdy AI wspiera decyzje w firmie
Cykl: CDF 1.3.2 w praktyce — 6 artykułów o metodyce wdrażania suwerennej AI
Ilustracja monitorowania Cognitive SLA
System AI działa nieprzerwanie od trzech miesięcy. Monitoring infrastruktury świeci na zielono: dostępność 99,97%, opóźnienie poniżej 200 milisekund, brak awarii. A jednak co dwudziesta odpowiedź w procesie obsługi klienta opiera się na informacji, której nie da się potwierdzić w żadnym źródle.
Z perspektywy tradycyjnego SLA system jest zdrowy. Z perspektywy organizacji podejmującej decyzje na podstawie tych odpowiedzi system generuje ryzyko — prawne, finansowe i reputacyjne. Właśnie ta luka między „działa” a „działa poprawnie” jest powodem, dla którego CDF 1.3.2 wprowadza pojęcie Cognitive SLA.
Gdzie kończy się klasyczne SLA
Tradycyjne metryki IT — dostępność, opóźnienie i przepustowość — powstały w świecie, w którym systemy miały być dostępne i szybkie. Jeśli serwer odpowiada, usługa działa. To rozsądne założenie dla baz danych, aplikacji webowych czy systemów ERP.
Systemy kognitywne działają jednak inaczej. Model językowy lub agent AI może być dostępny, szybki i stabilny, a jednocześnie halucynować, polegać na nieaktualnej wiedzy, błędnie kalibrować pewność odpowiedzi lub podejmować sprzeczne działania w środowisku wieloagentowym. Żaden z tych problemów nie pojawi się na klasycznym dashboardzie infrastruktury, ponieważ klasyczne metryki po prostu nie mierzą jakości rozumowania.
Dodatek B do metodyki CDF 1.3.2 ujmuje to bez ogródek: tradycyjne metryki IT SLA są konieczne, ale niewystarczające dla systemów kognitywnych. Trudno się z tym nie zgodzić, gdy weźmie się pod uwagę, że systemy LLM i agentowe są z natury probabilistyczne — ich odpowiedzi nigdy nie będą w pełni deterministyczne.
Trzy warstwy, nie jedna
CDF 1.3.2 nie odrzuca klasycznego SLA. Rozszerza je o dwie dodatkowe warstwy, tworząc model trójpoziomowy.
| Warstwa | Co mierzy | Kto odpowiada | | --- | --- | --- | | Infrastructure SLA | Dostępność ≥99,9%, opóźnienie ≤200 ms, przepustowość | DevOps / Platform Team | | Cognitive SLA | Reasoning Accuracy, Hallucination Rate, Knowledge Freshness, Confidence Calibration | CogOps / Knowledge Curator | | Agent SLA | Coordination Effectiveness, Task Success Rate, Recovery Rate, Token Budget Compliance | Agent Lifecycle Engineer |
To rozróżnienie ma ważne konsekwencje organizacyjne. Warstwa infrastruktury pozostaje w gestii zespołu platformowego, lecz odpowiedzialność za jakość rozumowania i koordynację agentów przechodzi na nowe role: zespół CogOps, kuratora wiedzy i inżyniera cyklu życia agentów. Innymi słowy, Cognitive SLA zmienia nie tylko to, co mierzymy, ale także to, kto za to odpowiada.
Pięć poziomów autonomii agenta
Zakres i rygor Cognitive SLA zależą bezpośrednio od tego, jak dużą autonomię mają agenci w systemie. CDF 1.3.2 definiuje pięć poziomów autonomii — od L0 do L4 — które określają wymagany zakres monitorowania, częstotliwość audytu i dopuszczalne progi eskalacji.
| Poziom | Nazwa | Opis | | --- | --- | --- | | L0 | Human-only | Brak agenta AI; człowiek samodzielnie wykonuje całe zadanie. | | L1 | Human-in-the-loop | Agent przygotowuje rekomendacje, a człowiek zatwierdza każde działanie przed jego wykonaniem. | | L2 | Human-on-the-loop | Agent działa samodzielnie, człowiek nadzoruje i może interweniować. | | L3 | Supervised autonomy | Agent działa autonomicznie, z okresowym audytem i monitorowaniem wydajności. | | L4 | Full autonomy | Pełna autonomia agenta; dozwolona wyłącznie dla procesów niekrytycznych. |
Im wyższy poziom autonomii, tym ważniejsze stają się metryki Cognitive SLA i Agent SLA. Na poziomie L1 kluczowa jest Confidence Calibration — ponieważ człowiek musi ocenić, czy rekomendacji można zaufać. Na poziomach L2–L3 rośnie znaczenie Agent Coordination i automatycznych procedur eskalacji. Poziom L4 wymaga pełnej automatyzacji monitorowania, ponieważ człowiek nie uczestniczy w bieżącym procesie decyzyjnym.
Siedem metryk definiujących jakość systemu AI
W Fazie 4 CDF — czyli w momencie wdrożenia produkcyjnego — zaczynają obowiązywać konkretne metryki Cognitive SLA. Każda ma zdefiniowany cel, metodę pomiaru i przypisany poziom odpowiedzialności.
| Metryka | Co mierzy | Cel | Metoda pomiaru | | --- | --- | --- | --- | | System Availability | Dostępność platformy bazowej | 99,9 | Monitoring infrastruktury (Prometheus, Datadog) | | Reasoning Accuracy Rate | Odsetek odpowiedzi zgodnych z ground truth | ≥95% — procesy krytyczne; ≥90% — standardowe | Ewaluacja względem golden dataset + próbkowy przegląd człowieka | | Hallucination Rate | Odsetek odpowiedzi niepotwierdzonych w źródłach | ≤2% — procesy krytyczne; ≤5% — standardowe | Automatyczna weryfikacja względem bazy wiedzy + audyt losowy | | Mitigation Response Time | Czas od wykrycia błędu kognitywnego do jego korekty | ≤15 min — procesy krytyczne; ≤4 h — standardowe | Znaczniki czasu alertów i zamknięć incydentów | | Knowledge Freshness Index | Świeżość bazy wiedzy w określonym oknie | ≥95% w oknie 7-dniowym | Porównanie dat aktualizacji dokumentów z oknem czasowym | | Agent Coordination | Odsetek zadań wieloagentowych zakończonych bez eskalacji | ≥85% | Logowanie orkiestracji agentów (Immutable Audit Trail) | | Confidence Calibration | Korelacja deklarowanej pewności z rzeczywistą trafnością | r ≥ 0,85 | Analiza statystyczna: deklarowana pewność wobec rzeczywistej trafności |
Warto zwrócić uwagę na dwie rzeczy. Po pierwsze, metryki rozróżniają procesy krytyczne i standardowe, co oznacza, że tolerancja błędu zależy od kontekstu biznesowego, a nie jest jednolita w całym systemie. Po drugie, system mierzy nie tylko trafność odpowiedzi, lecz również szybkość reakcji organizacji na wykryty błąd — Mitigation Response Time ≤15 minut dla procesów krytycznych to bardzo ambitny cel, który wymusza automatyzację wykrywania i procedur naprawczych.
Confidence Calibration — metryka, o której mówi niewiele osób
Spośród siedmiu wskaźników Cognitive SLA jeden zasługuje na osobne omówienie, ponieważ rzadko występuje w praktyce rynkowej: Confidence Calibration.
Odpowiada na pytanie: czy model deklarujący 90% pewności rzeczywiście ma rację w 90% przypadków? Jeśli nie — jeśli model sygnalizuje wysoką pewność, lecz w rzeczywistości myli się znacznie częściej — użytkownik traci możliwość sensownej oceny odpowiedzi. Nie wie, kiedy zaufać rekomendacji, a kiedy ją zweryfikować.
CDF mierzy to za pomocą statystycznej korelacji między deklarowaną pewnością a rzeczywistą trafnością, z celem r ≥ 0,85. To nie jest metryka akademicka — bezpośrednio wpływa na zdolność osób nadzorujących AI do trafnego rozstrzygania, kiedy zaufać systemowi, a kiedy szukać dodatkowego potwierdzenia.
Co się dzieje, gdy metryka spada
Same cele liczbowe nie wystarczą. Równie ważne jest to, co organizacja robi, gdy cel nie zostaje osiągnięty. Dlatego CDF definiuje trzystopniową procedurę eskalacji.
Yellow — metryka pozostaje poniżej celu przez 24 godziny. Automatyczny alert trafia do zespołu CogOps. To sygnał wczesnego ostrzegania: dzieje się coś, co wymaga obserwacji, być może korekty konfiguracji lub odświeżenia bazy wiedzy.
Orange — metryka pozostaje poniżej celu przez 72 godziny. Następuje eskalacja na poziom zarządzania architekturą i obowiązkowa analiza przyczyny źródłowej. To już nie przejściowy spadek, lecz systematyczny problem wymagający zrozumienia przyczyny.
Red — metryka pozostaje poniżej celu przez 7 dni albo Hallucination Rate przekracza 5% w procesie krytycznym. Konsekwencje są poważne: aktywacja Agent Kill-Switch, powiadomienie kierownictwa wykonawczego i wdrożenie planu naprawczego w ciągu 48 godzin.
Procedura jest ważna z dwóch powodów. Po pierwsze, zmienia ogólne odczucie, że „coś nie działa”, w zdefiniowany protokół z przypisanymi rolami, eskalacją i czasem reakcji. Po drugie, łączy Cognitive SLA z Agent Governance — poziom Red może bezpośrednio uruchomić Kill-Switch, czyli fizyczne lub programowe wyłączenie agenta albo całego roju agentów, z kaskadowym powiadamianiem zależnych węzłów.
Cognitive Quality Reports — ciągły dowód, nie jednorazowy test
Metryki Cognitive SLA nie są mierzone raz, a następnie odkładane na półkę. CDF przewiduje comiesięczne Cognitive Quality Reports prezentujące wyniki metryk, trendy jakości rozumowania, incydenty kognitywne i rekomendacje optymalizacyjne.
Ma to znaczenie z perspektywy zarządzania i zgodności. Organizacja nie musi polegać na deklaracji dostawcy, że „system działa dobrze”. Otrzymuje cykliczny, audytowalny raport pokazujący konkretne liczby: jak trafne było rozumowanie, ile wykryto halucynacji, jak szybko reagowano na incydenty i czy baza wiedzy była aktualna.
W środowiskach regulowanych — finansach, administracji publicznej, energetyce i obronności — taki raport nie jest luksusem, lecz koniecznością. Regulatorzy coraz częściej pytają nie o to, czy AI została wdrożona, ale o to, jak organizacja mierzy jej jakość i zarządza nią w czasie.
Dlaczego zmienia to rozmowę z dostawcą AI
Większość umów na wdrożenie AI zawiera SLA infrastruktury: dostępność, czas reakcji wsparcia i okna serwisowe. Jest to konieczne, ale niewystarczające, ponieważ cały opis jakości skupia się na warstwie technicznej.
Cognitive SLA przenosi rozmowę na wyższy poziom. Zamiast pytać: „Czy system będzie dostępny?”, organizacja może zapytać: „Jaki odsetek odpowiedzi będzie zgodny z naszą bazą wiedzy?”, „Jak szybko zareagujecie na wykrycie halucynacji w procesie krytycznym?” oraz „Kto konkretnie odpowiada za jakość rozumowania, a kto za koordynację agentów?”.
To pytania, na które wielu dostawców nie ma dziś dobrych odpowiedzi. Nie dlatego, że są nieuczciwi, ale dlatego, że rynek wdrożeń AI nadal działa w kategoriach infrastruktury i nie wypracował powszechnie przyjętych standardów jakości rozumowania.
Kilka pytań, które warto zadać
Przed podpisaniem umowy na wdrożenie lub utrzymanie systemu AI warto sprawdzić:
- Czy dostawca mierzy jakość rozumowania, czy tylko dostępność platformy?
- Czy istnieją odrębne metryki dla procesów krytycznych i standardowych?
- Jaka jest procedura, gdy Hallucination Rate przekroczy ustalony próg?
- Czy organizacja otrzymuje regularne raporty jakości kognitywnej z konkretnymi liczbami?
- Kto po stronie dostawcy odpowiada za jakość rozumowania — DevOps, data science czy dedykowany zespół CogOps?
- Czy istnieje awaryjny mechanizm zatrzymania agenta, jeśli metryki trwale spadną poniżej celu?
Jeśli odpowiedzi na te pytania są niejasne lub sprowadzają się do ogólnego „monitorujemy system”, najprawdopodobniej mówimy o klasycznym SLA infrastruktury bez warstwy kognitywnej. Może to wystarczyć dla prostych narzędzi wsparcia. W przypadku systemu uczestniczącego w procesach biznesowych i wspierającego rzeczywiste decyzje zwykle nie wystarcza.
Cognitive SLA nie zastępuje tradycyjnych metryk IT. Uzupełnia je o to, co w systemach AI jest najważniejsze i najtrudniejsze do zmierzenia: jakość rozumowania, szybkość reakcji na błędy i zdolność utrzymania tej jakości w czasie.
W następnym artykule pokażemy, jak CDF eliminuje Pilot Purgatory i definiuje drogę od pilota do produkcji w 90 dni — z exit criteria, Production Cost Model i Scale Path Definition, które zapewniają, że prototyp nie pozostanie prototypem na zawsze.