allclouds.pl

Cognitive SLA: dlaczego dostępność na poziomie 99,9% nie wystarcza, gdy AI wspiera decyzje w firmie

Okładka artykułu

Seria: CDF w praktyce — 6 artykułów o metodyce wdrażania suwerennej AI

*To pierwszy z 6 artykułów o metodyce CDF 1.3.2 — frameworku wdrażania suwerennej AI dla sektorów regulowanych, opracowanym przez allclouds.pl. Cykl SAVANT koncentruje się na zgodności, pomiarze jakości i nadzorze. Cykl GENESIS dotyczy zarządzania agentami, skalowania i operacji. CDF 1.3.2 jest autorską metodyką opracowaną przez allclouds.pl, opartą na ISO/IEC 42001:2023 i unijnym AI Act.*

![Ilustracja monitorowania Cognitive SLA](image:pl-inline-1)

System AI działa nieprzerwanie od trzech miesięcy. Monitoring infrastruktury świeci na zielono: dostępność 99,97%, opóźnienie poniżej 200 milisekund, brak awarii. A jednak co dwudziesta odpowiedź w procesie obsługi klienta opiera się na informacji, której nie da się potwierdzić w żadnym źródle.

Z perspektywy tradycyjnego SLA system jest zdrowy. Z perspektywy organizacji podejmującej decyzje na podstawie tych odpowiedzi system generuje ryzyko — prawne, finansowe i reputacyjne. Właśnie ta luka między „działa” a „działa poprawnie” jest powodem, dla którego CDF 1.3.2 wprowadza pojęcie Cognitive SLA.

Gdzie kończy się klasyczne SLA

Tradycyjne metryki IT — dostępność, opóźnienie i przepustowość — powstały w świecie, w którym systemy miały być dostępne i szybkie. Jeśli serwer odpowiada, usługa działa. To rozsądne założenie dla baz danych, aplikacji webowych czy systemów ERP.

Systemy kognitywne działają jednak inaczej. Model językowy lub agent AI może być dostępny, szybki i stabilny, a jednocześnie halucynować, polegać na nieaktualnej wiedzy, błędnie kalibrować pewność odpowiedzi lub podejmować sprzeczne działania w środowisku wieloagentowym. Żaden z tych problemów nie pojawi się na klasycznym dashboardzie infrastruktury, ponieważ klasyczne metryki po prostu nie mierzą jakości rozumowania.

Dodatek B do metodyki CDF 1.3.2 ujmuje to bez ogródek: tradycyjne metryki IT SLA są konieczne, ale niewystarczające dla systemów kognitywnych. Trudno się z tym nie zgodzić, gdy weźmie się pod uwagę, że systemy LLM i agentowe są z natury probabilistyczne — ich odpowiedzi nigdy nie będą w pełni deterministyczne.

Trzy warstwy, nie jedna

CDF 1.3.2 nie odrzuca klasycznego SLA. Rozszerza je o dwie dodatkowe warstwy, tworząc model trójpoziomowy.

:::table-wrap

| Warstwa | Co mierzy | Kto odpowiada | | --- | --- | --- | | Infrastructure SLA | Dostępność ≥99,9%, opóźnienie ≤200 ms, przepustowość | DevOps / Platform Team | | Cognitive SLA | Reasoning Accuracy, Hallucination Rate, Knowledge Freshness, Confidence Calibration | CogOps / Knowledge Curator | | Agent SLA | Coordination Effectiveness, Task Success Rate, Recovery Rate, Token Budget Compliance | Agent Lifecycle Engineer |

To rozróżnienie ma ważne konsekwencje organizacyjne. Warstwa infrastruktury pozostaje w gestii zespołu platformowego, lecz odpowiedzialność za jakość rozumowania i koordynację agentów przechodzi na nowe role: zespół CogOps, kuratora wiedzy i inżyniera cyklu życia agentów. Innymi słowy, Cognitive SLA zmienia nie tylko to, co mierzymy, ale także to, kto za to odpowiada.

*Szczegółowo opisujemy zarządzanie agentami, których jakość mierzy Agent SLA, w artykule „Agent Governance — jak zarządzać rojem 50 agentów AI bez utraty kontroli”.*

Pięć poziomów autonomii agenta

Zakres i rygor Cognitive SLA zależą bezpośrednio od tego, jak dużą autonomię mają agenci w systemie. CDF 1.3.2 definiuje pięć poziomów autonomii — od L0 do L4 — które określają wymagany zakres monitorowania, częstotliwość audytu i dopuszczalne progi eskalacji.

:::table-wrap

| Poziom | Nazwa | Opis | | --- | --- | --- | | L0 | Human-only | Brak agenta AI; człowiek samodzielnie wykonuje całe zadanie. | | L1 | Human-in-the-loop | Agent przygotowuje rekomendacje, a człowiek zatwierdza każde działanie przed jego wykonaniem. | | L2 | Human-on-the-loop | Agent działa samodzielnie, człowiek nadzoruje i może interweniować. | | L3 | Supervised autonomy | Agent działa autonomicznie, z okresowym audytem i monitorowaniem wydajności. | | L4 | Full autonomy | Pełna autonomia agenta; dozwolona wyłącznie dla procesów niekrytycznych. |

Im wyższy poziom autonomii, tym ważniejsze stają się metryki Cognitive SLA i Agent SLA. Na poziomie L1 kluczowa jest Confidence Calibration — ponieważ człowiek musi ocenić, czy rekomendacji można zaufać. Na poziomach L2–L3 rośnie znaczenie Agent Coordination i automatycznych procedur eskalacji. Poziom L4 wymaga pełnej automatyzacji monitorowania, ponieważ człowiek nie uczestniczy w bieżącym procesie decyzyjnym.

*Poziom autonomii jest jednym z dziewięciu obowiązkowych pól Agent Registry — centralnego rejestru agentów w CDF. Pełny model zarządzania agentami, w tym wzorce interakcji i procedury awaryjne, opisujemy w artykule „Agent Governance — jak zarządzać rojem 50 agentów AI bez utraty kontroli”.*

Siedem metryk definiujących jakość systemu AI

W Fazie 4 CDF — czyli w momencie wdrożenia produkcyjnego — zaczynają obowiązywać konkretne metryki Cognitive SLA. Każda ma zdefiniowany cel, metodę pomiaru i przypisany poziom odpowiedzialności.

:::table-wrap

| Metryka | Co mierzy | Cel | Metoda pomiaru | | --- | --- | --- | --- | | System Availability | Dostępność platformy bazowej | 99,9 | Monitoring infrastruktury (Prometheus, Datadog) | | Reasoning Accuracy Rate | Odsetek odpowiedzi zgodnych z ground truth | ≥95% — procesy krytyczne; ≥90% — standardowe | Ewaluacja względem golden dataset + próbkowy przegląd człowieka | | Hallucination Rate | Odsetek odpowiedzi niepotwierdzonych w źródłach | ≤2% — procesy krytyczne; ≤5% — standardowe | Automatyczna weryfikacja względem bazy wiedzy + audyt losowy | | Mitigation Response Time | Czas od wykrycia błędu kognitywnego do jego korekty | ≤15 min — procesy krytyczne; ≤4 h — standardowe | Znaczniki czasu alertów i zamknięć incydentów | | Knowledge Freshness Index | Świeżość bazy wiedzy w określonym oknie | ≥95% w oknie 7-dniowym | Porównanie dat aktualizacji dokumentów z oknem czasowym | | Agent Coordination | Odsetek zadań wieloagentowych zakończonych bez eskalacji | ≥85% | Logowanie orkiestracji agentów (Immutable Audit Trail) | | Confidence Calibration | Korelacja deklarowanej pewności z rzeczywistą trafnością | r ≥ 0,85 | Analiza statystyczna: deklarowana pewność wobec rzeczywistej trafności |

Warto zwrócić uwagę na dwie rzeczy. Po pierwsze, metryki rozróżniają procesy krytyczne i standardowe, co oznacza, że tolerancja błędu zależy od kontekstu biznesowego, a nie jest jednolita w całym systemie. Po drugie, system mierzy nie tylko trafność odpowiedzi, lecz również szybkość reakcji organizacji na wykryty błąd — Mitigation Response Time ≤15 minut dla procesów krytycznych to bardzo ambitny cel, który wymusza automatyzację wykrywania i procedur naprawczych.

Confidence Calibration — metryka, o której mówi niewiele osób

Spośród siedmiu wskaźników Cognitive SLA jeden zasługuje na osobne omówienie, ponieważ rzadko występuje w praktyce rynkowej: Confidence Calibration.

Odpowiada na pytanie: czy model deklarujący 90% pewności rzeczywiście ma rację w 90% przypadków? Jeśli nie — jeśli model sygnalizuje wysoką pewność, lecz w rzeczywistości myli się znacznie częściej — użytkownik traci możliwość sensownej oceny odpowiedzi. Nie wie, kiedy zaufać rekomendacji, a kiedy ją zweryfikować.

CDF mierzy to za pomocą statystycznej korelacji między deklarowaną pewnością a rzeczywistą trafnością, z celem r ≥ 0,85. To nie jest metryka akademicka — bezpośrednio wpływa na zdolność osób nadzorujących AI do trafnego rozstrzygania, kiedy zaufać systemowi, a kiedy szukać dodatkowego potwierdzenia.

*Confidence Calibration jest bezpośrednio związana z jakością nadzoru człowieka. W artykule „Human Competence Gate” opisujemy mechanizm sprawdzający, czy osoba zatwierdzająca rekomendację AI rzeczywiście rozumie, co zatwierdza — oraz jak kalibracja pewności modelu wpływa na tę zdolność.*

Co się dzieje, gdy metryka spada

Same cele liczbowe nie wystarczą. Równie ważne jest to, co organizacja robi, gdy cel nie zostaje osiągnięty. Dlatego CDF definiuje trzystopniową procedurę eskalacji.

Yellow — metryka pozostaje poniżej celu przez 24 godziny. Automatyczny alert trafia do zespołu CogOps. To sygnał wczesnego ostrzegania: dzieje się coś, co wymaga obserwacji, być może korekty konfiguracji lub odświeżenia bazy wiedzy.

Orange — metryka pozostaje poniżej celu przez 72 godziny. Następuje eskalacja na poziom zarządzania architekturą i obowiązkowa analiza przyczyny źródłowej. To już nie przejściowy spadek, lecz systematyczny problem wymagający zrozumienia przyczyny.

Red — metryka pozostaje poniżej celu przez 7 dni albo Hallucination Rate przekracza 5% w procesie krytycznym. Konsekwencje są poważne: aktywacja Agent Kill-Switch, powiadomienie kierownictwa wykonawczego i wdrożenie planu naprawczego w ciągu 48 godzin.

Procedura jest ważna z dwóch powodów. Po pierwsze, zmienia ogólne odczucie, że „coś nie działa”, w zdefiniowany protokół z przypisanymi rolami, eskalacją i czasem reakcji. Po drugie, łączy Cognitive SLA z Agent Governance — poziom Red może bezpośrednio uruchomić Kill-Switch, czyli fizyczne lub programowe wyłączenie agenta albo całego roju agentów, z kaskadowym powiadamianiem zależnych węzłów.

*CDF definiuje trzy typy Kill-Switch: Single Agent, Swarm i Cognitive Circuit Breaker. Ich pełny opis wraz z Agent Governance Model znajduje się w artykule „Agent Governance — jak zarządzać rojem 50 agentów AI bez utraty kontroli”.*

Cognitive Quality Reports — ciągły dowód, nie jednorazowy test

Metryki Cognitive SLA nie są mierzone raz, a następnie odkładane na półkę. CDF przewiduje comiesięczne Cognitive Quality Reports prezentujące wyniki metryk, trendy jakości rozumowania, incydenty kognitywne i rekomendacje optymalizacyjne.

Ma to znaczenie z perspektywy zarządzania i zgodności. Organizacja nie musi polegać na deklaracji dostawcy, że „system działa dobrze”. Otrzymuje cykliczny, audytowalny raport pokazujący konkretne liczby: jak trafne było rozumowanie, ile wykryto halucynacji, jak szybko reagowano na incydenty i czy baza wiedzy była aktualna.

W środowiskach regulowanych — finansach, administracji publicznej, energetyce i obronności — taki raport nie jest luksusem, lecz koniecznością. Regulatorzy coraz częściej pytają nie o to, czy AI została wdrożona, ale o to, jak organizacja mierzy jej jakość i zarządza nią w czasie.

*Comiesięczne Cognitive Quality Reports są częścią fazy CogOps — ciągłej usługi utrzymaniowej, opisanej szczegółowo w artykule „Cognitive Operations — co dzieje się po wdrożeniu, gdy większość dostawców AI dawno już opuściła firmę”.*

Dlaczego zmienia to rozmowę z dostawcą AI

Większość umów na wdrożenie AI zawiera SLA infrastruktury: dostępność, czas reakcji wsparcia i okna serwisowe. Jest to konieczne, ale niewystarczające, ponieważ cały opis jakości skupia się na warstwie technicznej.

Cognitive SLA przenosi rozmowę na wyższy poziom. Zamiast pytać: „Czy system będzie dostępny?”, organizacja może zapytać: „Jaki odsetek odpowiedzi będzie zgodny z naszą bazą wiedzy?”, „Jak szybko zareagujecie na wykrycie halucynacji w procesie krytycznym?” oraz „Kto konkretnie odpowiada za jakość rozumowania, a kto za koordynację agentów?”.

To pytania, na które wielu dostawców nie ma dziś dobrych odpowiedzi. Nie dlatego, że są nieuczciwi, ale dlatego, że rynek wdrożeń AI nadal działa w kategoriach infrastruktury i nie wypracował powszechnie przyjętych standardów jakości rozumowania.

Kilka pytań, które warto zadać

Przed podpisaniem umowy na wdrożenie lub utrzymanie systemu AI warto sprawdzić:

Jeśli odpowiedzi na te pytania są niejasne lub sprowadzają się do ogólnego „monitorujemy system”, najprawdopodobniej mówimy o klasycznym SLA infrastruktury bez warstwy kognitywnej. Może to wystarczyć dla prostych narzędzi wsparcia. W przypadku systemu uczestniczącego w procesach biznesowych i wspierającego rzeczywiste decyzje zwykle nie wystarcza.

Cognitive SLA nie zastępuje tradycyjnych metryk IT. Uzupełnia je o to, co w systemach AI jest najważniejsze i najtrudniejsze do zmierzenia: jakość rozumowania, szybkość reakcji na błędy i zdolność utrzymania tej jakości w czasie.

W następnym artykule pokażemy, jak CDF eliminuje Pilot Purgatory i definiuje drogę od pilota do produkcji w 90 dni — z exit criteria, Production Cost Model i Scale Path Definition, które zapewniają, że prototyp nie pozostanie prototypem na zawsze.

Co jeszcze warto zobaczyć

https://www.allclouds.pl/blog/cognitive-sla-why-99-9-uptime-is-not-enough-when-ai-supports-decisions-in-your-company