Gdy intuicja wyprzedza naukę: GENESIS-AI i era złożonych systemów sztucznej inteligencji
GENESIS-AI to projekt badawczy programu inLABs. Opisane funkcje są celem badań, a nie dostępnym produktem. Status projektu: inLABs
W świecie technologii rzadko zdarza się, aby „przeczucia i przekonania” inżyniera wyprzedzały „mikroskop i oko” naukowca. Historia projektu GENESIS-AI jest jednak zapisem właśnie takiej chwili: momentu, w którym intuicyjna decyzja o odrzuceniu monolitycznych gigantów na rzecz inteligencji zespołowej okazała się prorocza.
Wspomnienia z „technologicznej dziczy”
Wróćmy do etapu koncepcyjnego planowania Fabryki Aplikacji w ramach projektu GENESIS-AI. Był to szczególny czas: rynek zachłysnął się możliwościami ogromnych modeli językowych (LLM). Każdy tydzień przynosił informacje o nowym, „większym i lepszym” modelu, który miał rozwiązać wszystkie problemy ludzkości. O autonomicznych agentach AI (Agentic AI) mówiło się wtedy szeptem i traktowano je jako ciekawostkę akademicką. Małe modele językowe (SLM) spychano natomiast na margines, uznając je za ubogich krewnych wieloparametrowych braci. Mimo wszechobecnej fascynacji gigantyzmem zespół GENESIS-AI miał inne przeczucie. Kierując się intuicją inżynierską, odmówiliśmy bagatelizowania potencjału specjalizacji. Zamiast postawić na jeden „wszechwiedzący mózg”, zaczęliśmy szkicować system przypominający strukturę biologiczną lub dobrze zorganizowaną korporację: system oparty na współpracy. Najbardziej fascynujące było to, że poruszaliśmy się po niemal dziewiczej, niezbadanej przestrzeni technologicznej. Bez twardych danych i ograniczeń dla wyobraźni koncepcja zaczęła nabierać kształtu - najpierw na papierze, potem w architekturze systemu.

Architektura GENESIS-AI: trzy warstwy inteligencji
W rezultacie dokumentacja koncepcyjna GENESIS-AI przyjęła założenie, które wówczas mogło wydawać się ryzykowne, a dziś jest uznawane za najnowocześniejsze podejście. System zaprojektowano jako wielowarstwową strukturę wyspecjalizowanych agentów AI sterujących grupą SLM (Small Language Models) i MLM (Medium Language Models).
Opracowana topologia opiera się na trzech filarach:
- Warstwy podstawowe (on-premises): dwie najniższe warstwy modeli językowych utrzymywane w bezpiecznym środowisku lokalnym. Odpowiadają za wykonywanie elementarnych, powtarzalnych, lecz krytycznych zadań cyklu życia tworzenia oprogramowania (SDLC), takich jak generowanie kodu, testy jednostkowe i dokumentacja techniczna.
- Warstwa arbitrażu (chmura): trzecia, zewnętrzna warstwa wykorzystująca zaawansowane komercyjne modele LLM. Nie służą one do „brudnej roboty”, lecz realizują funkcje arbitrażowe, weryfikacyjne i twórcze na najwyższym poziomie abstrakcji.
- Inteligentna orkiestracja: cały proces nadzoruje nadrzędny agent-orkiestrator, zarządzający przepływem informacji między „pracownikami” (SLM) a „menedżerami” (LLM).

Nauka potwierdza intuicję: dowody poprawności
Z czasem okazało się, że intuicja nas nie zawiodła. To, co w GENESIS-AI było „inżynierskim przeczuciem”, w latach 2023-2024 stało się przedmiotem przełomowych badań na czołowych światowych uniwersytetach. Nauka ukuła nawet termin dla naszego podejścia: Compound AI Systems.
Oto trzy wyniki badań, które wspierają kierunek przyjęty w architekturze GENESIS-AI.
Dowód 1: efektywność kosztowa i jakość (Uniwersytet Stanforda)
Naukowcy z Uniwersytetu Stanforda w projekcie „FrugalGPT” (2023) pokazali to, co założyliśmy w naszych warstwach on-premises. Pokazali, że kaskada mniejszych i tańszych modeli, sterowana przez inteligentny router, może osiągać wyniki równe lub lepsze od najdroższych modeli LLM (takich jak GPT-4), jednocześnie obniżając koszty nawet o 98%.
:::blockquote „Nasze wyniki pokazują, że FrugalGPT może dorównać wydajnością najlepszym pojedynczym modelom LLM [...] przy jednoczesnym zmniejszeniu kosztów inferencji o rzędy wielkości”. - (Chen i in., 2023)
Dowód 2: przewaga pracy zespołowej (Together AI)
W połowie 2024 roku opublikowano badania nad architekturą MoA (Mixture-of-Agents). Wyniki wstrząsnęły branżą. Okazało się, że „kolektyw” złożony z kilku modeli open source, czyli klasy wykorzystywanej w GENESIS-AI, może pokonać giganta GPT-4o w bezpośrednim starciu. Dzieje się tak, ponieważ modele potrafią wzajemnie korygować swoje błędy.
:::blockquote „Stwierdziliśmy, że współpraca wielu modeli LLM pozwala im wykorzystywać swoje mocne strony i przezwyciężać słabości poszczególnych jednostek. Nasza metoda MoA osiągnęła wynik 65,1% w benchmarku AlpacaEval 2.0, przewyższając GPT-4o”. - (Wang i in., 2024)
Dowód 3: sprawczość agentów (Microsoft Research)
Badania nad frameworkiem AutoGen dowiodły, że kluczem do rozwiązywania złożonych problemów, takich jak pisanie całych modułów aplikacji w GENESIS-AI, nie jest „mądrzejszy model”, lecz „lepsza rozmowa”. Wykazano, że interakcja między agentami - np. „Programistą” i „Krytykiem” - prowadzi do samokorygującego się kodu.
:::blockquote „Pokazujemy, że wieloagentowe frameworki konwersacyjne umożliwiają systemom LLM autonomiczne rozwiązywanie zadań, które wcześniej wymagały interwencji człowieka lub były nieosiągalne dla pojedynczych modeli”. - (Wu i in., 2023)
BONUS: porównanie paradygmatów
Dlaczego wybraliśmy taki kierunek? Przyjrzyjmy się danym porównującym podejście monolityczne (jeden duży model) z podejściem zastosowanym w naszym projekcie (orkiestrowane SLM).

Podsumowanie: od marzenia do rzeczywistości badawczej
Dziś, gdy początkowe prace nad projektem GENESIS-AI dobiegają końca, z jednej strony możemy być dumni, że przewidzieliśmy przyszłość. Nasza wizja potencjału architektury hybrydowej zbudowanej ze ściśle współpracujących modeli SLM, MLM i LLM, sterowanych przez zestaw agentów AI, została mocno potwierdzona faktami.
Z drugiej strony rzeczywistość i obecny stan wiedzy stawiają nasz projekt w zupełnie nowym świetle. Z bardzo ryzykownego przedsięwzięcia opartego na niezbadanych technologiach i innowacji graniczącej z fantastyką GENESIS-AI stał się projektem mocno zakorzenionym w rzeczywistości naukowej. To, co zaplanowaliśmy w warunkach całkowitej niewiedzy, jest dziś określane jako jeden z głównych trendów sztucznej inteligencji. Nasze prace B+R przybierają konkretne kształty, a ryzyko technologiczne jest dziś mniejsze, bo kierunek potwierdzają niezależne badania.