Testowanie systemów AI [email protected]
Radukeu
Wiedza bez uproszczeń

Testowanie AI od środka

Radukeu to projekt, który powstał z konkretnej potrzeby - brakuje rzetelnych, technicznych materiałów po polsku na temat tego, jak faktycznie sprawdzać systemy sztucznej inteligencji.

Piszemy o metodach ewaluacji, pułapkach w projektowaniu testów i o tym, dlaczego wiele powszechnych założeń dotyczących zachowania modeli jest po prostu błędnych.

Środowisko testowania systemów AI - ekrany z wynikami ewaluacji modeli

Kim jesteśmy

Dwie osoby z różnych środowisk, które zbiegły się w jednym miejscu - przy testowaniu modeli językowych.

Weronika przez kilka lat pracowała przy wdrożeniach systemów NLP w środowiskach produkcyjnych. Zderzenie z rzeczywistością - modele zachowujące się inaczej niż w benchmarkach - skłoniło ją do głębszego zajęcia się ewaluacją. Od 2021 roku dokumentuje metody testowania, które faktycznie wychwytują problemy przed wdrożeniem.

Aldona trafiła do testowania AI od strony analityki danych. Specjalizuje się w interpretabilności modeli i w tym, jak projektować zestawy testowe tak, żeby nie mierzyły przypadkowych korelacji zamiast rzeczywistych zdolności systemu.

Red-teaming

Systematyczne szukanie słabych punktów modeli przez celowo skonstruowane przypadki testowe.

Benchmarking

Ocena modeli na zestandaryzowanych zbiorach - z uwzględnieniem tego, co benchmarki pomijają.

Interpretabilność

Analiza tego, dlaczego model daje konkretną odpowiedź - nie tylko czy odpowiedź jest poprawna.

Analiza błędów

Kategoryzacja i opis typowych klas błędów modeli - od halucynacji po błędy kalibracji pewności.

2021

Początek Radukeu

Pierwsze artykuły o ewaluacji modeli NLP w środowiskach produkcyjnych.

2022

Dołącza Aldona

Rozszerzenie tematyki o interpretabilność i projektowanie zbiorów testowych.

2023

Seria o LLM

Pierwsze polskojęzyczne materiały o testowaniu dużych modeli językowych w praktyce.

2025

Sesje coachingowe

Indywidualne konsultacje dla zespołów pracujących z systemami AI - szczegóły tutaj.

Analiza komponentów systemu AI podczas procesu testowania
Środowisko pracy przy ewaluacji modeli językowych
Wizualizacja wyników testów systemu AI

Masz pytanie dotyczące testowania konkretnego systemu? Napisz na [email protected] - staramy się odpowiadać na wiadomości z konkretnym problemem do przeanalizowania.