Red-teaming
Systematyczne szukanie słabych punktów modeli przez celowo skonstruowane przypadki testowe.
Radukeu to projekt, który powstał z konkretnej potrzeby - brakuje rzetelnych, technicznych materiałów po polsku na temat tego, jak faktycznie sprawdzać systemy sztucznej inteligencji.
Piszemy o metodach ewaluacji, pułapkach w projektowaniu testów i o tym, dlaczego wiele powszechnych założeń dotyczących zachowania modeli jest po prostu błędnych.
Dwie osoby z różnych środowisk, które zbiegły się w jednym miejscu - przy testowaniu modeli językowych.
Weronika przez kilka lat pracowała przy wdrożeniach systemów NLP w środowiskach produkcyjnych. Zderzenie z rzeczywistością - modele zachowujące się inaczej niż w benchmarkach - skłoniło ją do głębszego zajęcia się ewaluacją. Od 2021 roku dokumentuje metody testowania, które faktycznie wychwytują problemy przed wdrożeniem.
Aldona trafiła do testowania AI od strony analityki danych. Specjalizuje się w interpretabilności modeli i w tym, jak projektować zestawy testowe tak, żeby nie mierzyły przypadkowych korelacji zamiast rzeczywistych zdolności systemu.
Systematyczne szukanie słabych punktów modeli przez celowo skonstruowane przypadki testowe.
Ocena modeli na zestandaryzowanych zbiorach - z uwzględnieniem tego, co benchmarki pomijają.
Analiza tego, dlaczego model daje konkretną odpowiedź - nie tylko czy odpowiedź jest poprawna.
Kategoryzacja i opis typowych klas błędów modeli - od halucynacji po błędy kalibracji pewności.
Początek Radukeu
Pierwsze artykuły o ewaluacji modeli NLP w środowiskach produkcyjnych.
Dołącza Aldona
Rozszerzenie tematyki o interpretabilność i projektowanie zbiorów testowych.
Seria o LLM
Pierwsze polskojęzyczne materiały o testowaniu dużych modeli językowych w praktyce.
Sesje coachingowe
Indywidualne konsultacje dla zespołów pracujących z systemami AI - szczegóły tutaj.
Masz pytanie dotyczące testowania konkretnego systemu? Napisz na [email protected] - staramy się odpowiadać na wiadomości z konkretnym problemem do przeanalizowania.