Analiza zachowań granicznych
Identyfikacja przypadków brzegowych specyficznych dla modeli generatywnych. Praca z technikami adversarial prompting, testami regresji odpowiedzi i metodami oceny spójności semantycznej przy zmiennych danych wejściowych.
Co obejmuje sesja
Testowanie systemów AI różni się od klasycznego QA. Modele językowe i systemy oparte na uczeniu maszynowym wykazują zachowania niedeterministyczne - ten sam prompt może zwrócić różne odpowiedzi, a błędy często ujawniają się dopiero przy granicznych przypadkach wejściowych. Sesje skupiają się na konkretnych technikach, które pozwalają wykryć te problemy zanim trafią na produkcję.
Identyfikacja przypadków brzegowych specyficznych dla modeli generatywnych. Praca z technikami adversarial prompting, testami regresji odpowiedzi i metodami oceny spójności semantycznej przy zmiennych danych wejściowych.
Omówienie praktycznych metryk: BLEU, ROUGE, BERTScore oraz oceny ludzkiej jako uzupełnienia automatycznych narzędzi. Kiedy każda z nich ma sens, a kiedy wprowadza fałszywe poczucie bezpieczeństwa.
Budowanie zbiorów testowych odpornych na overfitting do konkretnego modelu. Strategie doboru danych, rotacja promptów i dokumentowanie wyników w sposób, który pozwala porównywać różne wersje systemu.
Jak włączyć testy AI do istniejących procesów ciągłej integracji. Narzędzia takie jak LangSmith, PromptFoo czy Pytest z niestandardowymi asercjami - dobór zależy od architektury systemu i dostępnych zasobów zespołu.