Dla branży bezpieczeństwa istotniejsze od rankingów są jednak dwie decyzje dotyczące blokad, bo one zmieniają to, co model faktycznie zrobi na polecenie analityka.
Anthropic dodaje konkret: na podstawie własnych testów spodziewa się, że klasyfikatory będą interweniować około 85 procent rzadziej niż w poprzedniej konfiguracji.
To jest odpowiedź na najczęstszą skargę zespołów blue teamowych ostatnich dwóch lat.
Model, który odmawia analizy złośliwego skryptu z incydentu, bo skrypt jest złośliwy, jest bezużyteczny dokładnie w tym momencie, w którym miał pomóc.