„Are 94% acuratețe” este afirmația care încheie cele mai multe prezentări de proiect și începe cele mai multe probleme.
De ce o cifră medie ascunde exact ce te interesează
Acuratețea este proporția de predicții corecte pe un set de test. Ea presupune tăcut că toate erorile costă la fel și că toate cazurile sunt la fel de frecvente. Aproape niciodată nu e adevărat.
Într-un sistem care detectează ceva rar — fraudă, defect, boală — un model care spune mereu „nu” poate atinge o acuratețe foarte mare fără să fie de niciun folos. Iar într-un sistem în care o eroare într-o direcție costă mult mai mult decât în cealaltă, media celor două tipuri de eroare nu înseamnă nimic.
Întrebările care produc informație utilă
Care sunt cele două tipuri de eroare și cât costă fiecare? Un fals pozitiv și un fals negativ au consecințe diferite, uneori cu ordine de mărime. Evaluarea trebuie să le separe, nu să le amestece într-o singură cifră.
Cum se comportă pe subgrupuri? Aceeași acuratețe medie poate ascunde o performanță bună pe grupul majoritar și una slabă pe grupuri mai puțin reprezentate în datele de antrenare. Dacă nu ai măsurat pe subgrupuri, nu știi.
Ce se întâmplă la cazurile de graniță? Performanța pe cazurile ușoare nu spune nimic despre cele grele. Un set de test construit din cazuri reprezentative pentru dificultate este mai informativ decât unul construit aleatoriu.
Cum arată datele de test față de realitate? Dacă setul de test provine din aceeași perioadă, aceeași sursă și aceeași distribuție ca antrenarea, cifra obținută este optimistă. Testul care contează folosește date din altă perioadă sau altă sursă.
Ce se întâmplă când intrarea este nefirească? Date lipsă, formate neașteptate, text în altă limbă, valori extreme. Un sistem care se degradează elegant este altceva decât unul care produce cu încredere un rezultat absurd.
Evaluarea nu se termină la lansare
Distribuția datelor se schimbă în timp: se modifică procesele, comportamentul oamenilor, produsele. Un model rămâne fix, iar realitatea nu.
Asta înseamnă că evaluarea trebuie să fie un proces continuu, nu un raport de acceptanță:
- monitorizarea distribuției intrărilor față de cele din antrenare;
- un eșantion de predicții verificate manual, periodic;
- un prag declarat sub care sistemul se oprește sau escaladează către un om;
- un jurnal al deciziilor, ca o problemă semnalată peste trei luni să poată fi investigată.
Ce ar trebui să conțină un raport de evaluare
Un raport util spune: ce întrebare s-a pus, pe ce date s-a răspuns, ce metrici s-au folosit și de ce tocmai acelea, cum arată performanța pe subgrupuri, unde greșește sistemul sistematic, ce nu s-a putut măsura și ce ar trebui monitorizat după punerea în funcțiune.
Un raport care conține un singur procent și un grafic nu este o evaluare. Este o afirmație.
