Termenul este nefericit — sugerează o eroare rară, patologică. În realitate, mecanismul care produce un răspuns corect și cel care produce o afirmație inventată sunt identici.
De ce apar
Un model generează textul cel mai plauzibil în context. Când contextul cere o informație pe care modelul nu o are reprezentată suficient de bine, cel mai plauzibil text rămâne unul care arată ca un răspuns: o citare cu autor, an și titlu, un număr de articol de lege, o cifră cu două zecimale.
Forma este învățată corect. Conținutul este completat cu ce se potrivește statistic.
Câțiva factori cresc riscul:
- întrebări despre fapte rare, recente sau foarte specifice;
- cereri de referințe, citate, cifre exacte;
- întrebări formulate ca și cum răspunsul ar exista cu siguranță;
- conversații lungi, în care contextul relevant a ieșit din fereastra modelului.
Ce funcționează
Dă-i sursele. Dacă modelul primește documentul relevant în context și i se cere să răspundă doar pe baza lui, rata de invenție scade semnificativ. Asta face, în esență, o arhitectură de tip RAG. Nu este o garanție — modelul poate în continuare să interpreteze greșit — dar mută sarcina de la „amintește-ți” la „citește”, unde se descurcă mult mai bine.
Cere citări verificabile. Pune modelul să indice pasajul din sursă pe care se bazează. Un citat care nu se regăsește în document este un semnal automat de problemă și se poate verifica programatic.
Lasă-i o ieșire. Un model căruia i se spune explicit că „nu știu” este un răspuns acceptabil îl va folosi mai des decât unul presat să producă ceva.
Verifică ce se poate verifica. Numele de fișiere, adresele web, identificatorii, formulele — toate se pot valida automat înainte de a ajunge la un om.
Ce nu funcționează
Nu funcționează să-i ceri modelului să se autoevalueze. „Ești sigur?” produce o reformulare, nu o verificare. Aceeași limitare se aplică și cererilor de tipul „dă-mi un scor de încredere”: scorul este generat, nu măsurat.
Nu funcționează nici presupunerea că un model mai nou rezolvă problema. Modelele mai mari inventează mai rar, dar inventează mai convingător — ceea ce, pentru o organizație, poate fi mai periculos.
Consecința pentru arhitectură
Dacă rezultatul ajunge direct la un utilizator final fără verificare, sistemul trebuie proiectat astfel încât o afirmație inventată să nu producă daune: afișezi sursele lângă răspuns, marchezi vizibil ce este generat, păstrezi o cale simplă de a semnala o eroare.
Dacă rezultatul declanșează o acțiune — o plată, o respingere, o comunicare oficială — trebuie să existe o verificare între generare și acțiune. Nu pentru că modelul greșește des, ci pentru că, atunci când greșește, nu dă niciun semn.
