AIDCIA
EN
Fundamente7 min. de citit

Halucinațiile: de ce apar și ce poți face

„Halucinația” nu este o defecțiune care se repară cu o versiune nouă. Este o consecință a modului în care funcționează modelul. Se poate însă reduce și, mai important, se poate detecta.

Termenul este nefericit — sugerează o eroare rară, patologică. În realitate, mecanismul care produce un răspuns corect și cel care produce o afirmație inventată sunt identici.

De ce apar

Un model generează textul cel mai plauzibil în context. Când contextul cere o informație pe care modelul nu o are reprezentată suficient de bine, cel mai plauzibil text rămâne unul care arată ca un răspuns: o citare cu autor, an și titlu, un număr de articol de lege, o cifră cu două zecimale.

Forma este învățată corect. Conținutul este completat cu ce se potrivește statistic.

Câțiva factori cresc riscul:

  • întrebări despre fapte rare, recente sau foarte specifice;
  • cereri de referințe, citate, cifre exacte;
  • întrebări formulate ca și cum răspunsul ar exista cu siguranță;
  • conversații lungi, în care contextul relevant a ieșit din fereastra modelului.

Ce funcționează

Dă-i sursele. Dacă modelul primește documentul relevant în context și i se cere să răspundă doar pe baza lui, rata de invenție scade semnificativ. Asta face, în esență, o arhitectură de tip RAG. Nu este o garanție — modelul poate în continuare să interpreteze greșit — dar mută sarcina de la „amintește-ți” la „citește”, unde se descurcă mult mai bine.

Cere citări verificabile. Pune modelul să indice pasajul din sursă pe care se bazează. Un citat care nu se regăsește în document este un semnal automat de problemă și se poate verifica programatic.

Lasă-i o ieșire. Un model căruia i se spune explicit că „nu știu” este un răspuns acceptabil îl va folosi mai des decât unul presat să producă ceva.

Verifică ce se poate verifica. Numele de fișiere, adresele web, identificatorii, formulele — toate se pot valida automat înainte de a ajunge la un om.

Ce nu funcționează

Nu funcționează să-i ceri modelului să se autoevalueze. „Ești sigur?” produce o reformulare, nu o verificare. Aceeași limitare se aplică și cererilor de tipul „dă-mi un scor de încredere”: scorul este generat, nu măsurat.

Nu funcționează nici presupunerea că un model mai nou rezolvă problema. Modelele mai mari inventează mai rar, dar inventează mai convingător — ceea ce, pentru o organizație, poate fi mai periculos.

Consecința pentru arhitectură

Dacă rezultatul ajunge direct la un utilizator final fără verificare, sistemul trebuie proiectat astfel încât o afirmație inventată să nu producă daune: afișezi sursele lângă răspuns, marchezi vizibil ce este generat, păstrezi o cale simplă de a semnala o eroare.

Dacă rezultatul declanșează o acțiune — o plată, o respingere, o comunicare oficială — trebuie să existe o verificare între generare și acțiune. Nu pentru că modelul greșește des, ci pentru că, atunci când greșește, nu dă niciun semn.

Articole înrudite