Drept român — ultima rulare

Cifrele, pe scurt.

91,2%

Articol corect în top 10

88,2%

Articol corect în top 5

97,1%

Citare corectă în răspuns

100%

Refuz corect în afara domeniului

Măsurat pe setul auriu de 34 întrebări de recuperare + 3 de control (în afara domeniului), pe calea de recuperare din producție. Ultima rulare reprodusă: 3 iulie 2026. Vezi metodologia și tabelul complet mai jos.

MetricăValoareCe înseamnă
Articol corect în top 1091,2%În 91,2% din întrebări, articolul de lege așteptat apare printre primele 10 prevederi recuperate.
Articol corect în top 588,2%Restrâns la primele 5 rezultate — cele pe care le vede efectiv modelul care compune răspunsul.
Citare corectă în răspuns97,1%În 97,1% din cazuri, răspunsul final citează chiar articolul așteptat (măsurat end-to-end, cu generare).
Refuz corect în afara domeniului100%La întrebări fără temei în surse, Jurivo refuză să răspundă în loc să improvizeze — 100% din cazurile de control.
MRR (rang mediu reciproc)0,695Măsură de poziționare: cu cât articolul corect apare mai sus în listă, cu atât scorul e mai aproape de 1.
Extensia de drept UE

Drept UE (extensie).

Corpusul de drept UE (GDPR, eIDAS, protecția avertizorilor) e evaluat separat, cu propriile întrebări cu răspuns cunoscut, pe un branch de test dedicat.

  • 100%Pe cele 17 întrebări de drept UE (GDPR, eIDAS, avertizori), articolul corect apare de fiecare dată în top 10.
  • 1,000Scor perfect: articolul corect e constant pe prima poziție pentru corpusul UE indexat.
De ce separat. Când o întrebare e strict de drept român, corpusul UE e exclus din căutare — și invers. Măsurăm fiecare domeniu pe scopul lui, ca cifrele să reflecte cum funcționează efectiv produsul.

17 întrebări de recuperare + 1 de control.

Metodologie

Cum măsurăm, exact.

Benchmark-ul rulează chiar calea de recuperare din producție (recuperare hibridă + rerank), peste un set de întrebări adnotate manual cu articolul de lege corect. Nimic nu e „aranjat" pentru test.

  • Recuperare (hit@k). Pentru fiecare întrebare știm articolul corect. „hit@10" = de câte ori acel articol apare printre primele 10 prevederi recuperate; „hit@5" restrânge la primele 5 — cele văzute efectiv de model.
  • Citare corectă (end-to-end). Generăm răspunsul complet cu modelul de producție și verificăm automat că citează chiar articolul așteptat, nu doar că l-a recuperat.
  • Refuz în afara domeniului. Includem întrebări-capcană fără temei în surse (ex. „Care e capitala Franței?"). Răspunsul corect e refuzul — măsurăm că se întâmplă de fiecare dată.
  • Judecătorul de verificare. Un al doilea model confruntă fiecare afirmație din răspuns cu extrasul citat (susține / parțial / nu susține). Îl calibrăm pe triple etichetate manual, optimizând să nu rateze afirmațiile nesusținute — mecanismul din spatele marcajului de încredere pe care îl vezi în produs.
  • Preflight pe bază de cunoștințe. Înainte de fiecare rulare, un test de sănătate refuză să continue dacă vreun act are prevederi dar zero fragmente indexate — exact clasa de regresie care ne-a lovit o dată și pe care acum o prindem automat.

Legislație primară RO (~14 acte: coduri + legi) + jurisprudență ÎCCJ/CCR, plus extensia de drept UE (GDPR, eIDAS, avertizori). Măsurat pe setul auriu fix, pe calea de recuperare din producție (retrieveForAnswer).

Ce NU spun aceste cifre. Sunt un benchmark intern pe un set finit de întrebări — nu o garanție că orice răspuns e corect. Nu acoperă fiecare speță, iar dreptul se schimbă. Jurivo e un instrument de informare și analiză juridică; verificarea finală și decizia rămân ale avocatului. Publicăm metrici de proces (recuperare, citare, refuz), nu un scor de „adevăr juridic". Cifrele reflectă ultima rulare reprodusă intern, pe starea de atunci a corpusului; le reîmprospătăm pe măsură ce extindem setul de test și baza de cunoștințe.

Transparența e o funcție, nu o pagină.

Aceleași mecanisme pe care le măsurăm aici — citare la articol, status în vigoare/abrogat, verificare automată, refuz onest — rulează la fiecare răspuns. Vezi cum tratăm datele și modelele.