SIH Judge Evaluation & Benchmark Dashboard
Quantitative performance metrics measuring retrieval quality, ground-truth citation verification, adversarial red-team trap defense, and safe abstention accuracy.
Live Automated Evaluation Benchmark
Executes statutory questions, classical TK queries, out-of-domain conversational traps, and adversarial fake-law questions.
| Status | Category | Test Query | Domain | Confidence | Expected | Actual Result | Latency |
|---|
🛡️ Red-Team Hallucination Defense Methodology
1. Fake Provision Traps
Queries targeting fabricated sections (e.g., Section 99B, Section 3(z), Ayurvedic Patent Free Grant Act) are intercepted by the deterministic statutory parser and safely abstained from.
2. Out-of-Domain Boundaries
Conversational chitchat, weather, movies, coding, or cryptocurrency queries are classified as Out-of-Domain, preventing legal misinformation or off-topic generation.
3. Citation Verification Stripper
The post-generation citation verifier measures n-gram overlap against retrieved statutory chunks. Any claim failing ground-truth alignment has its citation automatically revoked.