Evaluation matrix & sweeps

Benchmark evaluation registry.

Reproducible baselines and diagnostic sweeps across pedagogical reasoning, dialectal retrieval, tabular grounding, and multimodal geometry.

Deterministic Protocol

Zero temperature (T=0) greedy decoding across all baseline LLM evaluations, eliminating sampling noise and guaranteeing reproducible token traces.

Statistical Significance

BCa bootstrap resampling (10,000 iterations) with paired Wilcoxon signed-rank tests and Holm-Bonferroni correction for multi-hypothesis validation.

Preprint-Traceable

Every table corresponds strictly to our 5 research preprints under review, linking directly to underlying methodology and data splits.

Active Evaluation Sweeps

5 Diagnostic Registries
reasoning
4,500 Conversational Traces • Math & CS Curricula

TRACE-BN: Multi-Turn Bengali Tutoring Reasoning Benchmark

Evaluating multi-turn conversational reasoning, pedagogical step verification, and code-mixed Bangla-English tutoring dialogues comparing foundation LLMs and reasoning chains.

Model / BaselineMetricResult
GPT-4o (Zero-Shot Chain-of-Thought)Pedagogical Accuracy74.2%
Claude 3.5 Sonnet (CoT)Pedagogical Accuracy78.6%
Gemini 1.5 Pro (Bengali Context)Pedagogical Accuracy76.4%
TRACE-BN Fine-Tuned Llama 3 (8B)Pedagogical Accuracy82.1%
Code-Mixed Error LocalizationF1 Score0.842
Step Verification PrecisionPrecision@189.3%
retrieval
15,000 Dialectal Passages • 6 Dialects

Where Does Retrieval Fail? Diagnostic Sweeps on Low-Resource Bengali RAG

Empirical failure boundary analysis measuring retrieval recall@k, semantic drift, and ranking degradation across standard Bengali, regional dialects, and technical register shifts.

Model / BaselineMetricResult
BM25 Standard (k1=1.2, b=0.75)MRR@10 (Dialectal)0.362
BM25 Dialect-Tuned (k1=2.2, b=0.4)MRR@10 (Dialectal)0.518
Dense mE5-small (FAISS Index)MRR@10 (Dialectal)0.564
Multilingual BGE-M3 (Dense)MRR@10 (Dialectal)0.602
Hybrid Reciprocal Rank Fusion (BM25 + mE5)MRR@10 (Dialectal)0.674
Dialect Normalizer + Hybrid RRFRecall@50.789
retrieval
2,120 Knowledge Nodes • 13 Agricultural Institutions

KrishokChat Dual-Retriever Evaluation Sweep

Evaluating retrieval recall@k and mean reciprocal rank across Bengali agricultural advisory queries comparing BM25, dense embeddings (mE5-small), and hybrid Reciprocal Rank Fusion (RRF).

Model / BaselineMetricResult
BM25 (k1=1.2, b=0.75 default)Recall@50.41
BM25 Optimized (k1=2.2, b=0.4 tuned)Recall@50.54
Dense Retriever (mE5-small + FAISS)Recall@50.58
Hybrid RRF (BM25 + mE5 Fusion)Recall@50.63
Wheat 11-Class Disease Vision SweepTop-1 Accuracy44/50 = 88%
437-Image Crop Library SweepCoverage Recall436/437 = 99.8%
safety
20,112 Safety Evaluation Records

Bengali Chemical Advisory Safety Refusal Benchmark

Diagnostic safety refusal evaluation measuring false-positive advisory rates and hazardous pesticide dosage rejection across 6 regional dialects and 12 agricultural chemical categories.

Model / BaselineMetricResult
Standard LLM Zero-ShotHazard Refusal Rate52.4%
Fine-Tuned Bengali LLMHazard Refusal Rate78.1%
KrishokChat Multi-Stage Safety SinkHazard Refusal Rate97.6%
Dialectal Safety NormalizerRefusal Precision99.1%
Prohibited Compound DetectionF1 Score0.984
multimodal
3,200 High-Res Geometry Proof Diagrams

ChitraMiti: Multimodal Geometric Diagram Reasoning Benchmark

Cross-modal geometric problem-solving pairing high-resolution diagram parsing with step-by-step Bengali theorem proofs and Euclidean construction steps.

Model / BaselineMetricResult
Tesseract OCR + LLM PipelineTheorem Parsing Accuracy38.2%
pix2tex ViT TransformerLaTeX Proof Accuracy79.5%
GPT-4V Multimodal (Bengali)Geometric Step Accuracy71.0%
ChitraMiti Unified Vision-ReasonerOverall Proof Accuracy84.3%
systems
1,200 Flood Zone Geometries • PostGIS

Nirapod Probaho: Multi-Agent Geospatial Triage Latency Sweep

Benchmarking autonomous agent response latency, spatial pathfinding execution time, and volunteer dispatch routing across dynamic flood polygons.

Model / BaselineMetricResult
Sequential Single-Agent ScriptTriage Latency14.2s
CrewAI Multi-Agent PipelineTriage Latency3.4s
PostGIS Spatial Query OptimizationRouting Execution42ms
MapLibre GL Vector Tile PipelineClient FPS (60hz)59.8 FPS
Compute & Reproducibility Environment

Hardware Infrastructure & Evaluation Harness

Evaluation GPUs

Nvidia A100-SXM4 (80GB) & Dual RTX 4090 (24GB VRAM)

Inference Engines

vLLM 0.6.4 (TensorRT-LLM) & OpenRouter unified gateway

Edge Quantization

Unsloth 4-bit LoRA + llama.cpp GGUF Q4_K_M export

Scoring Libraries

SymPy 1.13, FAISS 1.8.0, SacreBLEU, Rouge-Score, ANLS

Want to benchmark your model against these test splits?

We openly share evaluation manifests, scoring scripts, and test-split queries with research labs and reviewers working on low-resource and South Asian NLP.