Open datasets · Hugging Face Hub
Bengali research datasets.
Open-access, human-annotated datasets for tutoring reasoning, retrieval diagnostics, safety classification, and multimodal document parsing.
44,000+
Curated Records
100% human-verified
6
Regional Dialects
Content tokens frozen
CC-BY-4.0
Open Licensing
Permissive academic use
100%
Provenance Gated
Official document traces
Open-Access Dataset Repositories (5 Collections)
Hugging Face HubTRACE-BN: Bengali Tutoring Dialogue Reasoning Traces
Multi-turn conversational tutoring traces evaluating pedagogical step verification and code-mixed Bangla-English student error correction across secondary math and CS curricula.
Where Retrieval Fails: Dialectal Passages & Failure Diagnostics
A diagnostic evaluation dataset containing 15,000 multi-dialectal Bengali passages with annotated semantic drift, morphological anomalies, and retriever failure tags.
KrishokChat Bengali Agricultural Safety Evaluation Dataset
A safety-critical evaluation dataset containing 20,112 verified Bengali agricultural queries spanning 6 regional dialects (Standard, Chittagonian, Sylheti, Noakhali, Rangpuri, Barisali) and 12 chemical advisory categories.
ChitraMiti: Multimodal Geometric Diagram Reasoning Dataset
High-resolution geometric proof diagrams paired with formal Bengali Euclidean proofs and step-by-step mathematical reasoning.
Data Ethics, Anonymization & Privacy Protocols
Our datasets strictly comply with academic data ethics. When curating real-world documents with sensitive personal data:
Positional Token Masking
In legal deed benchmarks (KhatianDoc), real citizen names are replaced with positional identifiers ([PERSON_1], [PERSON_2]) to protect citizen privacy while preserving multi-hop inheritance co-reference.
Verbatim Reference Extraction
In chemical safety benchmarks (KrishokChat), ground-truth answers are extracted verbatim from official government extension manuals rather than synthetic LLM generation, preventing synthetic error propagation.
from datasets import load_dataset
# 1. Load KrishokChat Agricultural Safety & Chemical Benchmark
dataset = load_dataset("RaiyanKhaan/krishokChat")
print("Tracks available:", dataset.keys())
print("Test sample:", dataset["test"][0])
# 2. Inspect structured chemical traces for dosage audit
sample = dataset["test"][0]
if "chemical_trace" in sample:
print("Dosage specification:", sample["chemical_trace"])Read the Associated Research Preprints
Each dataset is paired with an empirical preprint paper analyzing failure modes, baseline sweeps, and ablation findings.