Open datasets · Hugging Face Hub

Bengali research datasets.

Open-access, human-annotated datasets for tutoring reasoning, retrieval diagnostics, safety classification, and multimodal document parsing.

44,000+

Curated Records

100% human-verified

6

Regional Dialects

Content tokens frozen

CC-BY-4.0

Open Licensing

Permissive academic use

100%

Provenance Gated

Official document traces

Open-Access Dataset Repositories (5 Collections)

Hugging Face Hub
4,500 Records
License: CC-BY-4.0

TRACE-BN: Bengali Tutoring Dialogue Reasoning Traces

Multi-turn conversational tutoring traces evaluating pedagogical step verification and code-mixed Bangla-English student error correction across secondary math and CS curricula.

BengaliEnglishStandard BanglaCode-Mixed
15,000 Records
License: CC-BY-4.0

Where Retrieval Fails: Dialectal Passages & Failure Diagnostics

A diagnostic evaluation dataset containing 15,000 multi-dialectal Bengali passages with annotated semantic drift, morphological anomalies, and retriever failure tags.

Bengali6 Regional Dialects
20,112 Records
License: CC-BY-4.0

KrishokChat Bengali Agricultural Safety Evaluation Dataset

A safety-critical evaluation dataset containing 20,112 verified Bengali agricultural queries spanning 6 regional dialects (Standard, Chittagonian, Sylheti, Noakhali, Rangpuri, Barisali) and 12 chemical advisory categories.

BengaliEnglish6 Regional Dialects
3,200 Records
License: CC-BY-4.0

ChitraMiti: Multimodal Geometric Diagram Reasoning Dataset

High-resolution geometric proof diagrams paired with formal Bengali Euclidean proofs and step-by-step mathematical reasoning.

BengaliLaTeXAcademic Bangla
1,200 Records
License: CC-BY-NC-4.0

KhatianDoc: Historical Bengali Land Records & Fractional Math

Historical handwritten CS, SA, and RS Khatian land documents annotated with base-16 Anna-Ganda-Kara-Kranti fractional arithmetic notation.

BengaliHistorical Base-16Archaic Bengali

Data Ethics, Anonymization & Privacy Protocols

Our datasets strictly comply with academic data ethics. When curating real-world documents with sensitive personal data:

Positional Token Masking

In legal deed benchmarks (KhatianDoc), real citizen names are replaced with positional identifiers ([PERSON_1], [PERSON_2]) to protect citizen privacy while preserving multi-hop inheritance co-reference.

Verbatim Reference Extraction

In chemical safety benchmarks (KrishokChat), ground-truth answers are extracted verbatim from official government extension manuals rather than synthetic LLM generation, preventing synthetic error propagation.

Python Integration · Hugging Face Datasets
pip install datasets
from datasets import load_dataset

# 1. Load KrishokChat Agricultural Safety & Chemical Benchmark
dataset = load_dataset("RaiyanKhaan/krishokChat")
print("Tracks available:", dataset.keys())
print("Test sample:", dataset["test"][0])

# 2. Inspect structured chemical traces for dosage audit
sample = dataset["test"][0]
if "chemical_trace" in sample:
    print("Dosage specification:", sample["chemical_trace"])

Read the Associated Research Preprints

Each dataset is paired with an empirical preprint paper analyzing failure modes, baseline sweeps, and ablation findings.