Summary:
We are building an initial dataset of over 50,000 paired words using Modi-script manuscripts,
transliterated Marathi texts, and modern Marathi equivalents. Unlike sentence-level datasets,
our focus is on word-by-word pairing and Modi experts' backed meanings, which enables reuse
beyond a single sentence.