GanitLLM：基于课程式GRPO的难度感知型孟加拉语数学推理模型 (GanitLLM: Difficulty-Aware Bengali Mathematical Reasoning through Curriculum-GRPO) - 专知论文

会员服务 ·

0

数学 · 课程 · 数据集 · 推理模型 · 数学推理 ·

GanitLLM: Difficulty-Aware Bengali Mathematical Reasoning through Curriculum-GRPO

翻译：GanitLLM：基于课程式GRPO的难度感知型孟加拉语数学推理模型

Shubhashis Roy Dipta,Khairul Mahbub,Nadia Najjar

We present a Bengali mathematical reasoning model called GanitLLM (named after the Bangla word for mathematics, "Ganit"), together with a new difficulty-aware Bengali math corpus and a curriculum-based GRPO pipeline. Bengali is one of the world's most widely spoken languages, yet existing LLMs either reason in English and then translate, or simply fail on multi-step Bengali math, in part because reinforcement learning recipes are tuned for high-resource languages and collapse under reward sparsity in low-resource settings. To address this, we construct Ganit, a rigorously filtered and decontaminated Bengali math dataset with automatic difficulty tags derived from the pass@k of a strong evaluator model. Building on this dataset, we propose Curriculum-GRPO, which combines multi-stage training (SFT + GRPO) with difficulty-aware sampling and verifiable rewards for format, numerical correctness, and Bengali reasoning. On Bn-MGSM and Bn-MSVAMP, GanitLLM-4B improves over its Qwen3-4B base by +8 and +7 accuracy points, respectively, while increasing the percentage of Bengali reasoning tokens from 14% to over 88% and reducing average solution length from 943 to 193 words.

翻译：本文提出了一种名为GanitLLM（以孟加拉语数学词汇"Ganit"命名）的孟加拉语数学推理模型，同时构建了新型难度感知孟加拉语数学语料库及基于课程的GRPO训练流程。孟加拉语作为全球使用最广泛的语言之一，现有大语言模型在处理多步骤孟加拉语数学问题时，要么依赖英语推理后翻译，要么直接失效，部分原因在于强化学习方案主要针对高资源语言设计，在低资源场景的稀疏奖励环境下容易失效。为解决此问题，我们构建了Ganit数据集——一个经过严格筛选和去污染的孟加拉语数学数据集，其自动难度标签源自强评估模型的pass@k指标。基于该数据集，我们提出课程式GRPO方法，该方法融合多阶段训练（SFT + GRPO）、难度感知采样机制，以及针对格式、数值正确性和孟加拉语推理的可验证奖励机制。在Bn-MGSM和Bn-MSVAMP基准测试中，GanitLLM-4B相较于其基础模型Qwen3-4B分别提升8和7个准确率百分点，同时将孟加拉语推理标记比例从14%提升至88%以上，并将平均解答长度从943词缩减至193词。

0

相关内容

数学是关于数量、结构、变化等主题的探索。

从感知到推理：深度思考赋能多模态大语言模型

从感知到推理：深度思考赋能多模态大语言模型

专知会员服务

24+阅读 · 2025年11月19日

《面向遥感的多模态小语言模型——引入思维链推理与GRPO技术》

《面向遥感的多模态小语言模型——引入思维链推理与GRPO技术》

专知会员服务

26+阅读 · 2025年5月16日

强化多模态大语言模型：基于强化学习的推理综述

强化多模态大语言模型：基于强化学习的推理综述

专知会员服务

35+阅读 · 2025年5月3日

【微软亚研】rStar-Math：小型大语言模型通过自我进化的深度思维掌握数学推理

【微软亚研】rStar-Math：小型大语言模型通过自我进化的深度思维掌握数学推理

专知会员服务

24+阅读 · 2025年1月13日

《多模态大语言模型时代的数学推理研究：基准、方法与挑战》

《多模态大语言模型时代的数学推理研究：基准、方法与挑战》

专知会员服务

37+阅读 · 2024年12月18日

不可错过！加州理工最新《大模型推理》课程

不可错过！加州理工最新《大模型推理》课程

专知会员服务

73+阅读 · 2024年4月15日

RAG+LLM=？同济大学等最新《大型语言模型的检索增强生成》综述

RAG+LLM=？同济大学等最新《大型语言模型的检索增强生成》综述

专知会员服务

111+阅读 · 2023年12月19日

中科大腾讯最新《多模态大型语言模型》综述，详述多模态指令微调、上下文学习、思维链和辅助视觉推理技术

中科大腾讯最新《多模态大型语言模型》综述，详述多模态指令微调、上下文学习、思维链和辅助视觉推理技术

专知会员服务

105+阅读 · 2023年6月27日

【清华大学】Delta调优:预训练语言模型参数有效方法的综合研究，Delta Tuning: A Comprehensive Study of Parameter Efficient Methods for Pre-trained Language Models

【清华大学】Delta调优:预训练语言模型参数有效方法的综合研究，Delta Tuning: A Comprehensive Study of Parameter Efficient Methods for Pre-trained Language Models

专知会员服务

26+阅读 · 2022年3月15日

【NLPCC2020】多模态知识图谱构建、推理与挑战，东南大学王萌博士

专知会员服务

148+阅读 · 2020年10月21日

图神经网络模型集合GraphGallery，TensorFLow&PyTorch一并实现

图神经网络模型集合GraphGallery，TensorFLow&PyTorch一并实现

专知

20+阅读 · 2020年10月5日

系列教程GNN-algorithms之五：《注意力机制在图上的应用—GAT》

系列教程GNN-algorithms之五：《注意力机制在图上的应用—GAT》

专知

14+阅读 · 2020年8月7日

Tensorflow GNN最佳实践：tf_geometric（附图自编码器GAE完整代码）

Tensorflow GNN最佳实践：tf_geometric（附图自编码器GAE完整代码）

图与推荐

130+阅读 · 2020年2月6日

【加州理工】什么是模仿学习(Imitation Learning（模仿学习), 这62页ppt带你了解进展，附下载

【加州理工】什么是模仿学习(Imitation Learning（模仿学习), 这62页ppt带你了解进展，附下载

专知

21+阅读 · 2019年11月14日

绝对干货！NLP预训练模型：从transformer到albert

绝对干货！NLP预训练模型：从transformer到albert

新智元

13+阅读 · 2019年11月10日

【Github】nlp-tutorial：TensorFlow 和 PyTorch 实现各种NLP模型

【Github】nlp-tutorial：TensorFlow 和 PyTorch 实现各种NLP模型

AINLP

14+阅读 · 2019年9月4日

BAM！利用知识蒸馏和多任务学习构建的通用语言模型

BAM！利用知识蒸馏和多任务学习构建的通用语言模型

机器之心

15+阅读 · 2019年3月18日

换个角度看GAN：另一种损失函数

换个角度看GAN：另一种损失函数

机器之心

16+阅读 · 2019年1月1日

微软研究院Jianfeng Gao：基于深度学习的自然语言处理导论（课程，附PPT下载链接）

微软研究院Jianfeng Gao：基于深度学习的自然语言处理导论（课程，附PPT下载链接）

专知

17+阅读 · 2018年1月24日

GAN的数学原理

GAN的数学原理

算法与数学之美

16+阅读 · 2017年9月2日

广义Cartan型模李超代数的构作与阶化模

国家自然科学基金

0+阅读 · 2015年12月31日

随机Kolmogorov型系统及其数值解的渐近性质分析

国家自然科学基金

0+阅读 · 2015年12月31日

基于犹豫模糊语言信息的定性决策理论与方法

国家自然科学基金

2+阅读 · 2015年12月31日

复杂数据下带有形状约束的半参数模型统计推断

国家自然科学基金

3+阅读 · 2014年12月31日

线性时序关系下推理的概率计量化模型

国家自然科学基金

0+阅读 · 2014年12月31日

基于quantaloid-加载范畴的quantale值收敛理论

国家自然科学基金

1+阅读 · 2014年12月31日

维吾尔语单元集优化关键技术研究及其在语音识别中的应用

国家自然科学基金

0+阅读 · 2014年12月31日

随机Helmholtz型问题的数值方法

国家自然科学基金

0+阅读 · 2014年12月31日

不确定性推理与语义网中知识表示的数学基础

国家自然科学基金

18+阅读 · 2012年12月31日

基于贝叶斯推理的模糊逻辑强化学习模型研究

国家自然科学基金

18+阅读 · 2012年12月31日

SwimBird: Eliciting Switchable Reasoning Mode in Hybrid Autoregressive MLLMs

Arxiv

0+阅读 · 2月5日

Unveiling Implicit Advantage Symmetry: Why GRPO Struggles with Exploration and Difficulty Adaptation

Arxiv

0+阅读 · 2月5日

Multi-Task GRPO: Reliable LLM Reasoning Across Tasks

Arxiv

0+阅读 · 2月5日

Harder Is Better: Boosting Mathematical Reasoning via Difficulty-Aware GRPO and Multi-Aspect Question Reformulation

Arxiv

0+阅读 · 1月28日

MathMist: A Parallel Multilingual Benchmark Dataset for Mathematical Problem Solving and Reasoning

Arxiv

0+阅读 · 1月24日

TangramPuzzle: Evaluating Multimodal Large Language Models with Compositional Spatial Reasoning

Arxiv

0+阅读 · 1月23日

TL-GRPO: Turn-Level RL for Reasoning-Guided Iterative Optimization

Arxiv

0+阅读 · 1月23日

BLUCK: A Benchmark Dataset for Bengali Linguistic Understanding and Cultural Knowledge

Arxiv

0+阅读 · 1月19日

BnMMLU: Measuring Massive Multitask Language Understanding in Bengali

Arxiv

0+阅读 · 1月11日

†DAGGER: Distractor-Aware Graph Generation for Executable Reasoning in Math Problems

Arxiv

0+阅读 · 1月11日

VIP会员

文章信息

相关主题

相关VIP内容

从感知到推理：深度思考赋能多模态大语言模型

从感知到推理：深度思考赋能多模态大语言模型

专知会员服务

24+阅读 · 2025年11月19日

《面向遥感的多模态小语言模型——引入思维链推理与GRPO技术》

《面向遥感的多模态小语言模型——引入思维链推理与GRPO技术》

专知会员服务

26+阅读 · 2025年5月16日

强化多模态大语言模型：基于强化学习的推理综述

强化多模态大语言模型：基于强化学习的推理综述

专知会员服务

35+阅读 · 2025年5月3日

【微软亚研】rStar-Math：小型大语言模型通过自我进化的深度思维掌握数学推理

【微软亚研】rStar-Math：小型大语言模型通过自我进化的深度思维掌握数学推理

专知会员服务

24+阅读 · 2025年1月13日

《多模态大语言模型时代的数学推理研究：基准、方法与挑战》

《多模态大语言模型时代的数学推理研究：基准、方法与挑战》

专知会员服务

37+阅读 · 2024年12月18日

不可错过！加州理工最新《大模型推理》课程

不可错过！加州理工最新《大模型推理》课程

专知会员服务

73+阅读 · 2024年4月15日

RAG+LLM=？同济大学等最新《大型语言模型的检索增强生成》综述

RAG+LLM=？同济大学等最新《大型语言模型的检索增强生成》综述

专知会员服务

111+阅读 · 2023年12月19日

中科大腾讯最新《多模态大型语言模型》综述，详述多模态指令微调、上下文学习、思维链和辅助视觉推理技术

中科大腾讯最新《多模态大型语言模型》综述，详述多模态指令微调、上下文学习、思维链和辅助视觉推理技术

专知会员服务

105+阅读 · 2023年6月27日

【清华大学】Delta调优:预训练语言模型参数有效方法的综合研究，Delta Tuning: A Comprehensive Study of Parameter Efficient Methods for Pre-trained Language Models

【清华大学】Delta调优:预训练语言模型参数有效方法的综合研究，Delta Tuning: A Comprehensive Study of Parameter Efficient Methods for Pre-trained Language Models

专知会员服务

26+阅读 · 2022年3月15日

【NLPCC2020】多模态知识图谱构建、推理与挑战，东南大学王萌博士

专知会员服务

148+阅读 · 2020年10月21日

热门VIP内容

开通专知VIP会员享更多权益服务

论学习、公平性与复杂度

《整合杀伤链：一个用于边缘目标验证与战术推理的零样本框架》最新资料

2025中国人工智能学会系列白皮书⸺棋盘上的人工智能|附下载

通用智能体评估的逻辑架构

相关资讯

图神经网络模型集合GraphGallery，TensorFLow&PyTorch一并实现

图神经网络模型集合GraphGallery，TensorFLow&PyTorch一并实现

专知

20+阅读 · 2020年10月5日

系列教程GNN-algorithms之五：《注意力机制在图上的应用—GAT》

系列教程GNN-algorithms之五：《注意力机制在图上的应用—GAT》

专知

14+阅读 · 2020年8月7日

Tensorflow GNN最佳实践：tf_geometric（附图自编码器GAE完整代码）

Tensorflow GNN最佳实践：tf_geometric（附图自编码器GAE完整代码）

图与推荐

130+阅读 · 2020年2月6日

【加州理工】什么是模仿学习(Imitation Learning（模仿学习), 这62页ppt带你了解进展，附下载

【加州理工】什么是模仿学习(Imitation Learning（模仿学习), 这62页ppt带你了解进展，附下载

专知

21+阅读 · 2019年11月14日

绝对干货！NLP预训练模型：从transformer到albert

绝对干货！NLP预训练模型：从transformer到albert

新智元

13+阅读 · 2019年11月10日

【Github】nlp-tutorial：TensorFlow 和 PyTorch 实现各种NLP模型

【Github】nlp-tutorial：TensorFlow 和 PyTorch 实现各种NLP模型

AINLP

14+阅读 · 2019年9月4日

BAM！利用知识蒸馏和多任务学习构建的通用语言模型

BAM！利用知识蒸馏和多任务学习构建的通用语言模型

机器之心

15+阅读 · 2019年3月18日

换个角度看GAN：另一种损失函数

换个角度看GAN：另一种损失函数

机器之心

16+阅读 · 2019年1月1日

微软研究院Jianfeng Gao：基于深度学习的自然语言处理导论（课程，附PPT下载链接）

微软研究院Jianfeng Gao：基于深度学习的自然语言处理导论（课程，附PPT下载链接）

专知

17+阅读 · 2018年1月24日

GAN的数学原理

GAN的数学原理

算法与数学之美

16+阅读 · 2017年9月2日

相关论文

SwimBird: Eliciting Switchable Reasoning Mode in Hybrid Autoregressive MLLMs

Arxiv

0+阅读 · 2月5日

Unveiling Implicit Advantage Symmetry: Why GRPO Struggles with Exploration and Difficulty Adaptation

Arxiv

0+阅读 · 2月5日

Multi-Task GRPO: Reliable LLM Reasoning Across Tasks

Arxiv

0+阅读 · 2月5日

Harder Is Better: Boosting Mathematical Reasoning via Difficulty-Aware GRPO and Multi-Aspect Question Reformulation

Arxiv

0+阅读 · 1月28日

MathMist: A Parallel Multilingual Benchmark Dataset for Mathematical Problem Solving and Reasoning

Arxiv

0+阅读 · 1月24日

TangramPuzzle: Evaluating Multimodal Large Language Models with Compositional Spatial Reasoning

Arxiv

0+阅读 · 1月23日

TL-GRPO: Turn-Level RL for Reasoning-Guided Iterative Optimization

Arxiv

0+阅读 · 1月23日

BLUCK: A Benchmark Dataset for Bengali Linguistic Understanding and Cultural Knowledge

Arxiv

0+阅读 · 1月19日

BnMMLU: Measuring Massive Multitask Language Understanding in Bengali

Arxiv

0+阅读 · 1月11日

†DAGGER: Distractor-Aware Graph Generation for Executable Reasoning in Math Problems

Arxiv

0+阅读 · 1月11日

相关基金

广义Cartan型模李超代数的构作与阶化模

国家自然科学基金

0+阅读 · 2015年12月31日

随机Kolmogorov型系统及其数值解的渐近性质分析

国家自然科学基金

0+阅读 · 2015年12月31日

基于犹豫模糊语言信息的定性决策理论与方法

国家自然科学基金

2+阅读 · 2015年12月31日

复杂数据下带有形状约束的半参数模型统计推断

国家自然科学基金

3+阅读 · 2014年12月31日

线性时序关系下推理的概率计量化模型

国家自然科学基金

0+阅读 · 2014年12月31日

基于quantaloid-加载范畴的quantale值收敛理论

国家自然科学基金

1+阅读 · 2014年12月31日

维吾尔语单元集优化关键技术研究及其在语音识别中的应用

国家自然科学基金

0+阅读 · 2014年12月31日

随机Helmholtz型问题的数值方法

国家自然科学基金

0+阅读 · 2014年12月31日

不确定性推理与语义网中知识表示的数学基础

国家自然科学基金

18+阅读 · 2012年12月31日

基于贝叶斯推理的模糊逻辑强化学习模型研究

国家自然科学基金

18+阅读 · 2012年12月31日

微信扫码咨询专知VIP会员