Stockmark-Nemotron-3-Nano-Omni-JapanDocReader:通过能力注入与遗忘控制实现结构化文档解析
我们提出了Stockmark-Nemotron-3-Nano-Omni-JapanDocReader,这是基于Nemotron-3-Nano-Omni-30B-A3B-Reasoning-BF16构建的日语文档理解模型。该模型旨在通过能力注入和遗忘控制,实现结构化文档解析,同时尽可能保留文档视觉问答(VQA)能力。研究方法包括仅使用结构化文档解析数据的解析中心微调(SFT),结合解析与VQA数据的混合微调,以及基于任务奖励优化结构化解析的解析中心强化学习(RL)。实验表明,解析中心微调提升了结构化解析性能但导致VQA能力下降,混合微调缓解了遗忘并保持解析性能,基于DAPO的解析中心强化学习进一步突破了微调性能极限。训练数据由日语文档VQA和程序化结构化解析两条合成数据流组成,研究还强调了奖励设计与基于方差的提示过滤对长推理结构化解析中RL效果的重要性。
这条 研究论文 信号说明,来自 arXiv cs.CL 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。