返回今日信号
图片
研究论文2026年8月10日 04:00

Stockmark-Nemotron-3-Nano-Omni-JapanDocReader:通过能力注入与遗忘控制实现结构化文档解析

我们提出了Stockmark-Nemotron-3-Nano-Omni-JapanDocReader,这是基于Nemotron-3-Nano-Omni-30B-A3B-Reasoning-BF16构建的日语文档理解模型。该模型旨在通过能力注入和遗忘控制,实现结构化文档解析,同时尽可能保留文档视觉问答(VQA)能力。研究方法包括仅使用结构化文档解析数据的解析中心微调(SFT),结合解析与VQA数据的混合微调,以及基于任务奖励优化结构化解析的解析中心强化学习(RL)。实验表明,解析中心微调提升了结构化解析性能但导致VQA能力下降,混合微调缓解了遗忘并保持解析性能,基于DAPO的解析中心强化学习进一步突破了微调性能极限。训练数据由日语文档VQA和程序化结构化解析两条合成数据流组成,研究还强调了奖励设计与基于方差的提示过滤对长推理结构化解析中RL效果的重要性。

AI Signal Takeaway

这条 研究论文 信号说明,来自 arXiv cs.CL 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。

发生了什么

arXiv cs.CL 发布了这条关于 研究论文 的更新:我们提出了Stockmark-Nemotron-3-Nano-Omni-JapanDocReader,这是基于Nemotron-3-Nano-Omni-30B-A3B-Reasoning-BF16构建的日语文档理解模型。该模型旨在通过能力注入和遗忘控制,实现结构化文档解析,同时尽可能保留文档视觉问答(VQA)能力。研究方法包括仅使用结构化文档解析数据的解析中心微调(SFT),结合解析与VQA数据的混合微调,以及基于任务奖励优化结构化解析的解析中心强化学习(RL)。实验表明,解析中心微调提升了结构化解析性能但导致VQA能力下降,混合微调缓解了遗忘并保持解析性能,基于DAPO的解析中心强化学习进一步突破了微调性能极限。训练数据由日语文档VQA和程序化结构化解析两条合成数据流组成,研究还强调了奖励设计与基于方差的提示过滤对长推理结构化解析中RL效果的重要性。

为什么重要

该研究突破地将结构化文档解析能力注入已有的多模态推理模型,并有效控制因训练引起的遗忘,实现在结构化解析与文档问答之间的性能平衡,提升了日语文档理解领域的模型性能和应用潜力。

谁应该关注

研究员、模型团队和技术战略负责人 应该重点关注这条信号,尤其是正在跟踪 research、papers 的团队。

下一步看什么

接下来观察这条信号是否出现开发者采用、竞品回应、研究复现、企业部署或政策/平台层面的后续动作。

相关信号

[ 2026年8月10日 ]
研究论文
OpenAI Blog/2026年8月10日

模型ML使用GPT-5.6 Sol更高效完成金融工作

模型ML利用GPT-5.6 Sol,从研究和分析到可编辑、可追踪的PPT和Excel工作簿,完整完成金融工作流程。

研究论文
arXiv cs.CV/2026年8月10日

UAV3DCrop:无人机多角度重复农作物三维重建基准测试

UAV3DCrop是一个公开数据集,包含大规模无人机多角度农作物图像,覆盖玉米、大豆、小麦和燕麦等作物,用于评估三维重建技术在重复农田监测中的表现。该基准测试包含七种场景优化方法和四种预训练模型的多指标对比,评估包括图像外观、深度和冠层高度恢复。结果显示不同方法在不同指标上表现不一,当前三维重建技术尚未能兼顾外观、几何和度量精度,且预训练模型中仅有部分能恢复准确的尺度,表明农业场景的三维重建仍具挑战。数据集公开提供,促进精准农业视觉技术发展。

研究论文
arXiv cs.CV/2026年8月10日

基于深度证据回归的多模态卫星影像稀疏森林高度估计

准确估计森林高度对于碳核算、生物多样性监测和生态系统管理等应用至关重要。虽然深度学习方法能提供准确预测,但通常无法量化预测不确定性,这在稀疏标注和地理分布变化的地理空间环境中尤为重要。本文研究了用于森林高度估计的深度证据回归(DER),基于TreeUQ基准数据集,利用Sentinel-1/-2多模态卫星数据和巴伐利亚州的树木清单数据,提出了适应极端标签稀疏性的掩码证据损失。采用U-Net结构,实现树高及其不确定性的一次性预测。实验表明,DER在保持与确定性U-Net相当性能的同时,能有效提供校准良好的不确定性估计,展示了证据学习在地球观测数据不确定感知森林结构估计中的潜力。