Obshazard-bench:用于从原始地球观测流实时获取灾害情报的多模态基础模型基准测试
多模态大型语言模型(MLLMs)越来越多地被用于解读地球观测数据,但其支持真实灾害应急响应的能力尚未得到充分评估。现有遥感基准多依赖静态、事后且专家处理的产品,难以适应灾害快速演变和决策时间受限的实际场景。为此,Obshazard-bench 提出了一种基于实时观测的基准测试,直接整合了来自多种卫星传感器的高频原始声学流及地面观测、历史灾害记录和社会经济指标,避免了专家延迟处理和物理反演流程。该基准涵盖8大类灾害和28个子类,覆盖60多个国家,包含超过120个历史极端事件案例和数千生命周期定向视觉问答样本。其三阶段评估体系对应灾害操作流程:预测危机预警、灾害演进推理及多维影响量化。实验显示现有通用与地球专用基础模型在将多通道物理观测转化为时间关联且决策相关的灾害推理方面存在显著局限。
这条 研究论文 信号说明,来自 arXiv cs.CL 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。
