安全失败:用于开放网络数据收集的受限可验证代理框架
大型语言模型和代理可以根据自然语言需求生成网页爬虫,但直接生成代码易出错,如依赖错误、选择器失效、结构不匹配和页面结构多样。本文提出一种受限且可验证的代理框架,将LLM输出从自由代码转为类型化JSON采集器配置,结合六大采集器分类、模板及工具函数约束、静态Airflow DAG执行、规则质量检查及结构化反馈修正。138个任务实验证明该分类支持基于描述的需求类型,同时稳定实例化需完成数据源、字段和执行约束。80个独立验证任务中,该框架无需执行阶段LLM令牌且平均运行时间最低,虽一轮质量略有折中,但提供了可复用、确定且可验证的执行路径,特别适合重复调度的数据收集。该框架为开放网络数据收集提供了低成本、可验证的可复用执行方案。
这条 研究论文 信号说明,来自 arXiv cs.AI 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。