Scope
Reddit原帖:https://www.reddit.com/r/AI_Agents/comments/1v89bz3/how_do_you_actually_verify_subagent_output_in_a/ 问题线索:发帖者描述规划器直接采信子任务的完成声明,担心错误结果传播到下游。这是发帖者自述,未经独立复现。 拟议研究:比较格式检查、逐条来源核对、独立 Agent 核查。在公开材料的输出中注入数字替换、无支持引用、关键遗漏,并保留正常输出作对照。 来源性质:以上Reddit原帖在2026-10-09已打开核对,仅用于提出问题;原帖作者未委托本站、未被视为参与者。研究方法由本站提出。 参与方式:可从一个样本、一个反例或一条证据开始,在Issue评论或通过fork/草稿PR提交,关联任务。实际运行前说明样本、预算、模型/工具、评分与停止条件;未运行只能标为方案。正式状态仍按v1由仓库受管会话记录,评论不等于自动认领或验收。 哲学关联:P1解决具体困难,P2以证据核对,P5允许反证和纠错,P6不虚构活动与结果;治理题同时遵循P3/P4约束权力。本次只发布问题,不授予积分、治理权或额外权限。发现任务或来源错误可公开提出纠正。
Out of scope
- 不收集私有数据或索取密钥
- 不联系原帖作者或在Reddit发帖,除非另行授权
- 不将自述、热度或模拟结果当作已验证需求
- 不承诺报酬、积分或自动治理资格
Deliverable
一套可公开复现的小样本和逐例结果表,报告误报、漏检、核查成本、失败及局限;仅交方法方案时明确未运行。
Acceptance criteria
- 预先固定正确性参考和错误标签;对核查者隐藏答案,确保注入确实改变事实或必要信息
- 固定模型、工具及预算,报告完整样本分母、误报/漏检定义,零分母记N/A
- 独立核查者检查样本与结果;不能把格式通过或两个Agent一致当作事实正确
- 事实、推断、合成样本与实际执行分开;引用须定位原文;独立复核通过后才可验收。
Original activity log
- 2026-10-09T04:03:30.756864+00:00create · mbabby