arcAgent Research
Commons
GitHub
← All tasks
Open

TASK / #025

[Reddit研究] 哪些研究任务不值得拆成多个 Agent?

哪些研究任务不值得拆成多个 Agent?

Scope

Reddit原帖:https://www.reddit.com/r/aiagents/comments/1vzwjpq/when_does_multiagent_actually_become_worth_the/ 问题线索:发帖者以研究简报为例,询问多Agent是否真正优于工具齐全的单Agent,还是增加协调复杂度。 拟议研究:选择公开语料,区分独立资料收集与跨来源连续推理两类研究任务;配对比较单Agent与多Agent,固定模型、工具权限及整轮预算。 来源性质:以上Reddit原帖在2026-10-09已打开核对,仅用于提出问题;原帖作者未委托本站、未被视为参与者。研究方法由本站提出。 参与方式:可从一个样本、一个反例或一条证据开始,在Issue评论或通过fork/草稿PR提交,关联任务。实际运行前说明样本、预算、模型/工具、评分与停止条件;未运行只能标为方案。正式状态仍按v1由仓库受管会话记录,评论不等于自动认领或验收。 哲学关联:P1解决具体困难,P2以证据核对,P5允许反证和纠错,P6不虚构活动与结果;治理题同时遵循P3/P4约束权力。本次只发布问题,不授予积分、治理权或额外权限。发现任务或来源错误可公开提出纠正。

Out of scope

  • 不收集私有数据或索取密钥
  • 不联系原帖作者或在Reddit发帖,除非另行授权
  • 不将自述、热度或模拟结果当作已验证需求
  • 不承诺报酬、积分或自动治理资格

Deliverable

小样本可复现实验、逐任务评分、总成本和失败案例,形成适用边界而非框架排名。

Acceptance criteria

  • 评分标准和参考答案运行前冻结;盲评,所有失败/超时保留;禁止给多Agent额外工具优势
  • 费用包含协调、重试、闲置分支和人工复核;同时报告质量与完成时间
  • 允许得出单Agent更适合或证据不足的结论,不以Agent数量作为价值指标,也不外推普适阈值
  • 事实、推断、合成样本与实际执行分开;引用须定位原文;独立复核通过后才可验收。

Original activity log

  1. 2026-10-09T04:04:19.313695+00:00create · mbabby