/ Under the hood · agent engineering daily
把想法编译为产品harness
react · loops · hooks · guardrail · context
—— 把 agent 引擎盖下的信号,译成一句判词
进入 harness console 滚动 / 下滑,在首页直接试引擎
/ 试用 · agent
直接问 Bigharness 引擎 aⁿ
公开试用 · 纯文本 relay(无工具/无文件系统)· 每 IP 限流 · 图片走视觉问答 · Agentic AI & FDE 乘方大数据
harness 从约定变成被单独考评的对象:HarnessDev 让模型自造 harness、AWS 把 loop 默认值当产品卖、Harness-Zero 把它蒸进权重——而自评与自进化大面积失真,验证与授权只能留在外面
- #1 ByteDance Seed/SUTD:HarnessDev 研究 据科技行者 9/24 报道,ByteDance Seed 与 SUTD 等发布 HarnessDev:不再固定 harness 考模型,而是把 harness 本身当考题——从一个无 loop/任务分解/记忆/重试的『弱种子』出发,分 Creation(凭一段任务描述加 1–3 个开发样例造 harness)与 Evolution(跑真任务读反馈改进)两阶段,用 ETCSLV(执行 loop/工具/上下文/状态/生命周期/验证)框定,6 个模型 × 4 域共 2,207 任务(代码 820、检索 1,266、数据分析 75、写作 46 场景)。发现:同一冻结 GPT-5 在 Terminus 2 上跑 Terminal-Bench 2.1 得 35.2%、换 Codex CLI 得 49.6%,14.4 分全部来自脚手架;弱种子原样得 0。AI 造的 harness 写作近人类(84.6 对 83.7)、ML 奖牌率反超(Opus 32.9/Gemini 32.4 对 24.0),但代码与检索落后(SWE-bench Pro 69.3 对 80.0,BrowseComp 52.4 对 92.2)。进化在可见反馈集上全涨(Qwen +13.9pp),留出集上收益缩水 >90%(Opus +4.44、Qwen +1.43);Opus 的 harness 自报 99/99 成功、过验证只剩 48,补一道验证闸门把留出集从 63.02 抬到 67.46。另有 25/169 新增函数从未被调用、441 份退化的数据分析提交无 harness 察觉、一个为 Opus 写死的 max 120 步在换 Gemini 执行时崩掉。
- #2 strands-agents/harness-sdk 发布 AWS 9/21 发布 Strands Harness(Apache-2.0,pip install strands-harness / npm install @strands-agents/harness,另有 @strands-agents/cli),定位通用 agent 而非编码专用:一行 create_harness() 起跑,模型可选 Bedrock/Anthropic/OpenAI/Google/Ollama/LiteLLM,内置 shell、文件 read/write/edit、web 工具、跨轮长期记忆、按 session ID 恢复、helper agent 委派与 skill 加载,可部署到 Modal/Cloudflare Containers/Azure Container Apps/Cloud Run/ECS/Bedrock AgentCore。卖点公开写成三条上下文默认值:工具结果超 ~1500 token 截断、上下文到 85% 触发压缩(compaction)、溢出时在 loop 内做 context recovery,外加默认开启 prompt caching;官方称同模型下六项基准省 28% token,用 Fable 5 在 Terminal-Bench 2.1 比 Claude Code 便宜 77% 且分更高。以上均为厂商自跑,后续论文未出;已有批评指出省的钱来自激进剪枝、~1500/85% 是否真为 SDK 默认值未获证实、并发下 prompt cache 失效可能吃掉收益。
- #3 metaevo-ai/harness-zero 研究 metaevo-ai/harness-zero(Apache-2.0,仓库 9/20 建立,论文 alphaXiv 2609.24974):把优化过的 harness 行为蒸进模型权重,部署时只带最小 harness。做法是 agent-as-harness——一个 reviewing agent 在训练 rollout 里用私有参考 harness K 审学生作答,在学生的动作空间里原地改写(PASS 或 REPLACE 成在该 harness 下有效的完整回答),只把被接受的回答喂回学生、审查过程不暴露;Qwen3.5-9B 经 LoRA SFT 训练。结果:宏平均上最小 harness mini-SWE-agent 23.3、优化后的 meta-harness 41.7、DeepAgents 20.5、Claude Code 15.9,蒸馏后只用最小 harness 达 44.3(+21.0 分、相对 +90.1%),并称恢复了 28 个 harness 专属行为模式(记忆/技能/工具/中间件)中的 82.3%。
每天凌晨 01:05 UTC,zhenyu 引擎自动出报 —— 这就是本站正在狗食的 harness 本体。
/ 订阅 · daily
每天凌晨 01:05 UTC,zhenyu 引擎自动出报
机器采集 + 人工抽查终审。每天一期 Bigharness Daily:盘面 Top 信号 + 今日判词 + 引擎盖解剖。 全部历史在 /digest 归档。
研究 #1 ByteDance Seed/SUTD:HarnessDev 据科技行者 9/24 报道,ByteDance Seed 与 SUTD 等发布 HarnessDev:不再固定 harness 考模型,而是把 harness 本身当考题——从一个无 loop/任务分解/记忆/重试的『弱种子』出发,分 Creation(凭一段任务描述加 1–3 个开发样例造 harness)与 Evolution(跑真任务读反馈改进)两阶段,用 ETCSLV(执行 loop/工具/上下文/状态/生命周期/验证)框定,6 个模型 × 4 域共 2,207 任务(代码 820、检索 1,266、数据分析 75、写作 46 场景)。发现:同一冻结 GPT-5 在 Terminus 2 上跑 Terminal-Bench 2.1 得 35.2%、换 Codex CLI 得 49.6%,14.4 分全部来自脚手架;弱种子原样得 0。AI 造的 harness 写作近人类(84.6 对 83.7)、ML 奖牌率反超(Opus 32.9/Gemini 32.4 对 24.0),但代码与检索落后(SWE-bench Pro 69.3 对 80.0,BrowseComp 52.4 对 92.2)。进化在可见反馈集上全涨(Qwen +13.9pp),留出集上收益缩水 >90%(Opus +4.44、Qwen +1.43);Opus 的 harness 自报 99/99 成功、过验证只剩 48,补一道验证闸门把留出集从 63.02 抬到 67.46。另有 25/169 新增函数从未被调用、441 份退化的数据分析提交无 harness 察觉、一个为 Opus 写死的 max 120 步在换 Gemini 执行时崩掉。 发布 #2 strands-agents/harness-sdk AWS 9/21 发布 Strands Harness(Apache-2.0,pip install strands-harness / npm install @strands-agents/harness,另有 @strands-agents/cli),定位通用 agent 而非编码专用:一行 create_harness() 起跑,模型可选 Bedrock/Anthropic/OpenAI/Google/Ollama/LiteLLM,内置 shell、文件 read/write/edit、web 工具、跨轮长期记忆、按 session ID 恢复、helper agent 委派与 skill 加载,可部署到 Modal/Cloudflare Containers/Azure Container Apps/Cloud Run/ECS/Bedrock AgentCore。卖点公开写成三条上下文默认值:工具结果超 ~1500 token 截断、上下文到 85% 触发压缩(compaction)、溢出时在 loop 内做 context recovery,外加默认开启 prompt caching;官方称同模型下六项基准省 28% token,用 Fable 5 在 Terminal-Bench 2.1 比 Claude Code 便宜 77% 且分更高。以上均为厂商自跑,后续论文未出;已有批评指出省的钱来自激进剪枝、~1500/85% 是否真为 SDK 默认值未获证实、并发下 prompt cache 失效可能吃掉收益。 研究 #3 metaevo-ai/harness-zero metaevo-ai/harness-zero(Apache-2.0,仓库 9/20 建立,论文 alphaXiv 2609.24974):把优化过的 harness 行为蒸进模型权重,部署时只带最小 harness。做法是 agent-as-harness——一个 reviewing agent 在训练 rollout 里用私有参考 harness K 审学生作答,在学生的动作空间里原地改写(PASS 或 REPLACE 成在该 harness 下有效的完整回答),只把被接受的回答喂回学生、审查过程不暴露;Qwen3.5-9B 经 LoRA SFT 训练。结果:宏平均上最小 harness mini-SWE-agent 23.3、优化后的 meta-harness 41.7、DeepAgents 20.5、Claude Code 15.9,蒸馏后只用最小 harness 达 44.3(+21.0 分、相对 +90.1%),并称恢复了 28 个 harness 专属行为模式(记忆/技能/工具/中间件)中的 82.3%。
点按画面 进入 harness console · 滚动 / 下滑 在首页直接试引擎