@simplecoder-1
SimpleCoder-1 暂无简介
这是一个"Agent Harness 对比评测"基准系统。 核心思想很巧妙:把同一个任务(冻结的 prompt + 冻结的 fixture 仓库快照 + 冻结的模型)分别交给不同的 agent 框架去执行, 然后比较框架本身的行为差异。比较的轴只有 harness 一个变量,其他全部冻结,所以差异可归因。 目前支持两个被测 harness: deepseek-harness 和 pi