# 独立来源 SWE 工作流复核

36 次真实 Qwen3-8B 尝试比较四种条件：无技能、直接预加载、真实 MCP
预加载、MCP 预加载等长无关内容。三个公开 SWE-bench Verified 任务分别来自
Astropy、pytest 和 SymPy，每种条件、每个任务使用三个种子。模型运行于 L40S。

没有尝试获得上游验收。**31 次有可判读的原生测试报告，5 次因上游报告标记
基础设施异常而列为结果不确定。** 8 次产生了非空补丁；1 次生成请求超时，
用量记录不完整。这组结果不能证明技能收益、传输方式优势或模型的总体能力。

大量工具失败来自重复读取错误路径。五份 pytest 提交的日志同时含有离线构建
依赖安装失败和候选代码错误，报告保留上游的 `network_unreachable` 标签。
这个标签不足以确定网络是唯一原因，也不能推断候选修复本来能够通过。这五次
不计为已确认的任务拒绝。

打开 `index.html` 可按任务、条件与结果筛选，逐次查看工具调用、补丁、
实际记录的用量和原生报告。下载 `independent-swe.zip` 后，直接打开其中的
`review/index.html`，即可离线查看内嵌轨迹，无需启动服务器。

归档包含原始请求、模型响应、命令输出、上下文裁剪决定、评分日志、六个原生
正负对照，以及冻结的记录器、提供方源码、依赖与输入清单。完整文件系统 tar、
已安装依赖、容器镜像和模型权重不在归档内，其身份和哈希仍有记录。离线复核
记录与重新运行模型是两件不同的事。

通用技能在选题前定稿；开发案例不计入 36 次正式样本。原选择说明的来源更正
以追加文件保留，没有更换排除项或选定任务。直接加载与 MCP 加载交付的对象
完全相同；无关对象也为 444 tokens，完整初始提示长度逐任务匹配。这里测量
工作流预加载，不声称模型自主发现技能。

各组共享 20 回合、每回合最多 2048 新 tokens、900 秒交互预算及种子
17/41/97。条件顺序在任务与种子块内轮换。上下文裁剪始终保留任务和预加载；
失败、空补丁与超时均保留。编辑进程以 UID 65534 运行，原生评分容器另用
root，不能把整条流水线写成全部非 root。

六次原生对照均完成，原始缺陷被拒绝、上游修复被接受；它们不是模型成绩。
示例 95% 聚合规则用于观察大量通过的回归检查怎样掩盖一个必要缺陷未修复。
该阈值在看过原生对照后、正式模型运行前声明，不是新发现的上游漏洞。
缺失证据保留为未知；三个任务的种子重复不能算成更多独立任务。

数据集、评分器、模型的固定版本与各项目许可证见英文说明及归档
`source-attribution/`。记录器的 MIT 许可证不自动覆盖上游 issue、代码片段
与测试日志，不能将这份混合来源材料统称为 EvalArc 原创。
