Same length. Different guidance.

Initial cohort: an EOF example is the supplied execution check.

Six actual Qwen3-8B trials compare relevant robot-review guidance with unrelated descriptive prose, delivered through the same Skills Anywhere MCP route. Both skill-load results contain 476 tokens, including hashes.

The model, initial prompt, task, catalog description, tools and budgets are fixed. The loaded content changes. EvalArc independently executes the generated or unchanged starter programs in Docker; a successful skill load alone does not pass the task.

0 / 6 tasks resolved

48 / 48 recorded cases had a response timeout. An EOF example can appear to work while a persistent JSONL service waits on buffered output. The original failures remain here; the subsequent cohort supplies a protocol diagnostic to both conditions.

A harness stop of finished means the agent called finish. The independent grader decides whether the task was resolved.

relevant · seed 17

Program score
0.0%
Task resolved
No
Harness stop
finished
Skill-open calls
1
Generated tokens
1,671
Summed input tokens
48,112
Harness wall time
79.3 s
Inspect 8 case outcomes
  • seed 41 / world-meters: response timeout
  • seed 41 / millimeters-sensor-frame: response timeout
  • seed 41 / centimeters-offset-clock: response timeout
  • seed 41 / incomplete-recording: response timeout
  • seed 97 / world-meters: response timeout
  • seed 97 / millimeters-sensor-frame: response timeout
  • seed 97 / centimeters-offset-clock: response timeout
  • seed 97 / incomplete-recording: response timeout

Original trial · Program · Independent grade

neutral · seed 17

Program score
0.0%
Task resolved
No
Harness stop
finished
Skill-open calls
1
Generated tokens
2,829
Summed input tokens
59,980
Harness wall time
127.6 s
Inspect 8 case outcomes
  • seed 41 / world-meters: response timeout
  • seed 41 / millimeters-sensor-frame: response timeout
  • seed 41 / centimeters-offset-clock: response timeout
  • seed 41 / incomplete-recording: response timeout
  • seed 97 / world-meters: response timeout
  • seed 97 / millimeters-sensor-frame: response timeout
  • seed 97 / centimeters-offset-clock: response timeout
  • seed 97 / incomplete-recording: response timeout

Original trial · Program · Independent grade

neutral · seed 41

Program score
0.0%
Task resolved
No
Harness stop
finished
Skill-open calls
1
Generated tokens
3,336
Summed input tokens
67,223
Harness wall time
149.7 s
Inspect 8 case outcomes
  • seed 41 / world-meters: response timeout
  • seed 41 / millimeters-sensor-frame: response timeout
  • seed 41 / centimeters-offset-clock: response timeout
  • seed 41 / incomplete-recording: response timeout
  • seed 97 / world-meters: response timeout
  • seed 97 / millimeters-sensor-frame: response timeout
  • seed 97 / centimeters-offset-clock: response timeout
  • seed 97 / incomplete-recording: response timeout

Original trial · Program · Independent grade

relevant · seed 41

Program score
0.0%
Task resolved
No
Harness stop
finished
Skill-open calls
1
Generated tokens
1,549
Summed input tokens
47,626
Harness wall time
72.2 s
Inspect 8 case outcomes
  • seed 41 / world-meters: response timeout
  • seed 41 / millimeters-sensor-frame: response timeout
  • seed 41 / centimeters-offset-clock: response timeout
  • seed 41 / incomplete-recording: response timeout
  • seed 97 / world-meters: response timeout
  • seed 97 / millimeters-sensor-frame: response timeout
  • seed 97 / centimeters-offset-clock: response timeout
  • seed 97 / incomplete-recording: response timeout

Original trial · Program · Independent grade

relevant · seed 97

Program score
0.0%
Task resolved
No
Harness stop
finished
Skill-open calls
1
Generated tokens
2,735
Summed input tokens
59,944
Harness wall time
123.0 s
Inspect 8 case outcomes
  • seed 41 / world-meters: response timeout
  • seed 41 / millimeters-sensor-frame: response timeout
  • seed 41 / centimeters-offset-clock: response timeout
  • seed 41 / incomplete-recording: response timeout
  • seed 97 / world-meters: response timeout
  • seed 97 / millimeters-sensor-frame: response timeout
  • seed 97 / centimeters-offset-clock: response timeout
  • seed 97 / incomplete-recording: response timeout

Original trial · Program · Independent grade

neutral · seed 97

Program score
0.0%
Task resolved
No
Harness stop
finished
Skill-open calls
1
Generated tokens
5,646
Summed input tokens
87,948
Harness wall time
260.5 s
Inspect 8 case outcomes
  • seed 41 / world-meters: response timeout
  • seed 41 / millimeters-sensor-frame: response timeout
  • seed 41 / centimeters-offset-clock: response timeout
  • seed 41 / incomplete-recording: response timeout
  • seed 97 / world-meters: response timeout
  • seed 97 / millimeters-sensor-frame: response timeout
  • seed 97 / centimeters-offset-clock: response timeout
  • seed 97 / incomplete-recording: response timeout

Original trial · Program · Independent grade

What is matched, and what can still differ?

The match covers the JSON tool-result payload using the pinned Qwen3 tokenizer. It includes the skill name, description, instruction body and file/bundle hashes. Real MCP preflight results must equal the prepared payloads before inference.

Later generated programs, messages, tool calls and total token usage can differ. Seeds 17, 41 and 97 each receive both conditions in alternating order. Each trial has 12 model turns, up to 4096 generated tokens per turn and a 600-second wall budget.

This is one public development task with three model seeds, not six independent tasks or a held-out benchmark. The earlier 27-trial engineering profiles use their own recorded context and library versions; their results are not pooled here.

Review every attempt

Preselected plan · All six results · Both exact skill payloads · Native tokenizer check · Methods and commands · File identities

The page replays saved evidence. It does not call a model or execute a program. Negative outcomes remain in the download. These small controls do not establish a general skill benefit, context-length effect size, or client ranking.