Golden cases · skill deliveries · evaluator results
Follow the run.Keep the evidence. SYNTHETIC Five authored controls for import and review behavior. Placeholder hashes, simulated spans and judgments; no AWS or model run.
Inspect each case against its declared acceptance rules. Missing results, skipped evaluations and assessed zero scores remain distinct.
Imported evaluator judgments and caller-declared trace coverage. Identity and consistency checks do not authenticate the producer, rerun a judge, enforce permissions or independently verify task completion.
1 Accepted cases
2 Rejected cases
2 Incomplete cases
Review your own AgentCore export locally Wrap the saved spans and Evaluate responses with your versioned golden cases and rubrics, following the input contract. The CLI runs offline and creates this report.
evalarc trace-import input.json --output runs/review-001
evalarc trace-import current.json --baseline baseline.json --output runs/compare-001
evalarc trace-verify runs/review-001 Input contract and preparation guide What changed between runs? Changed model, prompt, tool and skill configuration {
"prompt_sha256": {
"baseline": "aaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaa",
"current": "ffffffffffffffffffffffffffffffffffffffffffffffffffffffffffffffff"
}
} Paired descriptive comparison; no causal or statistical gain claim.
Download baseline input Follow each golden case Find a case, skill, evaluator or explanation
All Accepted Rejected Incomplete
accepted-control ACCEPTED Inspect the accepted-control review condition.
1 exported spans · Skill observation declared complete
Expected skills Skill deliveries and recording identity evidence-review — bundle matched {
"name": "evidence-review",
"trace_id": "00000000000000000000000000000001",
"span_id": "0000000000000001",
"receipt": {
"schema": "skills-anywhere-load-1",
"load_id": "synthetic-0",
"loaded_at": "2026-09-15T00:00:00Z",
"provider": "dsh-skills-anywhere",
"provider_version": "0.12.0",
"name": "evidence-review",
"skill_sha256": "dddddddddddddddddddddddddddddddddddddddddddddddddddddddddddddddd",
"content_sha256": "eeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeee",
"bundle_sha256": "cccccccccccccccccccccccccccccccccccccccccccccccccccccccccccccccc",
"declared_tools": null,
"permissions_enforced": false
},
"identity": "matched"
} {
"session_id": "session-0",
"trace_ids": [
"00000000000000000000000000000001"
]
}
assessed-zero REJECTED Inspect the assessed-zero review condition.
1 exported spans · Skill observation declared complete
Expected skills Skill deliveries and recording identity evidence-review — bundle matched {
"name": "evidence-review",
"trace_id": "00000000000000000000000000000002",
"span_id": "0000000000000002",
"receipt": {
"schema": "skills-anywhere-load-1",
"load_id": "synthetic-1",
"loaded_at": "2026-09-15T00:00:00Z",
"provider": "dsh-skills-anywhere",
"provider_version": "0.12.0",
"name": "evidence-review",
"skill_sha256": "dddddddddddddddddddddddddddddddddddddddddddddddddddddddddddddddd",
"content_sha256": "eeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeee",
"bundle_sha256": "cccccccccccccccccccccccccccccccccccccccccccccccccccccccccccccccc",
"declared_tools": null,
"permissions_enforced": false
},
"identity": "matched"
} {
"session_id": "session-1",
"trace_ids": [
"00000000000000000000000000000002"
]
}
skipped-judge INCOMPLETE Inspect the skipped-judge review condition.
1 exported spans · Skill observation declared complete
Expected skills No skill required by this case. Skill deliveries and recording identity No annotated skill calls.
{
"session_id": "session-2",
"trace_ids": [
"00000000000000000000000000000003"
]
}
missing-result INCOMPLETE Inspect the missing-result review condition.
1 exported spans · Skill observation declared complete
Expected skills No skill required by this case. Skill deliveries and recording identity No annotated skill calls.
{
"session_id": "session-3",
"trace_ids": [
"00000000000000000000000000000004"
]
}
missed-skill REJECTED Inspect the missed-skill review condition.
1 exported spans · Skill observation declared complete
Expected skills evidence-review NOT CALLED Skill deliveries and recording identity No annotated skill calls.
{
"session_id": "session-4",
"trace_ids": [
"00000000000000000000000000000005"
]
} Frozen configuration, dataset and source identity {
"run_id": "synthetic-current",
"source_sha256": "7c16410530ff7c2e4b8553ddfa264eb624006e0236d0d4f12e1823905ff0202e",
"dataset_sha256": "af06543f58bb31780df1d63b6423ca3239720cff8aa2ba826d458b33116db7ab",
"configuration": {
"model": "synthetic-control",
"model_parameters": {},
"prompt_sha256": "ffffffffffffffffffffffffffffffffffffffffffffffffffffffffffffffff",
"tools_sha256": "bbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbb",
"skills": {
"evidence-review": "cccccccccccccccccccccccccccccccccccccccccccccccccccccccccccccccc"
}
},
"evaluators": [
{
"id": "goal-control",
"revision": "authored-1",
"level": "session",
"rating": {
"kind": "numeric",
"min": 0,
"max": 1,
"pass_at_least": 1
}
},
{
"id": "Builtin.SkillInstructionFollowing",
"revision": "synthetic-scale-1",
"level": "skill",
"rating": {
"kind": "numeric",
"min": 0,
"max": 1,
"pass_at_least": 1
}
}
]
}