EvalArc / Trace WorkbenchSource & documentation

Golden cases · skill deliveries · evaluator results

Follow the run.
Keep the evidence.

SYNTHETIC Five authored controls for import and review behavior. Placeholder hashes, simulated spans and judgments; no AWS or model run.

Inspect each case against its declared acceptance rules. Missing results, skipped evaluations and assessed zero scores remain distinct.

Imported evaluator judgments and caller-declared trace coverage. Identity and consistency checks do not authenticate the producer, rerun a judge, enforce permissions or independently verify task completion.

1Accepted cases
2Rejected cases
2Incomplete cases
Review your own AgentCore export locally

Wrap the saved spans and Evaluate responses with your versioned golden cases and rubrics, following the input contract. The CLI runs offline and creates this report.

evalarc trace-import input.json --output runs/review-001
evalarc trace-import current.json --baseline baseline.json --output runs/compare-001
evalarc trace-verify runs/review-001
Input contract and preparation guide

What changed between runs?

Same golden set and evaluator rules
CaseBaselineCurrentChange
accepted-controlACCEPTEDACCEPTED
assessed-zeroACCEPTEDREJECTEDPreviously accepted; now needs review
skipped-judgeACCEPTEDINCOMPLETEPreviously accepted; now needs review
missing-resultACCEPTEDINCOMPLETEPreviously accepted; now needs review
missed-skillACCEPTEDREJECTEDPreviously accepted; now needs review
Changed model, prompt, tool and skill configuration
{
  "prompt_sha256": {
    "baseline": "aaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaa",
    "current": "ffffffffffffffffffffffffffffffffffffffffffffffffffffffffffffffff"
  }
}

Paired descriptive comparison; no causal or statistical gain claim.

Download baseline input

Follow each golden case

accepted-control

ACCEPTED

Inspect the accepted-control review condition.

1 exported spans · Skill observation declared complete

Expected skills

  • evidence-review MATCHED
Imported evaluator results
Evaluator / targetValueConfigured gateExplanation
goal-controlauthored-1Session1ACCEPTEDAuthored passing control.
Builtin.SkillInstructionFollowingsynthetic-scale-100000000000000011ACCEPTEDAuthored passing control.
Skill deliveries and recording identity
evidence-review — bundle matched
{
  "name": "evidence-review",
  "trace_id": "00000000000000000000000000000001",
  "span_id": "0000000000000001",
  "receipt": {
    "schema": "skills-anywhere-load-1",
    "load_id": "synthetic-0",
    "loaded_at": "2026-09-15T00:00:00Z",
    "provider": "dsh-skills-anywhere",
    "provider_version": "0.12.0",
    "name": "evidence-review",
    "skill_sha256": "dddddddddddddddddddddddddddddddddddddddddddddddddddddddddddddddd",
    "content_sha256": "eeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeee",
    "bundle_sha256": "cccccccccccccccccccccccccccccccccccccccccccccccccccccccccccccccc",
    "declared_tools": null,
    "permissions_enforced": false
  },
  "identity": "matched"
}
{
  "session_id": "session-0",
  "trace_ids": [
    "00000000000000000000000000000001"
  ]
}

assessed-zero

REJECTED

Inspect the assessed-zero review condition.

1 exported spans · Skill observation declared complete

Expected skills

  • evidence-review MATCHED
Imported evaluator results
Evaluator / targetValueConfigured gateExplanation
goal-controlauthored-1Session0REJECTEDValid zero: the authored output lacks evidence.
Builtin.SkillInstructionFollowingsynthetic-scale-100000000000000021ACCEPTEDAuthored passing control.
Skill deliveries and recording identity
evidence-review — bundle matched
{
  "name": "evidence-review",
  "trace_id": "00000000000000000000000000000002",
  "span_id": "0000000000000002",
  "receipt": {
    "schema": "skills-anywhere-load-1",
    "load_id": "synthetic-1",
    "loaded_at": "2026-09-15T00:00:00Z",
    "provider": "dsh-skills-anywhere",
    "provider_version": "0.12.0",
    "name": "evidence-review",
    "skill_sha256": "dddddddddddddddddddddddddddddddddddddddddddddddddddddddddddddddd",
    "content_sha256": "eeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeeee",
    "bundle_sha256": "cccccccccccccccccccccccccccccccccccccccccccccccccccccccccccccccc",
    "declared_tools": null,
    "permissions_enforced": false
  },
  "identity": "matched"
}
{
  "session_id": "session-1",
  "trace_ids": [
    "00000000000000000000000000000002"
  ]
}

skipped-judge

INCOMPLETE

Inspect the skipped-judge review condition.

1 exported spans · Skill observation declared complete

Expected skills

  • No skill required by this case.
Imported evaluator results
Evaluator / targetValueConfigured gateExplanation
goal-controlauthored-1SessionSKIPPEDAuthored passing control.Authored example of unavailable context.
Builtin.SkillInstructionFollowingsynthetic-scale-1SessionNOT APPLICABLENo annotated skill calls; coverage is caller-declared.
Skill deliveries and recording identity

No annotated skill calls.

{
  "session_id": "session-2",
  "trace_ids": [
    "00000000000000000000000000000003"
  ]
}

missing-result

INCOMPLETE

Inspect the missing-result review condition.

1 exported spans · Skill observation declared complete

Expected skills

  • No skill required by this case.
Imported evaluator results
Evaluator / targetValueConfigured gateExplanation
goal-controlauthored-1SessionMISSINGNo result for this declared target.
Builtin.SkillInstructionFollowingsynthetic-scale-1SessionNOT APPLICABLENo annotated skill calls; coverage is caller-declared.
Skill deliveries and recording identity

No annotated skill calls.

{
  "session_id": "session-3",
  "trace_ids": [
    "00000000000000000000000000000004"
  ]
}

missed-skill

REJECTED

Inspect the missed-skill review condition.

1 exported spans · Skill observation declared complete

Expected skills

  • evidence-review NOT CALLED
Imported evaluator results
Evaluator / targetValueConfigured gateExplanation
goal-controlauthored-1Session1ACCEPTEDAuthored passing control.
Builtin.SkillInstructionFollowingsynthetic-scale-1SessionNOT APPLICABLENo annotated skill calls; coverage is caller-declared.
Skill deliveries and recording identity

No annotated skill calls.

{
  "session_id": "session-4",
  "trace_ids": [
    "00000000000000000000000000000005"
  ]
}
Frozen configuration, dataset and source identity
{
  "run_id": "synthetic-current",
  "source_sha256": "7c16410530ff7c2e4b8553ddfa264eb624006e0236d0d4f12e1823905ff0202e",
  "dataset_sha256": "af06543f58bb31780df1d63b6423ca3239720cff8aa2ba826d458b33116db7ab",
  "configuration": {
    "model": "synthetic-control",
    "model_parameters": {},
    "prompt_sha256": "ffffffffffffffffffffffffffffffffffffffffffffffffffffffffffffffff",
    "tools_sha256": "bbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbbb",
    "skills": {
      "evidence-review": "cccccccccccccccccccccccccccccccccccccccccccccccccccccccccccccccc"
    }
  },
  "evaluators": [
    {
      "id": "goal-control",
      "revision": "authored-1",
      "level": "session",
      "rating": {
        "kind": "numeric",
        "min": 0,
        "max": 1,
        "pass_at_least": 1
      }
    },
    {
      "id": "Builtin.SkillInstructionFollowing",
      "revision": "synthetic-scale-1",
      "level": "skill",
      "rating": {
        "kind": "numeric",
        "min": 0,
        "max": 1,
        "pass_at_least": 1
      }
    }
  ]
}