{
  "nodes": [
    {
      "id": "agent-observability-standards",
      "type": "entity",
      "name": "Observability standards for agents (OpenTelemetry GenAI)",
      "canonical_url": "https://agentreliability.dev/k/agent-observability-standards",
      "api_url": "https://agentreliability.dev/api/k/agent-observability-standards.json"
    },
    {
      "id": "agent-release-gates",
      "type": "entity",
      "name": "Release gates for agent systems",
      "canonical_url": "https://agentreliability.dev/k/agent-release-gates",
      "api_url": "https://agentreliability.dev/api/k/agent-release-gates.json"
    },
    {
      "id": "agent-reliability-faq",
      "type": "faq",
      "name": "Agent reliability FAQ",
      "canonical_url": "https://agentreliability.dev/k/agent-reliability-faq",
      "api_url": "https://agentreliability.dev/api/k/agent-reliability-faq.json"
    },
    {
      "id": "agent-reliability-glossary",
      "type": "glossary",
      "name": "Agent reliability glossary",
      "canonical_url": "https://agentreliability.dev/k/agent-reliability-glossary",
      "api_url": "https://agentreliability.dev/api/k/agent-reliability-glossary.json"
    },
    {
      "id": "agent-telemetry-actor-classification",
      "type": "entity",
      "name": "Agent telemetry and actor classification",
      "canonical_url": "https://agentreliability.dev/k/agent-telemetry-actor-classification",
      "api_url": "https://agentreliability.dev/api/k/agent-telemetry-actor-classification.json"
    },
    {
      "id": "agentbench",
      "type": "entity",
      "name": "AgentBench",
      "canonical_url": "https://agentreliability.dev/k/agentbench",
      "api_url": "https://agentreliability.dev/api/k/agentbench.json"
    },
    {
      "id": "behavioral-canaries",
      "type": "entity",
      "name": "Behavioral canaries",
      "canonical_url": "https://agentreliability.dev/k/behavioral-canaries",
      "api_url": "https://agentreliability.dev/api/k/behavioral-canaries.json"
    },
    {
      "id": "calibrating-your-llm-judge",
      "type": "guide",
      "name": "Calibrating your LLM judge before it gates anything",
      "canonical_url": "https://agentreliability.dev/k/calibrating-your-llm-judge",
      "api_url": "https://agentreliability.dev/api/k/calibrating-your-llm-judge.json"
    },
    {
      "id": "check-counter-alarm",
      "type": "entity",
      "name": "Check-counter regression alarm",
      "canonical_url": "https://agentreliability.dev/k/check-counter-alarm",
      "api_url": "https://agentreliability.dev/api/k/check-counter-alarm.json"
    },
    {
      "id": "choosing-k-for-pass-hat-k",
      "type": "guide",
      "name": "Choosing k and the threshold for pass^k",
      "canonical_url": "https://agentreliability.dev/k/choosing-k-for-pass-hat-k",
      "api_url": "https://agentreliability.dev/api/k/choosing-k-for-pass-hat-k.json"
    },
    {
      "id": "designing-an-agent-sandbox",
      "type": "guide",
      "name": "Designing an agent sandbox that actually contains failures",
      "canonical_url": "https://agentreliability.dev/k/designing-an-agent-sandbox",
      "api_url": "https://agentreliability.dev/api/k/designing-an-agent-sandbox.json"
    },
    {
      "id": "deterministic-harnesses-vs-llm-as-judge",
      "type": "comparison",
      "name": "Deterministic harnesses vs LLM-as-judge: when each wins",
      "canonical_url": "https://agentreliability.dev/k/deterministic-harnesses-vs-llm-as-judge",
      "api_url": "https://agentreliability.dev/api/k/deterministic-harnesses-vs-llm-as-judge.json"
    },
    {
      "id": "deterministic-vs-probabilistic-evaluation",
      "type": "entity",
      "name": "Deterministic vs probabilistic evaluation",
      "canonical_url": "https://agentreliability.dev/k/deterministic-vs-probabilistic-evaluation",
      "api_url": "https://agentreliability.dev/api/k/deterministic-vs-probabilistic-evaluation.json"
    },
    {
      "id": "evaluating-rag-in-agents",
      "type": "entity",
      "name": "Evaluating retrieval (RAG) inside agents",
      "canonical_url": "https://agentreliability.dev/k/evaluating-rag-in-agents",
      "api_url": "https://agentreliability.dev/api/k/evaluating-rag-in-agents.json"
    },
    {
      "id": "falsify-your-first-guardian",
      "type": "guide",
      "name": "How to falsify your first guardian",
      "canonical_url": "https://agentreliability.dev/k/falsify-your-first-guardian",
      "api_url": "https://agentreliability.dev/api/k/falsify-your-first-guardian.json"
    },
    {
      "id": "fault-injection-for-agents",
      "type": "entity",
      "name": "Fault injection for agents",
      "canonical_url": "https://agentreliability.dev/k/fault-injection-for-agents",
      "api_url": "https://agentreliability.dev/api/k/fault-injection-for-agents.json"
    },
    {
      "id": "from-incident-to-check",
      "type": "guide",
      "name": "From incident to check: making failures pay rent",
      "canonical_url": "https://agentreliability.dev/k/from-incident-to-check",
      "api_url": "https://agentreliability.dev/api/k/from-incident-to-check.json"
    },
    {
      "id": "gaia-benchmark",
      "type": "entity",
      "name": "GAIA benchmark",
      "canonical_url": "https://agentreliability.dev/k/gaia-benchmark",
      "api_url": "https://agentreliability.dev/api/k/gaia-benchmark.json"
    },
    {
      "id": "goodhart-resistance",
      "type": "entity",
      "name": "Goodhart resistance in agent metrics",
      "canonical_url": "https://agentreliability.dev/k/goodhart-resistance",
      "api_url": "https://agentreliability.dev/api/k/goodhart-resistance.json"
    },
    {
      "id": "guardian-falsification",
      "type": "entity",
      "name": "Guardian falsification",
      "canonical_url": "https://agentreliability.dev/k/guardian-falsification",
      "api_url": "https://agentreliability.dev/api/k/guardian-falsification.json"
    },
    {
      "id": "human-approval-gates",
      "type": "entity",
      "name": "Human approval gates and graduated autonomy",
      "canonical_url": "https://agentreliability.dev/k/human-approval-gates",
      "api_url": "https://agentreliability.dev/api/k/human-approval-gates.json"
    },
    {
      "id": "independent-evaluation",
      "type": "entity",
      "name": "Independent third-party evaluation",
      "canonical_url": "https://agentreliability.dev/k/independent-evaluation",
      "api_url": "https://agentreliability.dev/api/k/independent-evaluation.json"
    },
    {
      "id": "inspect-eval-framework",
      "type": "entity",
      "name": "Inspect (UK AI Security Institute evaluation framework)",
      "canonical_url": "https://agentreliability.dev/k/inspect-eval-framework",
      "api_url": "https://agentreliability.dev/api/k/inspect-eval-framework.json"
    },
    {
      "id": "llm-as-judge",
      "type": "entity",
      "name": "LLM-as-judge and its failure modes",
      "canonical_url": "https://agentreliability.dev/k/llm-as-judge",
      "api_url": "https://agentreliability.dev/api/k/llm-as-judge.json"
    },
    {
      "id": "measuring-agent-reliability",
      "type": "guide",
      "name": "Measuring agent reliability: bounded metrics and decision tables",
      "canonical_url": "https://agentreliability.dev/k/measuring-agent-reliability",
      "api_url": "https://agentreliability.dev/api/k/measuring-agent-reliability.json"
    },
    {
      "id": "opaque-rotating-test-sets",
      "type": "entity",
      "name": "Opaque rotating test sets",
      "canonical_url": "https://agentreliability.dev/k/opaque-rotating-test-sets",
      "api_url": "https://agentreliability.dev/api/k/opaque-rotating-test-sets.json"
    },
    {
      "id": "osworld",
      "type": "entity",
      "name": "OSWorld",
      "canonical_url": "https://agentreliability.dev/k/osworld",
      "api_url": "https://agentreliability.dev/api/k/osworld.json"
    },
    {
      "id": "process-vs-outcome-evaluation",
      "type": "entity",
      "name": "Process vs outcome evaluation of agent trajectories",
      "canonical_url": "https://agentreliability.dev/k/process-vs-outcome-evaluation",
      "api_url": "https://agentreliability.dev/api/k/process-vs-outcome-evaluation.json"
    },
    {
      "id": "prompt-injection-testing",
      "type": "entity",
      "name": "Prompt-injection testing for agents",
      "canonical_url": "https://agentreliability.dev/k/prompt-injection-testing",
      "api_url": "https://agentreliability.dev/api/k/prompt-injection-testing.json"
    },
    {
      "id": "public-benchmarks-vs-private-task-suites",
      "type": "comparison",
      "name": "Public benchmarks vs private task suites: what each buys you",
      "canonical_url": "https://agentreliability.dev/k/public-benchmarks-vs-private-task-suites",
      "api_url": "https://agentreliability.dev/api/k/public-benchmarks-vs-private-task-suites.json"
    },
    {
      "id": "red-teaming-your-agent",
      "type": "guide",
      "name": "Running your first agent red-team exercise",
      "canonical_url": "https://agentreliability.dev/k/red-teaming-your-agent",
      "api_url": "https://agentreliability.dev/api/k/red-teaming-your-agent.json"
    },
    {
      "id": "regression-gating-model-upgrades",
      "type": "guide",
      "name": "Regression-gating a model upgrade",
      "canonical_url": "https://agentreliability.dev/k/regression-gating-model-upgrades",
      "api_url": "https://agentreliability.dev/api/k/regression-gating-model-upgrades.json"
    },
    {
      "id": "sandboxed-execution",
      "type": "entity",
      "name": "Sandboxed execution environments",
      "canonical_url": "https://agentreliability.dev/k/sandboxed-execution",
      "api_url": "https://agentreliability.dev/api/k/sandboxed-execution.json"
    },
    {
      "id": "statistical-rigor-in-evals",
      "type": "entity",
      "name": "Statistical rigor in agent evals",
      "canonical_url": "https://agentreliability.dev/k/statistical-rigor-in-evals",
      "api_url": "https://agentreliability.dev/api/k/statistical-rigor-in-evals.json"
    },
    {
      "id": "swe-bench-verified",
      "type": "entity",
      "name": "SWE-bench Verified",
      "canonical_url": "https://agentreliability.dev/k/swe-bench-verified",
      "api_url": "https://agentreliability.dev/api/k/swe-bench-verified.json"
    },
    {
      "id": "testing-mcp-servers",
      "type": "entity",
      "name": "Testing MCP servers and integrations",
      "canonical_url": "https://agentreliability.dev/k/testing-mcp-servers",
      "api_url": "https://agentreliability.dev/api/k/testing-mcp-servers.json"
    },
    {
      "id": "webarena",
      "type": "entity",
      "name": "WebArena",
      "canonical_url": "https://agentreliability.dev/k/webarena",
      "api_url": "https://agentreliability.dev/api/k/webarena.json"
    },
    {
      "id": "your-first-agent-evals",
      "type": "guide",
      "name": "Your first agent evals: from zero to a release gate in two weeks",
      "canonical_url": "https://agentreliability.dev/k/your-first-agent-evals",
      "api_url": "https://agentreliability.dev/api/k/your-first-agent-evals.json"
    }
  ],
  "edges": [
    {
      "from": "agent-observability-standards",
      "rel": "standardizes",
      "to": "agent-telemetry-actor-classification"
    },
    {
      "from": "agent-observability-standards",
      "rel": "related",
      "to": "behavioral-canaries"
    },
    {
      "from": "agent-release-gates",
      "rel": "related",
      "to": "regression-gating-model-upgrades"
    },
    {
      "from": "agent-release-gates",
      "rel": "related",
      "to": "human-approval-gates"
    },
    {
      "from": "agent-release-gates",
      "rel": "applies",
      "to": "measuring-agent-reliability"
    },
    {
      "from": "agent-reliability-faq",
      "rel": "related",
      "to": "measuring-agent-reliability"
    },
    {
      "from": "agent-reliability-faq",
      "rel": "related",
      "to": "sandboxed-execution"
    },
    {
      "from": "agent-reliability-faq",
      "rel": "related",
      "to": "regression-gating-model-upgrades"
    },
    {
      "from": "agent-reliability-faq",
      "rel": "related",
      "to": "choosing-k-for-pass-hat-k"
    },
    {
      "from": "agent-reliability-glossary",
      "rel": "related",
      "to": "deterministic-vs-probabilistic-evaluation"
    },
    {
      "from": "agent-telemetry-actor-classification",
      "rel": "feeds",
      "to": "behavioral-canaries"
    },
    {
      "from": "agentbench",
      "rel": "related",
      "to": "measuring-agent-reliability"
    },
    {
      "from": "agentbench",
      "rel": "related",
      "to": "webarena"
    },
    {
      "from": "agentbench",
      "rel": "related",
      "to": "gaia-benchmark"
    },
    {
      "from": "behavioral-canaries",
      "rel": "related",
      "to": "guardian-falsification"
    },
    {
      "from": "behavioral-canaries",
      "rel": "related",
      "to": "agent-telemetry-actor-classification"
    },
    {
      "from": "calibrating-your-llm-judge",
      "rel": "applies",
      "to": "llm-as-judge"
    },
    {
      "from": "calibrating-your-llm-judge",
      "rel": "related",
      "to": "deterministic-harnesses-vs-llm-as-judge"
    },
    {
      "from": "calibrating-your-llm-judge",
      "rel": "related",
      "to": "statistical-rigor-in-evals"
    },
    {
      "from": "calibrating-your-llm-judge",
      "rel": "related",
      "to": "regression-gating-model-upgrades"
    },
    {
      "from": "check-counter-alarm",
      "rel": "protects",
      "to": "guardian-falsification"
    },
    {
      "from": "check-counter-alarm",
      "rel": "related",
      "to": "goodhart-resistance"
    },
    {
      "from": "choosing-k-for-pass-hat-k",
      "rel": "applies",
      "to": "agent-release-gates"
    },
    {
      "from": "choosing-k-for-pass-hat-k",
      "rel": "related",
      "to": "statistical-rigor-in-evals"
    },
    {
      "from": "choosing-k-for-pass-hat-k",
      "rel": "related",
      "to": "measuring-agent-reliability"
    },
    {
      "from": "choosing-k-for-pass-hat-k",
      "rel": "related",
      "to": "deterministic-vs-probabilistic-evaluation"
    },
    {
      "from": "choosing-k-for-pass-hat-k",
      "rel": "explains",
      "to": "agent-reliability-glossary"
    },
    {
      "from": "designing-an-agent-sandbox",
      "rel": "explains",
      "to": "sandboxed-execution"
    },
    {
      "from": "designing-an-agent-sandbox",
      "rel": "enables",
      "to": "fault-injection-for-agents"
    },
    {
      "from": "deterministic-harnesses-vs-llm-as-judge",
      "rel": "compares",
      "to": "deterministic-vs-probabilistic-evaluation"
    },
    {
      "from": "deterministic-harnesses-vs-llm-as-judge",
      "rel": "compares",
      "to": "llm-as-judge"
    },
    {
      "from": "deterministic-vs-probabilistic-evaluation",
      "rel": "compared_in",
      "to": "deterministic-harnesses-vs-llm-as-judge"
    },
    {
      "from": "deterministic-vs-probabilistic-evaluation",
      "rel": "related",
      "to": "llm-as-judge"
    },
    {
      "from": "evaluating-rag-in-agents",
      "rel": "related",
      "to": "llm-as-judge"
    },
    {
      "from": "evaluating-rag-in-agents",
      "rel": "related",
      "to": "prompt-injection-testing"
    },
    {
      "from": "evaluating-rag-in-agents",
      "rel": "related",
      "to": "deterministic-vs-probabilistic-evaluation"
    },
    {
      "from": "falsify-your-first-guardian",
      "rel": "explains",
      "to": "guardian-falsification"
    },
    {
      "from": "falsify-your-first-guardian",
      "rel": "related",
      "to": "check-counter-alarm"
    },
    {
      "from": "fault-injection-for-agents",
      "rel": "requires",
      "to": "sandboxed-execution"
    },
    {
      "from": "fault-injection-for-agents",
      "rel": "related",
      "to": "guardian-falsification"
    },
    {
      "from": "from-incident-to-check",
      "rel": "applies",
      "to": "guardian-falsification"
    },
    {
      "from": "from-incident-to-check",
      "rel": "applies",
      "to": "check-counter-alarm"
    },
    {
      "from": "from-incident-to-check",
      "rel": "related",
      "to": "falsify-your-first-guardian"
    },
    {
      "from": "gaia-benchmark",
      "rel": "related",
      "to": "measuring-agent-reliability"
    },
    {
      "from": "gaia-benchmark",
      "rel": "related",
      "to": "agentbench"
    },
    {
      "from": "goodhart-resistance",
      "rel": "threatened_by",
      "to": "llm-as-judge"
    },
    {
      "from": "goodhart-resistance",
      "rel": "defended_by",
      "to": "opaque-rotating-test-sets"
    },
    {
      "from": "guardian-falsification",
      "rel": "alarmed_by",
      "to": "check-counter-alarm"
    },
    {
      "from": "guardian-falsification",
      "rel": "explained_in",
      "to": "falsify-your-first-guardian"
    },
    {
      "from": "guardian-falsification",
      "rel": "related",
      "to": "behavioral-canaries"
    },
    {
      "from": "human-approval-gates",
      "rel": "complements",
      "to": "sandboxed-execution"
    },
    {
      "from": "human-approval-gates",
      "rel": "mitigates",
      "to": "prompt-injection-testing"
    },
    {
      "from": "human-approval-gates",
      "rel": "related",
      "to": "agent-telemetry-actor-classification"
    },
    {
      "from": "independent-evaluation",
      "rel": "related",
      "to": "goodhart-resistance"
    },
    {
      "from": "independent-evaluation",
      "rel": "related",
      "to": "red-teaming-your-agent"
    },
    {
      "from": "independent-evaluation",
      "rel": "related",
      "to": "inspect-eval-framework"
    },
    {
      "from": "inspect-eval-framework",
      "rel": "implements",
      "to": "sandboxed-execution"
    },
    {
      "from": "inspect-eval-framework",
      "rel": "related",
      "to": "deterministic-vs-probabilistic-evaluation"
    },
    {
      "from": "inspect-eval-framework",
      "rel": "related",
      "to": "llm-as-judge"
    },
    {
      "from": "llm-as-judge",
      "rel": "compared_in",
      "to": "deterministic-harnesses-vs-llm-as-judge"
    },
    {
      "from": "llm-as-judge",
      "rel": "related",
      "to": "deterministic-vs-probabilistic-evaluation"
    },
    {
      "from": "measuring-agent-reliability",
      "rel": "applies",
      "to": "goodhart-resistance"
    },
    {
      "from": "measuring-agent-reliability",
      "rel": "related",
      "to": "deterministic-vs-probabilistic-evaluation"
    },
    {
      "from": "measuring-agent-reliability",
      "rel": "refined_by",
      "to": "statistical-rigor-in-evals"
    },
    {
      "from": "measuring-agent-reliability",
      "rel": "related",
      "to": "swe-bench-verified"
    },
    {
      "from": "measuring-agent-reliability",
      "rel": "preceded_by",
      "to": "your-first-agent-evals"
    },
    {
      "from": "opaque-rotating-test-sets",
      "rel": "defends_against",
      "to": "goodhart-resistance"
    },
    {
      "from": "opaque-rotating-test-sets",
      "rel": "related",
      "to": "behavioral-canaries"
    },
    {
      "from": "osworld",
      "rel": "related",
      "to": "webarena"
    },
    {
      "from": "osworld",
      "rel": "related",
      "to": "sandboxed-execution"
    },
    {
      "from": "osworld",
      "rel": "related",
      "to": "measuring-agent-reliability"
    },
    {
      "from": "process-vs-outcome-evaluation",
      "rel": "related",
      "to": "deterministic-vs-probabilistic-evaluation"
    },
    {
      "from": "process-vs-outcome-evaluation",
      "rel": "related",
      "to": "llm-as-judge"
    },
    {
      "from": "process-vs-outcome-evaluation",
      "rel": "refines",
      "to": "measuring-agent-reliability"
    },
    {
      "from": "prompt-injection-testing",
      "rel": "related",
      "to": "fault-injection-for-agents"
    },
    {
      "from": "prompt-injection-testing",
      "rel": "requires",
      "to": "sandboxed-execution"
    },
    {
      "from": "prompt-injection-testing",
      "rel": "related",
      "to": "behavioral-canaries"
    },
    {
      "from": "prompt-injection-testing",
      "rel": "related",
      "to": "testing-mcp-servers"
    },
    {
      "from": "public-benchmarks-vs-private-task-suites",
      "rel": "compares",
      "to": "opaque-rotating-test-sets"
    },
    {
      "from": "public-benchmarks-vs-private-task-suites",
      "rel": "compares",
      "to": "gaia-benchmark"
    },
    {
      "from": "public-benchmarks-vs-private-task-suites",
      "rel": "related",
      "to": "measuring-agent-reliability"
    },
    {
      "from": "public-benchmarks-vs-private-task-suites",
      "rel": "related",
      "to": "goodhart-resistance"
    },
    {
      "from": "red-teaming-your-agent",
      "rel": "applies",
      "to": "prompt-injection-testing"
    },
    {
      "from": "red-teaming-your-agent",
      "rel": "applies",
      "to": "from-incident-to-check"
    },
    {
      "from": "red-teaming-your-agent",
      "rel": "requires",
      "to": "sandboxed-execution"
    },
    {
      "from": "red-teaming-your-agent",
      "rel": "related",
      "to": "human-approval-gates"
    },
    {
      "from": "regression-gating-model-upgrades",
      "rel": "applies",
      "to": "behavioral-canaries"
    },
    {
      "from": "regression-gating-model-upgrades",
      "rel": "applies",
      "to": "measuring-agent-reliability"
    },
    {
      "from": "regression-gating-model-upgrades",
      "rel": "related",
      "to": "deterministic-vs-probabilistic-evaluation"
    },
    {
      "from": "sandboxed-execution",
      "rel": "explained_in",
      "to": "designing-an-agent-sandbox"
    },
    {
      "from": "sandboxed-execution",
      "rel": "enables",
      "to": "fault-injection-for-agents"
    },
    {
      "from": "statistical-rigor-in-evals",
      "rel": "refines",
      "to": "measuring-agent-reliability"
    },
    {
      "from": "statistical-rigor-in-evals",
      "rel": "related",
      "to": "deterministic-vs-probabilistic-evaluation"
    },
    {
      "from": "statistical-rigor-in-evals",
      "rel": "related",
      "to": "goodhart-resistance"
    },
    {
      "from": "swe-bench-verified",
      "rel": "refines",
      "to": "measuring-agent-reliability"
    },
    {
      "from": "swe-bench-verified",
      "rel": "related",
      "to": "public-benchmarks-vs-private-task-suites"
    },
    {
      "from": "swe-bench-verified",
      "rel": "related",
      "to": "opaque-rotating-test-sets"
    },
    {
      "from": "testing-mcp-servers",
      "rel": "related",
      "to": "prompt-injection-testing"
    },
    {
      "from": "testing-mcp-servers",
      "rel": "related",
      "to": "agent-observability-standards"
    },
    {
      "from": "testing-mcp-servers",
      "rel": "related",
      "to": "red-teaming-your-agent"
    },
    {
      "from": "webarena",
      "rel": "related",
      "to": "osworld"
    },
    {
      "from": "webarena",
      "rel": "related",
      "to": "sandboxed-execution"
    },
    {
      "from": "webarena",
      "rel": "related",
      "to": "measuring-agent-reliability"
    },
    {
      "from": "your-first-agent-evals",
      "rel": "leads_to",
      "to": "measuring-agent-reliability"
    },
    {
      "from": "your-first-agent-evals",
      "rel": "leads_to",
      "to": "falsify-your-first-guardian"
    },
    {
      "from": "your-first-agent-evals",
      "rel": "related",
      "to": "from-incident-to-check"
    },
    {
      "from": "your-first-agent-evals",
      "rel": "related",
      "to": "inspect-eval-framework"
    }
  ]
}
