{
  "$comment": "GENERATED by the Citarium compiler — do not edit",
  "mcp": {
    "endpoint": "https://agentreliability.dev/mcp",
    "transport": "streamable-http",
    "protocol_versions": [
      "2026-07-28",
      "2025-11-25",
      "2025-06-18",
      "2025-03-26",
      "2024-11-05",
      "2024-10-07"
    ],
    "manifest": "https://agentreliability.dev/.well-known/mcp/server.json",
    "tools": [
      "search",
      "get_entity",
      "get_topic",
      "answer",
      "get_sources",
      "get_related",
      "get_latest",
      "get_overview"
    ]
  },
  "name": "agent-reliability",
  "title": "Agent Reliability",
  "description": "Testing, benchmarking and auditing autonomous AI agents — methods, harnesses, evidence",
  "license": "CC-BY-4.0",
  "generator": "citarium@0.4.0",
  "author": {
    "name": "Santiago Santa María Morales",
    "jobTitle": "practitioner — harness engineering and agent evaluation in production"
  },
  "tags": [
    "actors",
    "adversarial",
    "agentbench",
    "agents",
    "approval-gates",
    "assistants",
    "auditing",
    "autonomy",
    "benchmarks",
    "biases",
    "bootstrap",
    "calibration",
    "canaries",
    "chaos-engineering",
    "ci",
    "comparison",
    "computer-use",
    "contamination",
    "data-quality",
    "deprecations",
    "ecosystem",
    "error-bars",
    "evals",
    "evaluation",
    "execution",
    "faithfulness",
    "falsification",
    "faq",
    "fault-injection",
    "gaia",
    "gaming",
    "gating",
    "getting-started",
    "glossary",
    "goodhart",
    "governance",
    "grading",
    "grounding",
    "guardians",
    "guide",
    "hallucination",
    "harness",
    "incidents",
    "inspect",
    "integrations",
    "isolation",
    "llm-as-judge",
    "mcp",
    "meta-testing",
    "metrics",
    "model-upgrades",
    "monitoring",
    "observability",
    "open-source",
    "opentelemetry",
    "osworld",
    "oversight",
    "process",
    "process-supervision",
    "production",
    "prompt-injection",
    "protocols",
    "quality",
    "rag",
    "reasoning",
    "red-teaming",
    "regression",
    "release-gates",
    "reliability",
    "reproducibility",
    "resilience",
    "retrieval",
    "safety",
    "sandbox",
    "security",
    "shipping",
    "standards",
    "statistics",
    "swe-bench",
    "telemetry",
    "terminology",
    "testing",
    "third-party",
    "thresholds",
    "tool-use",
    "tooling",
    "tools",
    "tracing",
    "trajectories",
    "variance",
    "verification",
    "web-agents",
    "webarena"
  ],
  "surfaces": [
    {
      "kind": "llms-index",
      "url": "https://agentreliability.dev/llms.txt",
      "content_type": "text/plain"
    },
    {
      "kind": "llms-full",
      "url": "https://agentreliability.dev/llms-full.txt",
      "content_type": "text/plain"
    },
    {
      "kind": "sitemap",
      "url": "https://agentreliability.dev/sitemap.xml",
      "content_type": "application/xml"
    },
    {
      "kind": "robots",
      "url": "https://agentreliability.dev/robots.txt",
      "content_type": "text/plain"
    },
    {
      "kind": "feed-json",
      "url": "https://agentreliability.dev/feed.json",
      "content_type": "application/feed+json"
    },
    {
      "kind": "feed-rss",
      "url": "https://agentreliability.dev/feed.xml",
      "content_type": "application/rss+xml"
    },
    {
      "kind": "graph",
      "url": "https://agentreliability.dev/graph.json",
      "content_type": "application/json"
    },
    {
      "kind": "entity-index",
      "url": "https://agentreliability.dev/api/index.json",
      "content_type": "application/json"
    },
    {
      "kind": "entity",
      "url": "https://agentreliability.dev/api/k/agent-observability-standards.json",
      "content_type": "application/json"
    },
    {
      "kind": "entity",
      "url": "https://agentreliability.dev/api/k/agent-release-gates.json",
      "content_type": "application/json"
    },
    {
      "kind": "entity",
      "url": "https://agentreliability.dev/api/k/agent-reliability-faq.json",
      "content_type": "application/json"
    },
    {
      "kind": "entity",
      "url": "https://agentreliability.dev/api/k/agent-reliability-glossary.json",
      "content_type": "application/json"
    },
    {
      "kind": "entity",
      "url": "https://agentreliability.dev/api/k/agent-telemetry-actor-classification.json",
      "content_type": "application/json"
    },
    {
      "kind": "entity",
      "url": "https://agentreliability.dev/api/k/agentbench.json",
      "content_type": "application/json"
    },
    {
      "kind": "entity",
      "url": "https://agentreliability.dev/api/k/behavioral-canaries.json",
      "content_type": "application/json"
    },
    {
      "kind": "entity",
      "url": "https://agentreliability.dev/api/k/calibrating-your-llm-judge.json",
      "content_type": "application/json"
    },
    {
      "kind": "entity",
      "url": "https://agentreliability.dev/api/k/check-counter-alarm.json",
      "content_type": "application/json"
    },
    {
      "kind": "entity",
      "url": "https://agentreliability.dev/api/k/choosing-k-for-pass-hat-k.json",
      "content_type": "application/json"
    },
    {
      "kind": "entity",
      "url": "https://agentreliability.dev/api/k/designing-an-agent-sandbox.json",
      "content_type": "application/json"
    },
    {
      "kind": "entity",
      "url": "https://agentreliability.dev/api/k/deterministic-harnesses-vs-llm-as-judge.json",
      "content_type": "application/json"
    },
    {
      "kind": "entity",
      "url": "https://agentreliability.dev/api/k/deterministic-vs-probabilistic-evaluation.json",
      "content_type": "application/json"
    },
    {
      "kind": "entity",
      "url": "https://agentreliability.dev/api/k/evaluating-rag-in-agents.json",
      "content_type": "application/json"
    },
    {
      "kind": "entity",
      "url": "https://agentreliability.dev/api/k/falsify-your-first-guardian.json",
      "content_type": "application/json"
    },
    {
      "kind": "entity",
      "url": "https://agentreliability.dev/api/k/fault-injection-for-agents.json",
      "content_type": "application/json"
    },
    {
      "kind": "entity",
      "url": "https://agentreliability.dev/api/k/from-incident-to-check.json",
      "content_type": "application/json"
    },
    {
      "kind": "entity",
      "url": "https://agentreliability.dev/api/k/gaia-benchmark.json",
      "content_type": "application/json"
    },
    {
      "kind": "entity",
      "url": "https://agentreliability.dev/api/k/goodhart-resistance.json",
      "content_type": "application/json"
    },
    {
      "kind": "entity",
      "url": "https://agentreliability.dev/api/k/guardian-falsification.json",
      "content_type": "application/json"
    },
    {
      "kind": "entity",
      "url": "https://agentreliability.dev/api/k/human-approval-gates.json",
      "content_type": "application/json"
    },
    {
      "kind": "entity",
      "url": "https://agentreliability.dev/api/k/independent-evaluation.json",
      "content_type": "application/json"
    },
    {
      "kind": "entity",
      "url": "https://agentreliability.dev/api/k/inspect-eval-framework.json",
      "content_type": "application/json"
    },
    {
      "kind": "entity",
      "url": "https://agentreliability.dev/api/k/llm-as-judge.json",
      "content_type": "application/json"
    },
    {
      "kind": "entity",
      "url": "https://agentreliability.dev/api/k/measuring-agent-reliability.json",
      "content_type": "application/json"
    },
    {
      "kind": "entity",
      "url": "https://agentreliability.dev/api/k/opaque-rotating-test-sets.json",
      "content_type": "application/json"
    },
    {
      "kind": "entity",
      "url": "https://agentreliability.dev/api/k/osworld.json",
      "content_type": "application/json"
    },
    {
      "kind": "entity",
      "url": "https://agentreliability.dev/api/k/process-vs-outcome-evaluation.json",
      "content_type": "application/json"
    },
    {
      "kind": "entity",
      "url": "https://agentreliability.dev/api/k/prompt-injection-testing.json",
      "content_type": "application/json"
    },
    {
      "kind": "entity",
      "url": "https://agentreliability.dev/api/k/public-benchmarks-vs-private-task-suites.json",
      "content_type": "application/json"
    },
    {
      "kind": "entity",
      "url": "https://agentreliability.dev/api/k/red-teaming-your-agent.json",
      "content_type": "application/json"
    },
    {
      "kind": "entity",
      "url": "https://agentreliability.dev/api/k/regression-gating-model-upgrades.json",
      "content_type": "application/json"
    },
    {
      "kind": "entity",
      "url": "https://agentreliability.dev/api/k/sandboxed-execution.json",
      "content_type": "application/json"
    },
    {
      "kind": "entity",
      "url": "https://agentreliability.dev/api/k/statistical-rigor-in-evals.json",
      "content_type": "application/json"
    },
    {
      "kind": "entity",
      "url": "https://agentreliability.dev/api/k/swe-bench-verified.json",
      "content_type": "application/json"
    },
    {
      "kind": "entity",
      "url": "https://agentreliability.dev/api/k/testing-mcp-servers.json",
      "content_type": "application/json"
    },
    {
      "kind": "entity",
      "url": "https://agentreliability.dev/api/k/webarena.json",
      "content_type": "application/json"
    },
    {
      "kind": "entity",
      "url": "https://agentreliability.dev/api/k/your-first-agent-evals.json",
      "content_type": "application/json"
    },
    {
      "kind": "mcp-manifest",
      "url": "https://agentreliability.dev/.well-known/mcp/server.json",
      "content_type": "application/json"
    },
    {
      "kind": "skill-manifest",
      "url": "https://agentreliability.dev/skill.json",
      "content_type": "application/json"
    },
    {
      "kind": "skill",
      "url": "https://agentreliability.dev/skill/SKILL.txt",
      "content_type": "text/plain"
    },
    {
      "kind": "skill-alias",
      "url": "https://agentreliability.dev/skill/SKILL.md",
      "content_type": "text/markdown"
    }
  ]
}
