{"as_of":"2026-08-10T03:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:83bc03fb6774c91c9e73e25efb3f83ceff09e5a012a9afe60796598376d6c2d3","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T00:36:15.896432Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T03:38:16.681296Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T20:42:21.683853Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.14989","snapshot_observed_at":"2026-08-01T03:38:16.681296Z","title":"Omniabench: Benchmarking general ai agents across diverse scenarios, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23124","last_updated":"2026-07-25T09:58:24Z","snapshot_observed_at":"2026-08-06T19:50:20.416891Z","submitted_at":"2026-07-25T09:58:24Z","title":"AgentOmnia: Scaling Agentic Models for Full-Scenario Applications","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T03:38:16.681296Z"},"links":{"cited_paper":"/paper/2607.14989","citing_paper":"/paper/2607.23124"},"observation_digest":"sha256:d6e3fcffe1c76dd63f4dc75610aa320256b2aaddc9d76c6ffda8fee639b8b2a8","observation_id":"2bc7ea6a-b277-4acd-9cb3-21332b85d0d0","resolution":{"observed_at":"2026-08-01T03:38:16.681296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.14989/citation-record","integrity":"/paper/2607.14989/integrity","json":"/paper/2607.14989/citation-record.json","paper":"/paper/2607.14989"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.15840","last_updated":"2025-02-20T15:52:29Z","snapshot_observed_at":"2026-08-07T18:01:38.589431Z","submitted_at":"2025-02-20T15:52:29Z","title":"Vending-Bench: A Benchmark for Long-Term Coherence of Autonomous Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.15840","snapshot_observed_at":"2026-08-02T00:36:15.686510Z","title":"Vending-bench: A benchmark for long-term coherence of autonomous agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T20:42:21.683853Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.686510Z"},"links":{"cited_paper":"/paper/2502.15840","citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:1842b897c32c76489e7b4a8e00fee7403beb2695fc2248af17a35f1750f51528","observation_id":"f92f1d4b-46d7-4c3f-81e9-094a084376a9","resolution":{"observed_at":"2026-08-02T00:36:15.686510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.00933","last_updated":"2026-05-19T23:26:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-31T23:19:39Z","title":"MCP-Atlas: A Large-Scale Benchmark for Tool-Use Competency with Real MCP Servers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.00933","snapshot_observed_at":"2026-08-02T00:36:15.692389Z","title":"Mcp-atlas: A large-scale benchmark for tool-use competency with real mcp servers","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T20:42:21.683853Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.692389Z"},"links":{"cited_paper":"/paper/2602.00933","citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:edb22c41e0d1713e942bd25cfa6444da5f2397e589d5644f67de22565a2d7498","observation_id":"ee70646b-4454-4e07-8009-a1e1c2d75d7b","resolution":{"observed_at":"2026-08-02T00:36:15.692389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07982","last_updated":"2025-06-09T17:52:18Z","snapshot_observed_at":"2026-07-06T21:39:13.304260Z","submitted_at":"2025-06-09T17:52:18Z","title":"$\\tau^2$-Bench: Evaluating Conversational Agents in a Dual-Control Environment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07982","snapshot_observed_at":"2026-08-02T00:36:15.697891Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T20:42:21.683853Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.697891Z"},"links":{"cited_paper":"/paper/2506.07982","citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:c86a8073df5bdac2dcd07731d06d47c015aebf4fac5884447a0a4302a14ad7dd","observation_id":"98ecf2b2-2b0c-4c1a-8cae-d008ec31a237","resolution":{"observed_at":"2026-08-02T00:36:15.697891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.703133Z","title":"Workarena++: Towards compositional planning and reasoning-based common knowledge work tasks.Advances in Neural Information Processing Systems, 37:5996–6051, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T20:42:21.683853Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.703133Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:e6b949492afa23003ef105894f2267ddca95c7dd9889ce974775efa047b56b8e","observation_id":"69d89396-9c19-42f5-9f52-506cad14fab0","resolution":{"observed_at":"2026-08-02T00:36:15.703133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.708055Z","title":"Acebench: Who wins the match point in tool usage?arXiv preprint arXiv:2501.12851, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T20:42:21.683853Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.708055Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:b35bded1fb8ff8667a40295285af2a1f1a0dfb6cc3d1a8032fa212feebbf8124","observation_id":"92e1de46-1928-4ce4-ba49-12da0a77ca13","resolution":{"observed_at":"2026-08-02T00:36:15.708055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-02T00:36:15.712554Z","title":"Training verifiers to solve math word problems, 2021.URL https://arxiv","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T20:42:21.683853Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.712554Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:bb2423f774ce874050a37a1e25932310117c2a9fdcb4d9e486f3963ea6933aa1","observation_id":"d2222a21-b736-4cfe-8275-ce8d485c1f75","resolution":{"observed_at":"2026-08-02T00:36:15.712554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.717827Z","title":"Deepseek-v4: Towards highly efficient million-token context intelligence, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T20:42:21.683853Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.717827Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:93c404b361de135edfa2b09f678e28793847ac0452a1c71c973b2cae3cfd5291","observation_id":"d9ac0475-4325-4b21-8e75-df4f7b354e95","resolution":{"observed_at":"2026-08-02T00:36:15.717827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.18292","last_updated":"2026-04-20T14:01:10Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:01:10Z","title":"Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.18292","snapshot_observed_at":"2026-08-02T00:36:15.722166Z","title":"Agent-world: Scaling real-world environment synthesis for evolving general agent intelligence.arXiv preprint arXiv:2604.18292, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T20:42:21.683853Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.722166Z"},"links":{"cited_paper":"/paper/2604.18292","citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:35f3ca4a529b1ae1b3c626e478ce3ced6418f09bb10a2f4b1ad6ce13c670d519","observation_id":"f80d6b94-f83a-4286-9116-df602d194120","resolution":{"observed_at":"2026-08-02T00:36:15.722166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.726706Z","title":"Gaia2: Benchmarking llm agents on dynamic and asynchronous environments.arXiv preprint arXiv:2602.11964, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T20:42:21.683853Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.726706Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:07ec8191b1da7e867d8d26966be5ce3301fadc99cc3db3bda54f0b7e0f6254b1","observation_id":"cfadd12e-87fa-42be-8641-d1fbb1574dde","resolution":{"observed_at":"2026-08-02T00:36:15.726706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15763","last_updated":"2026-02-24T10:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T17:50:56Z","title":"GLM-5: from Vibe Coding to Agentic Engineering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.15763","snapshot_observed_at":"2026-08-02T00:36:15.731165Z","title":"Glm-5: from vibe coding to agentic engineering, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T20:42:21.683853Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.731165Z"},"links":{"cited_paper":"/paper/2602.15763","citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:740b414c1b43a9fbb465b953764886dca24f64eba67dcc02c165b63dc1f1dce7","observation_id":"c345dfa9-7688-4b25-b7ca-c55a6fe11a38","resolution":{"observed_at":"2026-08-02T00:36:15.731165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.736318Z","title":"Vitabench: Benchmarking llm agents with versatile interactive tasks in real-world applications.arXiv preprint arXiv:2509.26490, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T20:42:21.683853Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.736318Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:e3cc57c8a090434beed90677a4734291f6307b87bafe4ad153d3332752b2e9b2","observation_id":"a1ad8539-97f9-47ff-874d-8edd8998011c","resolution":{"observed_at":"2026-08-02T00:36:15.736318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.740857Z","title":"Swe-bench: Can language models resolve real-world github issues? In International Conference on Learning Representations, volume 2024, pages 54107–54157, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T20:42:21.683853Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.740857Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:243f0738a5bf5f195ced374ca759d6447f26712d2348251b0fb0962ad49e1208","observation_id":"d532e613-26c8-4670-99cf-ee37c8d0485f","resolution":{"observed_at":"2026-08-02T00:36:15.740857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.745842Z","title":"The tool decathlon: Bench- marking language agents for diverse, realistic, and long-horizon task execution.arXiv preprint arXiv:2510.25726, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T20:42:21.683853Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.745842Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:aa96b4943d2d7a4613a8233b13c6f439b0e77bad7a0cb33e140f352af373bf50","observation_id":"de01f234-0ee2-40bb-a02f-ae99aa420a8e","resolution":{"observed_at":"2026-08-02T00:36:15.745842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.750217Z","title":"Dataflow: An llm-driven framework for unified data preparation and workflow automation in the era of data-centric ai, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T20:42:21.683853Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.750217Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:ced4e4c68d6274822a96bfa7aeaab7eb2afbc58bed6519dcd4332848ef69b43a","observation_id":"ae5b7737-562e-4b11-abc5-8bf9457f9a66","resolution":{"observed_at":"2026-08-02T00:36:15.750217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.754402Z","title":"Toolsandbox: A stateful, conversational, interactive evaluation benchmark for llm tool use capabilities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T20:42:21.683853Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.754402Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:b0f4d033b133410d9e7c4898a8009da91d3d63f538bfc242833343c99208d571","observation_id":"dcec0a53-67d5-4c3d-bcb9-1ae873084715","resolution":{"observed_at":"2026-08-02T00:36:15.754402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.23781","last_updated":"2026-05-05T15:32:46Z","snapshot_observed_at":"2026-07-06T23:09:58.193241Z","submitted_at":"2026-04-26T16:05:02Z","title":"ClawMark: A Living-World Benchmark for Multi-Turn, Multi-Day, Multimodal Coworker Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.23781","snapshot_observed_at":"2026-08-02T00:36:15.758892Z","title":"Clawmark: A living-world benchmark for multi-turn, multi-day, multimodal coworker agents.arXiv preprint arXiv:2604.23781, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T20:42:21.683853Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.758892Z"},"links":{"cited_paper":"/paper/2604.23781","citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:a2925a8fd1e5df6e4e0ea562d76267cad9d888a7671ca849bc7303fc1487ecd1","observation_id":"35d0ddb8-f4d3-4ac4-920f-1a718e7be0cb","resolution":{"observed_at":"2026-08-02T00:36:15.758892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.763968Z","title":"Gorilla: Large language model connected with massive apis.Advances in Neural Information Processing Systems, 37:126544–126565, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T20:42:21.683853Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.763968Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:e75a4e66bc7ef83e26943f27fa75901029d57c3446f6d4191c9083ee654953a3","observation_id":"57e6884d-83e8-4a3e-aa7c-f3d8bac50212","resolution":{"observed_at":"2026-08-02T00:36:15.763968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.768484Z","title":"The berkeley function calling leaderboard (bfcl): From tool use to agentic evaluation of large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T20:42:21.683853Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.768484Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:50e2a95396dd597c65eb0d3da43cad30aed27ac122bc58ecb4311aebf5719153","observation_id":"c13722e1-b478-40ba-a0d6-96a425633d9a","resolution":{"observed_at":"2026-08-02T00:36:15.768484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.04374","last_updated":"2025-10-05T21:36:43Z","snapshot_observed_at":"2026-07-06T22:31:44.964774Z","submitted_at":"2025-10-05T21:36:43Z","title":"GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.04374","snapshot_observed_at":"2026-08-02T00:36:15.772715Z","title":"Gdpval: Evaluating ai model performance on real-world economically valuable tasks.arXiv preprint arXiv:2510.04374, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T20:42:21.683853Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.772715Z"},"links":{"cited_paper":"/paper/2510.04374","citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:086498cdc1346e06a9b91140a1c37ff48e7617bb20b264608da88c199682cff3","observation_id":"146c6ecc-0f79-4997-83da-47bd6ce570af","resolution":{"observed_at":"2026-08-02T00:36:15.772715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.777037Z","title":"QwenClawBench: Real-user-distribution benchmark for openclaw agents, April","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T20:42:21.683853Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.777037Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:9d97a40590f02fdc6510aa40c70f9c36c899a7d7b263faeef8d3fb497f60f689","observation_id":"d90dc87d-f0b7-4e55-b017-cfc8530cc58c","resolution":{"observed_at":"2026-08-02T00:36:15.777037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.785663Z","title":"One-eval: An agentic system for automated and traceable llm evaluation.arXiv preprint arXiv:2603.09821, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T20:42:21.683853Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.785663Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:2b07945ed5cf07395439ed3c1ec70187938047ed021888aa6e734ae7ee51666b","observation_id":"8d291883-7561-47ed-b00e-4e53a70b11b8","resolution":{"observed_at":"2026-08-02T00:36:15.785663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.789506Z","title":"URLhttps://arxiv.org/abs/2603.04370","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T20:42:21.683853Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.789506Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:bde12f7359a88c91bcb581fd68590905ca8b6d994f33b8fc17fda705575a9764","observation_id":"8a43c760-0979-454d-9dcb-148f7ee0153a","resolution":{"observed_at":"2026-08-02T00:36:15.789506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02276","last_updated":"2026-02-02T16:17:38Z","snapshot_observed_at":"2026-07-06T22:44:09.804048Z","submitted_at":"2026-02-02T16:17:38Z","title":"Kimi K2.5: Visual Agentic Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.02276","snapshot_observed_at":"2026-08-02T00:36:15.794297Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T20:42:21.683853Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.794297Z"},"links":{"cited_paper":"/paper/2602.02276","citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:0abf7a967874a76e94948904d3657fb544cc0b4715fe89764f2163ec6bbd276f","observation_id":"e55cf75c-035a-4b25-a140-5a352ebe7b0d","resolution":{"observed_at":"2026-08-02T00:36:15.794297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.799456Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark.Advances in Neural Information Processing Systems, 37:95266–95290, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T20:42:21.683853Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.799456Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:dd4852e7bf027eeca1da304242bbbd91e5ea0e3a002d2fc00488e0311bf47609","observation_id":"bb12d6ba-b891-44d2-be04-6d568462a14a","resolution":{"observed_at":"2026-08-02T00:36:15.799456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.804245Z","title":"Swe-agent: Agent-computer interfaces enable automated software engineering.Advances in Neural Information Processing Systems, 37:50528–50652, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T20:42:21.683853Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.804245Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:50c60165ac72933ab31350e392084db1bece6009bc1bfca78874c76169745013","observation_id":"af412506-04f8-471c-97d8-06db166c7e8e","resolution":{"observed_at":"2026-08-02T00:36:15.804245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12045","last_updated":"2024-06-17T19:33:08Z","snapshot_observed_at":"2026-08-08T21:08:39.676079Z","submitted_at":"2024-06-17T19:33:08Z","title":"$\\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12045","snapshot_observed_at":"2026-08-02T00:36:15.809267Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T20:42:21.683853Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.809267Z"},"links":{"cited_paper":"/paper/2406.12045","citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:2147dc2fcb79687017c4044ce3dee4dd8d8214d565b52de6be6c3d3b337f2702","observation_id":"380c0c35-124a-4edf-9d35-aae77bbfd9a5","resolution":{"observed_at":"2026-08-02T00:36:15.809267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.06132","last_updated":"2026-05-07T14:06:23Z","snapshot_observed_at":"2026-07-06T22:54:40.349479Z","submitted_at":"2026-04-07T17:43:18Z","title":"Claw-Eval: Towards Trustworthy Evaluation of Autonomous Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.06132","snapshot_observed_at":"2026-08-02T00:36:15.814013Z","title":"Claw-eval: Towards trustworthy evaluation of autonomous agents.arXiv preprint arXiv:2604.06132, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T20:42:21.683853Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.814013Z"},"links":{"cited_paper":"/paper/2604.06132","citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:f9fa9f3fc8d6fc0de101543de1364ceb92da220aca12e04addc606b90d3c9a91","observation_id":"f7303418-7fa0-46ef-9090-43c43d571a79","resolution":{"observed_at":"2026-08-02T00:36:15.814013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.818900Z","title":"Deepplanning: Bench- marking long-horizon agentic planning with verifiable constraints.arXiv preprint arXiv:2601.18137, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T20:42:21.683853Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.818900Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:8080d88880daa726bef7ab606ed6a9d702d8e5128a79345fe3a4f4b39b417400","observation_id":"6fe38867-3a50-4928-8cc1-323641177e9f","resolution":{"observed_at":"2026-08-02T00:36:15.818900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.824559Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T20:42:21.683853Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.824559Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:8596b1dc57329b6a88fa4961fb8baa93feba38df000c869632500a3ae821b827","observation_id":"532400e7-adb4-410f-acfd-6b22622c9a7c","resolution":{"observed_at":"2026-08-02T00:36:15.824559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.828684Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T20:42:21.683853Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.828684Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:7239200657e3f8008e9d860fe62246ab9452b2a182bcf52767abba4f434e8b41","observation_id":"7099790e-86de-4bb8-89bc-b4636ce2f1e0","resolution":{"observed_at":"2026-08-02T00:36:15.828684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.833186Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T20:42:21.683853Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.833186Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:83fc5acc786ee7bae975bfcac404575200adfa70aabf468b6936d72db676b03f","observation_id":"72246456-5f0d-4556-9518-d2adf7b427e4","resolution":{"observed_at":"2026-08-02T00:36:15.833186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.837265Z","title":"This protocol evaluates not only task execution, but also clarification, constraint tracking, adaptation to user feedback, and state maintenance across multiple turns","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T20:42:21.683853Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.837265Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:5daa655f4726c27a0a2e9f558197f7ed79caf3350d16aa236aac8c707c440264","observation_id":"67998d9a-8708-4d4e-b59d-12469d9c2195","resolution":{"observed_at":"2026-08-02T00:36:15.837265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.842384Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T20:42:21.683853Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.842384Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:16a71838107ed8c40a2746ca7754f4a372dbef156e131ba4c311300c8bc41ae1","observation_id":"714e253d-0a79-4272-8875-05d696ed5080","resolution":{"observed_at":"2026-08-02T00:36:15.842384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.846871Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T20:42:21.683853Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.846871Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:b09e2a18b4a615375e8dd77067b2324b8a9b33d3d752caabc95b8af8b6e01eae","observation_id":"77acbd66-6a2b-476f-bf2d-f0b21dcb3264","resolution":{"observed_at":"2026-08-02T00:36:15.846871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.852162Z","title":"4.VerifyCodechecks the trajectory and final observation and returns a binary pass/fail result","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T20:42:21.683853Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.852162Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:6815cda087bad6781b9ab48a54045a41ea5877fdb3305fbc5fb6fdf94e84af17","observation_id":"ef31ed00-4acd-458d-83e4-0b45f1df8868","resolution":{"observed_at":"2026-08-02T00:36:15.852162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.856453Z","title":"[...additional description omitted ...]","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T20:42:21.683853Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.856453Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:2c4f9f1635e40a77f4906b0173f034287bcf816b7c60c94b8226520841573fe3","observation_id":"e7af32ea-81ca-4c1b-bc37-92a81124aa3d","resolution":{"observed_at":"2026-08-02T00:36:15.856453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.860557Z","title":"[...additional tools omitted ...]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T20:42:21.683853Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.860557Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:706a5b4af598f1c317e282e75760402232172b92298983c22448b051b5ea413a","observation_id":"fcd424a9-9c6d-47a2-8ee4-9f4dde5f68d8","resolution":{"observed_at":"2026-08-02T00:36:15.860557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.865246Z","title":"Your goal is to complete the user’s request in an interactive environment by gradually calling the available tools step by step, and to proactively communicate with the user","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T20:42:21.683853Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.865246Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:bdede0ebea2c57e6b9670cfbe77510229028f03e18f4804cf45d38ce108f25b8","observation_id":"10c3a754-e51a-4626-9ef3-498b001c9a3b","resolution":{"observed_at":"2026-08-02T00:36:15.865246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.869397Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T20:42:21.683853Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.869397Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:f6a287f09a26dab7b11b8afc936a3dde92a9dad8f0c18cea839f91f7d9401793","observation_id":"85bd7733-9245-40e0-89a5-575d6b867983","resolution":{"observed_at":"2026-08-02T00:36:15.869397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.874308Z","title":"<Judge reason> The trajectory correctly resolvesLF-2024-PI-024, confirms Yunhe Foods / Lin Qiaoxue / He Shan, verifiesVER-004 as current, and flags the self-referentialLNK-003link","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T20:42:21.683853Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.874308Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:4c33282242a8c55c6a5b09d4ad57f00f6f7876b5a712475e2ace9cc9a8c85e98","observation_id":"e457aacb-d23d-48fc-92db-2e1a7301f1e2","resolution":{"observed_at":"2026-08-02T00:36:15.874308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.878606Z","title":"store surveillance screenshots and incident timeline explanation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T20:42:21.683853Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.878606Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:9c516cd8b33476dd564763d58d7d8cd37b82957ced6732439ed91f4d1ebcdfd2","observation_id":"3b900804-95e7-4063-82de-3f3bce04cd52","resolution":{"observed_at":"2026-08-02T00:36:15.878606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.883109Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T20:42:21.683853Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.883109Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:53fa56162b11079ae30188238ab2f794cf130a9911bdc16d07858fdcd06ecf43","observation_id":"008c583d-9452-4fa5-936d-392a1db75110","resolution":{"observed_at":"2026-08-02T00:36:15.883109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.887535Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T20:42:21.683853Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.887535Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:e4e5243e350ef729e81e44c317b80ad9f4964f7df4126e864e72572aad2cfe4a","observation_id":"8db42b9d-0575-4d7e-9996-7269cca3ffab","resolution":{"observed_at":"2026-08-02T00:36:15.887535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.892243Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T20:42:21.683853Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.892243Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:8825fadb70509581d91027ffa8a4bbbf5fe0951908a2e6e21724ad70b9b1e722","observation_id":"bd688285-357f-4f79-a60f-60a168ba8c39","resolution":{"observed_at":"2026-08-02T00:36:15.892243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.896432Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T20:42:21.683853Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.896432Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:4c9a99c33907a4f93679651b79d2e48ce6da383922a07dc3c3d378d564e6434b","observation_id":"ecf144a3-b8d9-41c8-9c6e-b03b254a77ae","resolution":{"observed_at":"2026-08-02T00:36:15.896432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:36:15.781239Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","snapshot_observed_at":"2026-08-06T20:42:21.683853Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-02T00:36:15.781239Z"},"links":{"citing_paper":"/paper/2607.14989"},"observation_digest":"sha256:b4c232329c7c18a6934e74ecec739c411d6db60315300a99b7776464cbac5126","observation_id":"2861883a-b8c8-47d8-b643-7ac88668d0c4","resolution":{"observed_at":"2026-08-02T00:36:15.781239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.14989","last_updated":"2026-07-16T13:38:07Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T20:42:21.683853Z","submitted_at":"2026-07-16T13:38:07Z","title":"OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":46,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 1 inbound Pith citation observation for arXiv:2607.14989."}