{"as_of":"2026-08-05T16:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6c9c7f4caeb23395894f5c4127e5371d53ff9d4038585f1717ec1e278fe4a4f7","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":21,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T05:13:41.995563Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-11T01:37:42.801023Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.09124","last_updated":"2025-08-12T17:53:03Z","snapshot_observed_at":"2026-07-06T22:11:57.493922Z","submitted_at":"2025-08-12T17:53:03Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","version":1},"cited_work":{"arxiv_id":"2508.09124","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.09124","snapshot_observed_at":"2026-07-11T01:37:42.801023Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","venue":"cs.CL","work_id":"061edd26-53a3-4802-a464-5ce90e859239","year":2025},"citing_paper":{"arxiv_id":"2512.13168","last_updated":"2026-04-15T17:46:00Z","snapshot_observed_at":"2026-07-31T12:41:54.136440Z","submitted_at":"2025-12-15T10:28:45Z","title":"Finch: Benchmarking Finance & Accounting across Spreadsheet-Centric Enterprise Workflows","version":5},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-16T22:43:48.618334Z"},"links":{"cited_paper":"/paper/2508.09124","citing_paper":"/paper/2512.13168"},"observation_digest":"sha256:f6dfedf8431f0c3b7f0a94ee61d662a6757179b0935ef94bfa44346dc7f5b9e0","observation_id":"65d346f4-7218-450b-a8d3-1038b655014f","resolution":{"observed_at":"2026-05-16T22:48:38.315116Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09124","last_updated":"2025-08-12T17:53:03Z","snapshot_observed_at":"2026-07-06T22:11:57.493922Z","submitted_at":"2025-08-12T17:53:03Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09124","snapshot_observed_at":"2026-08-03T04:08:12.299526Z","title":"M., Xu, J., R \\\"u hle, V., and Rajmohan, S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.05843","last_updated":"2026-06-04T17:59:52Z","snapshot_observed_at":"2026-08-03T04:08:05.711718Z","submitted_at":"2026-02-05T16:31:43Z","title":"OdysseyArena: Benchmarking Large Language Models For Long-Horizon, Active and Inductive Interactions","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-03T04:08:12.299526Z"},"links":{"cited_paper":"/paper/2508.09124","citing_paper":"/paper/2602.05843"},"observation_digest":"sha256:80c3b912516dcdfb63e5aefba23f80adcb1a07ee76dff836fe53b5ec071f94ae","observation_id":"5072d6c0-9b4a-4c27-8feb-cd934da8508e","resolution":{"observed_at":"2026-08-03T04:08:12.299526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09124","last_updated":"2025-08-12T17:53:03Z","snapshot_observed_at":"2026-07-06T22:11:57.493922Z","submitted_at":"2025-08-12T17:53:03Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09124","snapshot_observed_at":"2026-07-13T23:45:24.809791Z","title":"Preprint, arXiv:2508.09124","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16453","last_updated":"2026-07-08T13:11:31Z","snapshot_observed_at":"2026-07-13T23:45:24.236059Z","submitted_at":"2026-03-17T12:35:52Z","title":"RetailBench: Evaluating Long-Horizon Autonomous Decision-Making and Strategy Stability of LLM Agents in Realistic Retail Environments","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-13T23:45:24.809791Z"},"links":{"cited_paper":"/paper/2508.09124","citing_paper":"/paper/2603.16453"},"observation_digest":"sha256:d1eb29b246d31452aa013defc2ee25f6eb100f00e361bff5022331ec228c445a","observation_id":"c62324e5-15e4-4783-944e-7ea13ed7d6c7","resolution":{"observed_at":"2026-07-13T23:45:24.809791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09124","last_updated":"2025-08-12T17:53:03Z","snapshot_observed_at":"2026-07-06T22:11:57.493922Z","submitted_at":"2025-08-12T17:53:03Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","version":1},"cited_work":{"arxiv_id":"2508.09124","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.09124","snapshot_observed_at":"2026-07-11T01:37:42.801023Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","venue":"cs.CL","work_id":"061edd26-53a3-4802-a464-5ce90e859239","year":2025},"citing_paper":{"arxiv_id":"2604.02522","last_updated":"2026-04-02T21:23:00Z","snapshot_observed_at":"2026-08-03T01:43:37.179078Z","submitted_at":"2026-04-02T21:23:00Z","title":"Opal: Private Memory for Personal AI","version":1},"reference_index":239,"source":"pdf_text","source_observed_at":"2026-05-13T21:09:06.320543Z"},"links":{"cited_paper":"/paper/2508.09124","citing_paper":"/paper/2604.02522"},"observation_digest":"sha256:54a62c3fff32971d4d0868ec2265693dcf13a8ee1e612ec082bb2985387063d4","observation_id":"24c38b31-9cb7-4baa-9c58-338a028a99f0","resolution":{"observed_at":"2026-05-13T21:13:16.664821Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09124","last_updated":"2025-08-12T17:53:03Z","snapshot_observed_at":"2026-07-06T22:11:57.493922Z","submitted_at":"2025-08-12T17:53:03Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","version":1},"cited_work":{"arxiv_id":"2508.09124","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.09124","snapshot_observed_at":"2026-07-11T01:37:42.801023Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","venue":"cs.CL","work_id":"061edd26-53a3-4802-a464-5ce90e859239","year":2025},"citing_paper":{"arxiv_id":"2604.15715","last_updated":"2026-04-17T05:36:00Z","snapshot_observed_at":"2026-08-01T15:43:04.529409Z","submitted_at":"2026-04-17T05:36:00Z","title":"GTA-2: Benchmarking General Tool Agents from Atomic Tool-Use to Open-Ended Workflows","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T08:42:57.035226Z"},"links":{"cited_paper":"/paper/2508.09124","citing_paper":"/paper/2604.15715"},"observation_digest":"sha256:2b59f03af5a503e2f5764185b59402e7a275ec5fa4179b9538e7945a2f50b8b3","observation_id":"6b0e752a-c0bd-4e4b-ae6e-4ebeb9b0e139","resolution":{"observed_at":"2026-05-10T08:43:01.095541Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09124","last_updated":"2025-08-12T17:53:03Z","snapshot_observed_at":"2026-07-06T22:11:57.493922Z","submitted_at":"2025-08-12T17:53:03Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","version":1},"cited_work":{"arxiv_id":"2508.09124","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.09124","snapshot_observed_at":"2026-07-11T01:37:42.801023Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","venue":"cs.CL","work_id":"061edd26-53a3-4802-a464-5ce90e859239","year":2025},"citing_paper":{"arxiv_id":"2604.23455","last_updated":"2026-05-01T07:18:53Z","snapshot_observed_at":"2026-07-06T23:09:38.799345Z","submitted_at":"2026-04-25T22:10:53Z","title":"CUJBench: Benchmarking LLM-Agent on Cross-Modal Failure Diagnosis from Browser to Backend","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-08T07:47:51.195882Z"},"links":{"cited_paper":"/paper/2508.09124","citing_paper":"/paper/2604.23455"},"observation_digest":"sha256:26a8d3051a972855d344552b8a929ff80f4884e2ee0028846e1c0d67044bafbb","observation_id":"1bea0ef8-cb73-4380-9fa3-c3f46052a504","resolution":{"observed_at":"2026-05-11T20:51:13.490188Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09124","last_updated":"2025-08-12T17:53:03Z","snapshot_observed_at":"2026-07-06T22:11:57.493922Z","submitted_at":"2025-08-12T17:53:03Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","version":1},"cited_work":{"arxiv_id":"2508.09124","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.09124","snapshot_observed_at":"2026-07-11T01:37:42.801023Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","venue":"cs.CL","work_id":"061edd26-53a3-4802-a464-5ce90e859239","year":2025},"citing_paper":{"arxiv_id":"2605.07339","last_updated":"2026-05-08T06:44:11Z","snapshot_observed_at":"2026-07-31T12:37:52.379547Z","submitted_at":"2026-05-08T06:44:11Z","title":"Tools as Continuous Flow for Evolving Agentic Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-11T01:30:19.859374Z"},"links":{"cited_paper":"/paper/2508.09124","citing_paper":"/paper/2605.07339"},"observation_digest":"sha256:084b9043ae799d91b3a4dfd3b634c8bb7c035fc285b79760fb4427cec7d7d4ca","observation_id":"4fa2cec6-8f8b-4a61-b35c-6e1a2595bf5d","resolution":{"observed_at":"2026-05-11T01:45:51.700933Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09124","last_updated":"2025-08-12T17:53:03Z","snapshot_observed_at":"2026-07-06T22:11:57.493922Z","submitted_at":"2025-08-12T17:53:03Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","version":1},"cited_work":{"arxiv_id":"2508.09124","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.09124","snapshot_observed_at":"2026-07-11T01:37:42.801023Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","venue":"cs.CL","work_id":"061edd26-53a3-4802-a464-5ce90e859239","year":2025},"citing_paper":{"arxiv_id":"2605.10912","last_updated":"2026-05-11T17:49:43Z","snapshot_observed_at":"2026-08-03T00:15:01.823825Z","submitted_at":"2026-05-11T17:49:43Z","title":"WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-12T03:40:00.725327Z"},"links":{"cited_paper":"/paper/2508.09124","citing_paper":"/paper/2605.10912"},"observation_digest":"sha256:556fd2ddb5b8a3378898668ce3d2a7ef709336ba2909f67124967439a87961e1","observation_id":"4d5e23ff-a394-4099-9135-f654742b73de","resolution":{"observed_at":"2026-05-12T07:11:23.957989Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09124","last_updated":"2025-08-12T17:53:03Z","snapshot_observed_at":"2026-07-06T22:11:57.493922Z","submitted_at":"2025-08-12T17:53:03Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","version":1},"cited_work":{"arxiv_id":"2508.09124","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.09124","snapshot_observed_at":"2026-07-11T01:37:42.801023Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","venue":"cs.CL","work_id":"061edd26-53a3-4802-a464-5ce90e859239","year":2025},"citing_paper":{"arxiv_id":"2605.15230","last_updated":"2026-08-03T14:38:56Z","snapshot_observed_at":"2026-08-05T16:22:58.287056Z","submitted_at":"2026-05-13T18:03:51Z","title":"EnergyAgentBench: Benchmarking LLM Agents on Live Energy Infrastructure Data","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-19T17:43:11.038874Z"},"links":{"cited_paper":"/paper/2508.09124","citing_paper":"/paper/2605.15230"},"observation_digest":"sha256:157b8fedbb79316a28dc0f0456364a3f4f671516cf468b7f78c838a67235a5da","observation_id":"f5a64f86-eeb9-4c68-ba41-61067e440367","resolution":{"observed_at":"2026-05-19T17:47:42.076382Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09124","last_updated":"2025-08-12T17:53:03Z","snapshot_observed_at":"2026-07-06T22:11:57.493922Z","submitted_at":"2025-08-12T17:53:03Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09124","snapshot_observed_at":"2026-08-04T05:13:41.995563Z","title":"arXiv preprint arXiv:2508.09124, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.15230","last_updated":"2026-08-03T14:38:56Z","snapshot_observed_at":"2026-08-05T16:22:58.287056Z","submitted_at":"2026-05-13T18:03:51Z","title":"EnergyAgentBench: Benchmarking LLM Agents on Live Energy Infrastructure Data","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T05:13:41.995563Z"},"links":{"cited_paper":"/paper/2508.09124","citing_paper":"/paper/2605.15230"},"observation_digest":"sha256:ae0c3f8e626bd0ead67c6a636938477507ee8801ce4734451bf7f4e9485a100a","observation_id":"6e0420ee-eb3c-4c33-8f04-924fbe58b065","resolution":{"observed_at":"2026-08-04T05:13:41.995563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09124","last_updated":"2025-08-12T17:53:03Z","snapshot_observed_at":"2026-07-06T22:11:57.493922Z","submitted_at":"2025-08-12T17:53:03Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","version":1},"cited_work":{"arxiv_id":"2508.09124","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.09124","snapshot_observed_at":"2026-07-11T01:37:42.801023Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","venue":"cs.CL","work_id":"061edd26-53a3-4802-a464-5ce90e859239","year":2025},"citing_paper":{"arxiv_id":"2606.05342","last_updated":"2026-06-05T17:19:56Z","snapshot_observed_at":"2026-07-06T23:45:23.749718Z","submitted_at":"2026-06-03T18:32:00Z","title":"SentinelBench: A Benchmark for Long-Running Monitoring Agents","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-06-28T06:09:38.698353Z"},"links":{"cited_paper":"/paper/2508.09124","citing_paper":"/paper/2606.05342"},"observation_digest":"sha256:004dccbec720ed65f9d6669d1b4416f27db1ef445c5af440a0f386c6919cbf47","observation_id":"4d295bdd-2f3e-46ed-8708-8acc3d463185","resolution":{"observed_at":"2026-07-02T08:16:48.301325Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09124","last_updated":"2025-08-12T17:53:03Z","snapshot_observed_at":"2026-07-06T22:11:57.493922Z","submitted_at":"2025-08-12T17:53:03Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","version":1},"cited_work":{"arxiv_id":"2508.09124","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.09124","snapshot_observed_at":"2026-07-11T01:37:42.801023Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","venue":"cs.CL","work_id":"061edd26-53a3-4802-a464-5ce90e859239","year":2025},"citing_paper":{"arxiv_id":"2606.08340","last_updated":"2026-06-06T21:13:43Z","snapshot_observed_at":"2026-07-31T22:58:06.517022Z","submitted_at":"2026-06-06T21:13:43Z","title":"Benchmarking Open-Ended Multi-Agent Coordination in Language Agents","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-27T19:18:56.039587Z"},"links":{"cited_paper":"/paper/2508.09124","citing_paper":"/paper/2606.08340"},"observation_digest":"sha256:6edf4b7f85354e4a1895ba29d41518abe2bea7db46c83f2ae76fd200587c019d","observation_id":"2fb866c7-3830-4bb4-b3fb-a9ecb1dd1d5a","resolution":{"observed_at":"2026-07-02T21:57:26.489813Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09124","last_updated":"2025-08-12T17:53:03Z","snapshot_observed_at":"2026-07-06T22:11:57.493922Z","submitted_at":"2025-08-12T17:53:03Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","version":1},"cited_work":{"arxiv_id":"2508.09124","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.09124","snapshot_observed_at":"2026-07-11T01:37:42.801023Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","venue":"cs.CL","work_id":"061edd26-53a3-4802-a464-5ce90e859239","year":2025},"citing_paper":{"arxiv_id":"2606.14397","last_updated":"2026-06-25T10:49:26Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T12:32:24Z","title":"Running the Gauntlet: Re-evaluating the Capabilities of Agents Beyond Familiar Environments","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-27T04:35:38.527140Z"},"links":{"cited_paper":"/paper/2508.09124","citing_paper":"/paper/2606.14397"},"observation_digest":"sha256:4b270235ff31e2c0830f988a47cfdfccd450aa23ad0c3c1d5dc4454e457921f6","observation_id":"a4eb0f97-5ceb-46e3-8957-5d90ae170888","resolution":{"observed_at":"2026-07-03T17:08:43.394326Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09124","last_updated":"2025-08-12T17:53:03Z","snapshot_observed_at":"2026-07-06T22:11:57.493922Z","submitted_at":"2025-08-12T17:53:03Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","version":1},"cited_work":{"arxiv_id":"2508.09124","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.09124","snapshot_observed_at":"2026-07-11T01:37:42.801023Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","venue":"cs.CL","work_id":"061edd26-53a3-4802-a464-5ce90e859239","year":2025},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-02T11:01:11.072388Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-06-27T00:19:47.396643Z"},"links":{"cited_paper":"/paper/2508.09124","citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:0191981c89fea9a2541091d78ebced8429c9410b76accb87afcedfa16a7d6ce0","observation_id":"3ab79eeb-82cd-4ef1-80d5-1a74c4fe99e4","resolution":{"observed_at":"2026-07-03T21:38:58.671790Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09124","last_updated":"2025-08-12T17:53:03Z","snapshot_observed_at":"2026-07-06T22:11:57.493922Z","submitted_at":"2025-08-12T17:53:03Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09124","snapshot_observed_at":"2026-08-02T11:01:20.504958Z","title":"OdysseyBench : Evaluating LLM agents on long-horizon complex office application workflows","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-02T11:01:11.072388Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-02T11:01:20.504958Z"},"links":{"cited_paper":"/paper/2508.09124","citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:a51f76b5da740a8a2e4fc3a43418a205567233b25cb51a040844069f2a70e281","observation_id":"f8e0eeee-4f78-4a5a-94ab-21a3e66e5da5","resolution":{"observed_at":"2026-08-02T11:01:20.504958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09124","last_updated":"2025-08-12T17:53:03Z","snapshot_observed_at":"2026-07-06T22:11:57.493922Z","submitted_at":"2025-08-12T17:53:03Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","version":1},"cited_work":{"arxiv_id":"2508.09124","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.09124","snapshot_observed_at":"2026-07-11T01:37:42.801023Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","venue":"cs.CL","work_id":"061edd26-53a3-4802-a464-5ce90e859239","year":2025},"citing_paper":{"arxiv_id":"2606.21654","last_updated":"2026-06-19T18:00:14Z","snapshot_observed_at":"2026-08-04T06:52:55.694202Z","submitted_at":"2026-06-19T18:00:14Z","title":"ChainWorld: Composing Long-Horizon Desktop Workloads from Atomic OSWorld Tasks","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-26T14:05:28.423719Z"},"links":{"cited_paper":"/paper/2508.09124","citing_paper":"/paper/2606.21654"},"observation_digest":"sha256:1aceaccedf72814062c98ef04cbc8d56d1a9775e99b0e602b37f65de755323a7","observation_id":"ad13d3d4-f532-4450-96d8-0ce87595a72a","resolution":{"observed_at":"2026-07-04T06:49:38.855626Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09124","last_updated":"2025-08-12T17:53:03Z","snapshot_observed_at":"2026-07-06T22:11:57.493922Z","submitted_at":"2025-08-12T17:53:03Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","version":1},"cited_work":{"arxiv_id":"2508.09124","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.09124","snapshot_observed_at":"2026-07-11T01:37:42.801023Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","venue":"cs.CL","work_id":"061edd26-53a3-4802-a464-5ce90e859239","year":2025},"citing_paper":{"arxiv_id":"2606.26346","last_updated":"2026-06-24T19:38:21Z","snapshot_observed_at":"2026-08-01T10:31:00.655586Z","submitted_at":"2026-06-24T19:38:21Z","title":"How Do Tool-Augmented LLM Agents Perform on Real-World Energy Analytics Tasks?","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-26T01:34:10.103638Z"},"links":{"cited_paper":"/paper/2508.09124","citing_paper":"/paper/2606.26346"},"observation_digest":"sha256:b65392e2e57fee4527027ab9b0929e7d2be462626fa715dec897f1cbcaa5d603","observation_id":"561a7d5e-68da-4aaa-9250-13b69716b9d0","resolution":{"observed_at":"2026-07-04T15:29:56.687129Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09124","last_updated":"2025-08-12T17:53:03Z","snapshot_observed_at":"2026-07-06T22:11:57.493922Z","submitted_at":"2025-08-12T17:53:03Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","version":1},"cited_work":{"arxiv_id":"2508.09124","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.09124","snapshot_observed_at":"2026-07-11T01:37:42.801023Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","venue":"cs.CL","work_id":"061edd26-53a3-4802-a464-5ce90e859239","year":2025},"citing_paper":{"arxiv_id":"2607.01245","last_updated":"2026-05-29T03:19:32Z","snapshot_observed_at":"2026-07-07T00:06:49.412663Z","submitted_at":"2026-05-29T03:19:32Z","title":"Office Comprehension Benchmark","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-04T00:20:42.974208Z"},"links":{"cited_paper":"/paper/2508.09124","citing_paper":"/paper/2607.01245"},"observation_digest":"sha256:a4ba2f314db52c43f9880574b5d5f635b06cc7f1f7c595f14b060d04c6f02b3f","observation_id":"0adcedff-cf5d-4e65-ac83-237afa52fb7e","resolution":{"observed_at":"2026-07-04T00:29:15.017566Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09124","last_updated":"2025-08-12T17:53:03Z","snapshot_observed_at":"2026-07-06T22:11:57.493922Z","submitted_at":"2025-08-12T17:53:03Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","version":1},"cited_work":{"arxiv_id":"2508.09124","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.09124","snapshot_observed_at":"2026-07-11T01:37:42.801023Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","venue":"cs.CL","work_id":"061edd26-53a3-4802-a464-5ce90e859239","year":2025},"citing_paper":{"arxiv_id":"2607.06008","last_updated":"2026-07-09T11:01:43Z","snapshot_observed_at":"2026-07-12T23:17:38.931960Z","submitted_at":"2026-07-07T08:50:09Z","title":"PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-08T20:03:47.212663Z"},"links":{"cited_paper":"/paper/2508.09124","citing_paper":"/paper/2607.06008"},"observation_digest":"sha256:f3d103d7efd7016c2dab0f15373529067826f5393406ec0db9ba75987e0808b8","observation_id":"662aa882-8fc7-40db-979c-6a923384bff0","resolution":{"observed_at":"2026-07-08T20:05:34.092723Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09124","last_updated":"2025-08-12T17:53:03Z","snapshot_observed_at":"2026-07-06T22:11:57.493922Z","submitted_at":"2025-08-12T17:53:03Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","version":1},"cited_work":{"arxiv_id":"2508.09124","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.09124","snapshot_observed_at":"2026-07-11T01:37:42.801023Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","venue":"cs.CL","work_id":"061edd26-53a3-4802-a464-5ce90e859239","year":2025},"citing_paper":{"arxiv_id":"2607.06008","last_updated":"2026-07-09T11:01:43Z","snapshot_observed_at":"2026-07-12T23:17:38.931960Z","submitted_at":"2026-07-07T08:50:09Z","title":"PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-11T01:37:23.646537Z"},"links":{"cited_paper":"/paper/2508.09124","citing_paper":"/paper/2607.06008"},"observation_digest":"sha256:79048ea20d90225f8268360b9f9875bcc5b91c1a121f16f8563363bfb06e6a86","observation_id":"3d6e37f4-3f48-4ee5-9232-60d5934d89f5","resolution":{"observed_at":"2026-07-11T01:37:42.831140Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09124","last_updated":"2025-08-12T17:53:03Z","snapshot_observed_at":"2026-07-06T22:11:57.493922Z","submitted_at":"2025-08-12T17:53:03Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09124","snapshot_observed_at":"2026-07-30T10:50:09.643083Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27155","last_updated":"2026-07-29T17:33:47Z","snapshot_observed_at":"2026-08-03T10:37:01.473880Z","submitted_at":"2026-07-29T17:33:47Z","title":"OmegaUse-OfficeVal: Benchmarking LLM Agents on Long-Horizon Office-Suite Tasks with Economic Grounding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-30T10:50:09.643083Z"},"links":{"cited_paper":"/paper/2508.09124","citing_paper":"/paper/2607.27155"},"observation_digest":"sha256:066f791caa00c19b4487b596f18b8fe61a9a77b5786051c0485f7ff3d64bf8d2","observation_id":"35539d15-0a15-41c9-9662-f7ecf4bb764c","resolution":{"observed_at":"2026-07-30T10:50:09.643083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.09124/citation-record","integrity":"/paper/2508.09124/integrity","json":"/paper/2508.09124/citation-record.json","paper":"/paper/2508.09124"},"outbound":[],"paper":{"arxiv_id":"2508.09124","last_updated":"2025-08-12T17:53:03Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T22:11:57.493922Z","submitted_at":"2025-08-12T17:53:03Z","title":"OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 21 inbound Pith citation observations for arXiv:2508.09124."}