{"as_of":"2026-08-09T22:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:61ce8b6ee6fcbfda7284ff748e0739872a2d153975320f11a396c452c2b98b4d","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:09:04.438910Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T05:42:59.909229Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T10:48:12.945063Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00539","snapshot_observed_at":"2026-08-06T05:42:59.909229Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.01557","last_updated":"2025-08-03T03:03:05Z","snapshot_observed_at":"2026-08-07T22:45:43.378325Z","submitted_at":"2025-08-03T03:03:05Z","title":"Unsupervised Learning for the Elementary Shortest Path Problem","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T05:42:59.909229Z"},"links":{"cited_paper":"/paper/2506.00539","citing_paper":"/paper/2508.01557"},"observation_digest":"sha256:59c6995e4684da2e7bedb677f998101c51113ece492cf1f62c62d609ee07dd2b","observation_id":"c3128c10-4099-4755-8cb2-2203ceb52e11","resolution":{"observed_at":"2026-08-06T05:42:59.909229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"cited_work":{"arxiv_id":"2506.00539","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00539","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Aria: Training language agents with intention-driven reward aggregation","venue":null,"work_id":"a638b501-a63c-4ab4-b6da-4a3f1747bdc4","year":2025},"citing_paper":{"arxiv_id":"2605.18597","last_updated":"2026-05-19T03:38:49Z","snapshot_observed_at":"2026-07-06T23:29:29.105126Z","submitted_at":"2026-05-18T16:07:44Z","title":"Latent Action Reparameterization for Efficient Agent Inference","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-20T10:45:20.306945Z"},"links":{"cited_paper":"/paper/2506.00539","citing_paper":"/paper/2605.18597"},"observation_digest":"sha256:929dbe548a66b9ad336943114643b4fd5da26d7b536f56f31cd0d04c21eaa754","observation_id":"6d425eb3-e2b6-43f7-87c1-d24c0a9c6d16","resolution":{"observed_at":"2026-05-20T10:48:12.946615Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.00539/citation-record","integrity":"/paper/2506.00539/integrity","json":"/paper/2506.00539/citation-record.json","paper":"/paper/2506.00539"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:58.443310Z","title":"A survey on large language model based autonomous agents.Frontiers of Computer Science, 18(6):186345, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:58.443310Z"},"links":{"citing_paper":"/paper/2506.00539"},"observation_digest":"sha256:67f5522bc688414165cd41344c3ca6855ab3da801c3deba914d5b6db5eb18226","observation_id":"80ad7cea-d893-42d4-8fb8-8d1dc96e9c22","resolution":{"observed_at":"2026-08-07T12:08:58.443310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21460","last_updated":"2025-03-27T12:50:17Z","snapshot_observed_at":"2026-07-06T20:59:35.694800Z","submitted_at":"2025-03-27T12:50:17Z","title":"Large Language Model Agent: A Survey on Methodology, Applications and Challenges","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21460","snapshot_observed_at":"2026-08-07T12:08:58.562789Z","title":"Large language model agent: A survey on methodology, applications and challenges.arXiv preprint arXiv:2503.21460, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:58.562789Z"},"links":{"cited_paper":"/paper/2503.21460","citing_paper":"/paper/2506.00539"},"observation_digest":"sha256:fc4429470d2945df9852b7eb651e9c221e2b9bfa490e4af3816f45c18e9930b2","observation_id":"9620f307-85c9-438c-ac40-08993cec4f70","resolution":{"observed_at":"2026-08-07T12:08:58.562789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:58.722060Z","title":"Cognitive architec- tures for language agents.Transactions on Machine Learning Research, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:58.722060Z"},"links":{"citing_paper":"/paper/2506.00539"},"observation_digest":"sha256:b9b7c17a09d731eb3cdfa3a738c19f7cae2f21141c18a3cea812f7a9ce0851e7","observation_id":"08dc02f7-5467-446a-b50b-0c95824aed5b","resolution":{"observed_at":"2026-08-07T12:08:58.722060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.12856","last_updated":"2024-02-25T16:17:43Z","snapshot_observed_at":"2026-07-06T15:57:53.178833Z","submitted_at":"2023-07-24T14:56:30Z","title":"A Real-World WebAgent with Planning, Long Context Understanding, and Program Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.12856","snapshot_observed_at":"2026-08-07T12:08:58.885758Z","title":"A real-world webagent with planning, long context understanding, and program synthesis.arXiv preprint arXiv:2307.12856, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:58.885758Z"},"links":{"cited_paper":"/paper/2307.12856","citing_paper":"/paper/2506.00539"},"observation_digest":"sha256:caa67525c2b73791fadef8dc57e63dc95b30925ce0e73079e9fe4b4974ccdc94","observation_id":"26122e5f-d53f-416d-afdd-296c44456f03","resolution":{"observed_at":"2026-08-07T12:08:58.885758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13854","last_updated":"2024-04-16T15:13:18Z","snapshot_observed_at":"2026-08-06T12:47:01.809185Z","submitted_at":"2023-07-25T22:59:32Z","title":"WebArena: A Realistic Web Environment for Building Autonomous Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13854","snapshot_observed_at":"2026-08-07T12:08:59.066328Z","title":"Webarena: A realistic web environment for building autonomous agents.arXiv preprint arXiv:2307.13854, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:59.066328Z"},"links":{"cited_paper":"/paper/2307.13854","citing_paper":"/paper/2506.00539"},"observation_digest":"sha256:dbc3901aa956ed5bcec7c68bc9f6889cee099c1150ee1b2b8fc57ae280f997d5","observation_id":"c161d582-e1ed-4dfe-80a8-3d1af98e887f","resolution":{"observed_at":"2026-08-07T12:08:59.066328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.07540","last_updated":"2022-11-14T17:52:27Z","snapshot_observed_at":"2026-08-06T07:25:42.562786Z","submitted_at":"2022-03-14T22:52:34Z","title":"ScienceWorld: Is your Agent Smarter than a 5th Grader?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.07540","snapshot_observed_at":"2026-08-07T12:08:59.239397Z","title":"Scienceworld: Is your agent smarter than a 5th grader?arXiv preprint arXiv:2203.07540, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:59.239397Z"},"links":{"cited_paper":"/paper/2203.07540","citing_paper":"/paper/2506.00539"},"observation_digest":"sha256:43eb39e67e4890ba67c96e29b113cad727cd687bb3e3601300762f0fd8647b5f","observation_id":"8b3b0c7d-8cac-47ed-820c-658eff6bda9e","resolution":{"observed_at":"2026-08-07T12:08:59.239397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05733","last_updated":"2024-02-08T15:08:57Z","snapshot_observed_at":"2026-08-07T22:45:03.366691Z","submitted_at":"2024-02-08T15:08:57Z","title":"TimeArena: Shaping Efficient Multitasking Language Agents in a Time-Aware Simulation","version":1},"cited_work":{"arxiv_id":"2402.05733","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.05733","snapshot_observed_at":"2026-08-07T12:09:04.978044Z","title":"TimeArena: Shaping Efficient Multitasking Language Agents in a Time-Aware Simulation","venue":"cs.CL","work_id":"451b83a7-6d71-47d5-8db5-c02a319d2ab9","year":2024},"citing_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:59.403455Z"},"links":{"cited_paper":"/paper/2402.05733","citing_paper":"/paper/2506.00539"},"observation_digest":"sha256:d989b0089246ad75f3115e58b1da810d00c98528d750dcbe041426fb6b0ace7a","observation_id":"5cbe73be-554d-47b1-a061-01188b55cced","resolution":{"observed_at":"2026-08-07T12:09:05.090357Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18232","last_updated":"2023-11-30T03:59:31Z","snapshot_observed_at":"2026-08-07T02:51:02.413859Z","submitted_at":"2023-11-30T03:59:31Z","title":"LMRL Gym: Benchmarks for Multi-Turn Reinforcement Learning with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18232","snapshot_observed_at":"2026-08-07T12:08:59.541246Z","title":"Lmrl gym: Benchmarks for multi-turn reinforcement learning with language models.arXiv preprint arXiv:2311.18232, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:59.541246Z"},"links":{"cited_paper":"/paper/2311.18232","citing_paper":"/paper/2506.00539"},"observation_digest":"sha256:d6f6e6a2c763beab8971a9b371449dcf45e8b8cfe8420e2338c8e7dbb95c2fbd","observation_id":"a042abfe-c539-4c27-a6c1-e58591cbdc71","resolution":{"observed_at":"2026-08-07T12:08:59.541246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:59.754365Z","title":"Evaluating language model agency through negotiations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:59.754365Z"},"links":{"citing_paper":"/paper/2506.00539"},"observation_digest":"sha256:8a07611cd676ed026d7d2faceedd3e1fc6b3ff0b4004d951dcd9290c22d46fd1","observation_id":"b75ecb96-8246-4666-9bf4-f38c158d1f4f","resolution":{"observed_at":"2026-08-07T12:08:59.754365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05863","last_updated":"2024-02-08T17:51:48Z","snapshot_observed_at":"2026-08-06T14:14:36.632646Z","submitted_at":"2024-02-08T17:51:48Z","title":"How Well Can LLMs Negotiate? NegotiationArena Platform and Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05863","snapshot_observed_at":"2026-08-07T12:08:59.948196Z","title":"How well can llms negotiate? negotiationarena platform and analysis.arXiv preprint arXiv:2402.05863, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:59.948196Z"},"links":{"cited_paper":"/paper/2402.05863","citing_paper":"/paper/2506.00539"},"observation_digest":"sha256:da1fbe32504eec2991fba4bb6eba7a6025a5bc7471642253ed5c413f7d39a680","observation_id":"ad64771c-0f22-46dd-96ec-5627d4093b27","resolution":{"observed_at":"2026-08-07T12:08:59.948196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10134","last_updated":"2023-10-16T07:17:27Z","snapshot_observed_at":"2026-08-08T09:46:51.637697Z","submitted_at":"2023-10-16T07:17:27Z","title":"CLIN: A Continually Learning Language Agent for Rapid Task Adaptation and Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10134","snapshot_observed_at":"2026-08-07T12:09:00.107183Z","title":"Clin: A continually learning language agent for rapid task adaptation and generalization.arXiv preprint arXiv:2310.10134, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:00.107183Z"},"links":{"cited_paper":"/paper/2310.10134","citing_paper":"/paper/2506.00539"},"observation_digest":"sha256:19ec5c58c828b72a9e5859070afc47792adfc09f56cd9532abfd552a6a0f39c1","observation_id":"46b68e55-dc53-4d56-9ebf-81317dd519d4","resolution":{"observed_at":"2026-08-07T12:09:00.107183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02502","last_updated":"2024-07-10T17:36:25Z","snapshot_observed_at":"2026-08-07T22:37:26.229203Z","submitted_at":"2024-03-04T21:50:29Z","title":"Trial and Error: Exploration-Based Trajectory Optimization for LLM Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02502","snapshot_observed_at":"2026-08-07T12:09:00.264859Z","title":"Trial and error: Exploration-based trajectory optimization for llm agents.arXiv preprint arXiv:2403.02502, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:00.264859Z"},"links":{"cited_paper":"/paper/2403.02502","citing_paper":"/paper/2506.00539"},"observation_digest":"sha256:b23a7a15eb4aab8a895bed234c033be7269fafa086ff5896e96a53b45c14c6aa","observation_id":"4a26fead-1325-49cd-8a15-53c0823dec83","resolution":{"observed_at":"2026-08-07T12:09:00.264859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11176","last_updated":"2024-09-24T10:01:31Z","snapshot_observed_at":"2026-08-01T17:35:58.677762Z","submitted_at":"2024-06-17T03:29:13Z","title":"Watch Every Step! LLM Agent Learning via Iterative Step-Level Process Refinement","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11176","snapshot_observed_at":"2026-08-07T12:09:00.382912Z","title":"Watch every step! llm agent learning via iterative step-level process refinement.arXiv preprint arXiv:2406.11176, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:00.382912Z"},"links":{"cited_paper":"/paper/2406.11176","citing_paper":"/paper/2506.00539"},"observation_digest":"sha256:60aa9089ba18db268ce77e7995b9755a9faba9dfb8ce4b11c1439f49ae837c13","observation_id":"b0282fc0-9feb-4ac3-a30a-0f6c441ec3e6","resolution":{"observed_at":"2026-08-07T12:09:00.382912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.07199","last_updated":"2024-08-13T20:52:13Z","snapshot_observed_at":"2026-08-01T22:07:45.419539Z","submitted_at":"2024-08-13T20:52:13Z","title":"Agent Q: Advanced Reasoning and Learning for Autonomous AI Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.07199","snapshot_observed_at":"2026-08-07T12:09:00.454738Z","title":"Agent q: Advanced reasoning and learning for autonomous ai agents.arXiv preprint arXiv:2408.07199, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:00.454738Z"},"links":{"cited_paper":"/paper/2408.07199","citing_paper":"/paper/2506.00539"},"observation_digest":"sha256:e1eee0a5a42f18e062de80de8297f8e1386e2bf6ce11b76bda1d4f1f190f8937","observation_id":"64dda7ae-cab9-4447-b0e6-144f1c6b5289","resolution":{"observed_at":"2026-08-07T12:09:00.454738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:08.494766Z","title":"Selfgoal: Your language agents already know how to achieve high-level goals","venue":null,"work_id":"eeaad946-365e-4737-b6d0-f62adb3ccaca","year":2025},"citing_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:00.548686Z"},"links":{"citing_paper":"/paper/2506.00539"},"observation_digest":"sha256:53cab84ec23b9ed6727cd21b6fba9922c244807885ac6c6a9ce5969a918e3408","observation_id":"acfa2ab7-d82e-4c26-a9d1-1892540ca541","resolution":{"observed_at":"2026-08-07T12:09:08.621937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.03768","last_updated":"2021-03-14T22:44:38Z","snapshot_observed_at":"2026-08-08T17:40:47.037804Z","submitted_at":"2020-10-08T05:13:36Z","title":"ALFWorld: Aligning Text and Embodied Environments for Interactive Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.03768","snapshot_observed_at":"2026-08-07T12:09:00.612952Z","title":"Alfworld: Aligning text and embodied environments for interactive learning.arXiv preprint arXiv:2010.03768, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:00.612952Z"},"links":{"cited_paper":"/paper/2010.03768","citing_paper":"/paper/2506.00539"},"observation_digest":"sha256:e19f0b55c05e39af8912a59d594f5d182006453219e8377282a964baf236043d","observation_id":"60fadc7d-c7a7-4280-a143-c016ad995460","resolution":{"observed_at":"2026-08-07T12:09:00.612952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:00.701429Z","title":"Webshop: Towards scalable real-world web interaction with grounded language agents, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:00.701429Z"},"links":{"citing_paper":"/paper/2506.00539"},"observation_digest":"sha256:2238bfd3518d6da00e3f1210c390813ba730c317d9bb67ab4e8ffb82aea8d253","observation_id":"f8f102a7-b5ef-4855-98d4-bbc843c64d73","resolution":{"observed_at":"2026-08-07T12:09:00.701429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.05125","last_updated":"2017-06-16T01:26:09Z","snapshot_observed_at":"2026-07-06T05:47:06.697057Z","submitted_at":"2017-06-16T01:26:09Z","title":"Deal or No Deal? End-to-End Learning for Negotiation Dialogues","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.05125","snapshot_observed_at":"2026-08-07T12:09:00.787910Z","title":"Deal or no deal? end-to-end learning for negotiation dialogues.arXiv preprint arXiv:1706.05125, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:00.787910Z"},"links":{"cited_paper":"/paper/1706.05125","citing_paper":"/paper/2506.00539"},"observation_digest":"sha256:13ac04cd39d00494e55dc1d8725258a5ef1e4c1a17540cd1fdcb7eac70927aec","observation_id":"8385a51d-7781-4cde-b779-bdf200c5f991","resolution":{"observed_at":"2026-08-07T12:09:00.787910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:00.857814Z","title":"Glee: A unified framework and benchmark for language-based economic environments.arXiv preprint arXiv:2410.05254, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:00.857814Z"},"links":{"citing_paper":"/paper/2506.00539"},"observation_digest":"sha256:570bf39fd21193885d92423ec9c59e73041e42f7fb6afa63ac0001d009c85038","observation_id":"05755954-fad1-44ff-9e02-6556f7349060","resolution":{"observed_at":"2026-08-07T12:09:00.857814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19446","last_updated":"2024-02-29T18:45:56Z","snapshot_observed_at":"2026-08-07T22:12:46.006835Z","submitted_at":"2024-02-29T18:45:56Z","title":"ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19446","snapshot_observed_at":"2026-08-07T12:09:00.985006Z","title":"Archer: Training language model agents via hierarchical multi-turn rl.arXiv preprint arXiv:2402.19446, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:00.985006Z"},"links":{"cited_paper":"/paper/2402.19446","citing_paper":"/paper/2506.00539"},"observation_digest":"sha256:c8d85068d854679dfde8dd43c04e7f03d4782f5d20881eaeffde9f5cb1a1e804","observation_id":"b389c14e-e26e-4d02-9c71-a9b0eadee153","resolution":{"observed_at":"2026-08-07T12:09:00.985006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15478","last_updated":"2025-03-19T17:55:08Z","snapshot_observed_at":"2026-08-08T21:39:18.091217Z","submitted_at":"2025-03-19T17:55:08Z","title":"SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15478","snapshot_observed_at":"2026-08-07T12:09:01.135410Z","title":"Sweet-rl: Training multi-turn llm agents on collaborative reasoning tasks.arXiv preprint arXiv:2503.15478, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:01.135410Z"},"links":{"cited_paper":"/paper/2503.15478","citing_paper":"/paper/2506.00539"},"observation_digest":"sha256:baca21a23b80db70863397a5c62ae9b7c05c77b722ad67a866e125c7830895b0","observation_id":"125d7087-241d-4a98-9ab3-b3ac2c9313c8","resolution":{"observed_at":"2026-08-07T12:09:01.135410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T12:09:01.250499Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:01.250499Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.00539"},"observation_digest":"sha256:73274e3ddba690de8d14fa9d61a2b208510a9fbe3837d97978e150b654c6d54f","observation_id":"7b7ff850-89b1-49fd-98db-56015d0e1fab","resolution":{"observed_at":"2026-08-07T12:09:01.250499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:01.348373Z","title":"Williams","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:01.348373Z"},"links":{"citing_paper":"/paper/2506.00539"},"observation_digest":"sha256:05953c45d003fab9a508148a13540eba0a08516ebf3a5328367979100ca51571","observation_id":"11531a67-1dfa-4331-ad07-68535afe723d","resolution":{"observed_at":"2026-08-07T12:09:01.348373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:01.453841Z","title":"Hierarchical grouping to optimize an objective function.Journal of the American statistical association, 58(301):236–244, 1963","venue":null,"work_id":null,"year":1963},"citing_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:01.453841Z"},"links":{"citing_paper":"/paper/2506.00539"},"observation_digest":"sha256:8bbb5757576dc4cdb1c34a21eeb733dbcd934b074c2eba98629626e0971fb1b3","observation_id":"2f549245-1f64-40f6-a229-01c395381c2a","resolution":{"observed_at":"2026-08-07T12:09:01.453841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11667","last_updated":"2024-03-22T18:52:15Z","snapshot_observed_at":"2026-08-01T04:15:49.179138Z","submitted_at":"2023-10-18T02:27:01Z","title":"SOTOPIA: Interactive Evaluation for Social Intelligence in Language Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11667","snapshot_observed_at":"2026-08-07T12:09:01.633394Z","title":"Sotopia: Interactive evaluation for social intelligence in language agents.arXiv preprint arXiv:2310.11667, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:01.633394Z"},"links":{"cited_paper":"/paper/2310.11667","citing_paper":"/paper/2506.00539"},"observation_digest":"sha256:e8c4e07600cfb211adf54cbc3b52736f88f32a986c02732d87499105f81c9a28","observation_id":"23c052aa-133b-453d-be09-6464489841e1","resolution":{"observed_at":"2026-08-07T12:09:01.633394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14225","last_updated":"2025-03-13T03:55:17Z","snapshot_observed_at":"2026-07-06T20:25:22.313860Z","submitted_at":"2025-01-24T04:09:03Z","title":"Multi-agent KTO: Reinforcing Strategic Interactions of Large Language Model in Language Game","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14225","snapshot_observed_at":"2026-08-07T12:09:01.819815Z","title":"Multi- agent kto: Reinforcing strategic interactions of large language model in language game.arXiv preprint arXiv:2501.14225, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:01.819815Z"},"links":{"cited_paper":"/paper/2501.14225","citing_paper":"/paper/2506.00539"},"observation_digest":"sha256:c5a3cf5fea1096fe3609edca543273a65ee5e6ebdbe78969705107c8e1319969","observation_id":"29b6e2d0-369f-4eb5-a5e5-42983e1c28e9","resolution":{"observed_at":"2026-08-07T12:09:01.819815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05036","last_updated":"2023-11-08T16:01:32Z","snapshot_observed_at":"2026-08-09T04:13:06.233233Z","submitted_at":"2023-10-08T06:37:08Z","title":"AvalonBench: Evaluating LLMs Playing the Game of Avalon","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05036","snapshot_observed_at":"2026-08-07T12:09:02.061227Z","title":"Avalonbench: Evaluating llms playing the game of avalon.arXiv preprint arXiv:2310.05036, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:02.061227Z"},"links":{"cited_paper":"/paper/2310.05036","citing_paper":"/paper/2506.00539"},"observation_digest":"sha256:b80550b5f4493a3f4cc5581c51e7fcd7134128665e0158f9414ad9e4fe1ac552","observation_id":"f7e1c9e0-5ab3-441d-a0f4-7b0c98d53ea7","resolution":{"observed_at":"2026-08-07T12:09:02.061227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:08.228579Z","title":"Self-playing adversarial language game enhances llm reasoning.Advances in Neural Information Processing Systems, 37:126515–126543, 2024","venue":null,"work_id":"696991ee-f96b-4767-95b1-7668ca07df49","year":2024},"citing_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:02.194205Z"},"links":{"citing_paper":"/paper/2506.00539"},"observation_digest":"sha256:e7d2a270abc18d4a52f772176e6ac59bd61f681a0ad814453f948ea319642fdc","observation_id":"d2858b76-b913-4b2c-b2fd-2b24a6e29b11","resolution":{"observed_at":"2026-08-07T12:09:08.356809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10032","last_updated":"2023-08-19T14:33:40Z","snapshot_observed_at":"2026-07-06T16:08:00.845026Z","submitted_at":"2023-08-19T14:33:40Z","title":"GameEval: Evaluating LLMs on Conversational Games","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.10032","snapshot_observed_at":"2026-08-07T12:09:02.360560Z","title":"Gameeval: Evaluating llms on conversational games.arXiv preprint arXiv:2308.10032, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:02.360560Z"},"links":{"cited_paper":"/paper/2308.10032","citing_paper":"/paper/2506.00539"},"observation_digest":"sha256:2e24060adebe5184a20630a591e9dd0694d676ad629a8a56c4aac8fa4a38e349","observation_id":"bbd1ebb1-33ab-4190-9d6e-d788077e060c","resolution":{"observed_at":"2026-08-07T12:09:02.360560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:02.463723Z","title":"Least squares quantization in pcm.IEEE transactions on information theory, 28(2):129–137, 1982","venue":null,"work_id":null,"year":1982},"citing_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:02.463723Z"},"links":{"citing_paper":"/paper/2506.00539"},"observation_digest":"sha256:e8c1e9ed51bec84f76728824be297f05c93cf87cab058002632c56a8afc28415","observation_id":"0c288d72-2f51-4edd-9cb1-e6f6d4a8f2c4","resolution":{"observed_at":"2026-08-07T12:09:02.463723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:08.015553Z","title":"A density-based algorithm for discovering clusters in large spatial databases with noise","venue":null,"work_id":"0bfcf726-0a8c-4613-aa44-1e34f7bcee9e","year":1996},"citing_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:02.575342Z"},"links":{"citing_paper":"/paper/2506.00539"},"observation_digest":"sha256:de0bd71c3706fe76cca6d8f2d64f71090e75ba5dda8969f111fe7ce7e3ffadf8","observation_id":"bb4b8319-ba75-4af0-8f3e-c49a25c75d6b","resolution":{"observed_at":"2026-08-07T12:09:08.105891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12119","last_updated":"2026-05-29T11:31:58Z","snapshot_observed_at":"2026-08-07T18:11:25.128924Z","submitted_at":"2025-02-17T18:43:41Z","title":"PRISM: Self-Pruning Intrinsic Selection Method for Training-Free Multimodal Data Selection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12119","snapshot_observed_at":"2026-08-07T12:09:02.673624Z","title":"Prism: Self-pruning intrinsic selection method for training-free multimodal data selection.arXiv preprint arXiv:2502.12119, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:02.673624Z"},"links":{"cited_paper":"/paper/2502.12119","citing_paper":"/paper/2506.00539"},"observation_digest":"sha256:497e552b7b53fabda941ae8c2ed411d0885c232d3c94988eaa0f36f1b9b6e721","observation_id":"dc0febd7-dfd3-4257-b303-d6d35b337bc1","resolution":{"observed_at":"2026-08-07T12:09:02.673624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:02.783375Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:02.783375Z"},"links":{"citing_paper":"/paper/2506.00539"},"observation_digest":"sha256:39ba13f635d53d39e6991a31b51976decbeee9ee06f350eb298fdba8647552d5","observation_id":"5d6ad255-2e81-4393-a49a-7658872f2539","resolution":{"observed_at":"2026-08-07T12:09:02.783375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-08-07T12:09:02.856184Z","title":"Kto: Model alignment as prospect theoretic optimization.arXiv preprint arXiv:2402.01306, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:02.856184Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2506.00539"},"observation_digest":"sha256:f17bd968a1ea7506edbd50a28a8795562147c47e85628c053b4015bc7facacc8","observation_id":"25cb6302-961a-4c3d-8c72-d1278b151cd9","resolution":{"observed_at":"2026-08-07T12:09:02.856184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T12:09:02.951993Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:02.951993Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.00539"},"observation_digest":"sha256:5de298e43f52615c4e818a121d259b85ae8fcdd7f10f1d6e1fcb95809ad89aef","observation_id":"6833c2ab-c860-44eb-bb1d-7b5757caf38d","resolution":{"observed_at":"2026-08-07T12:09:02.951993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13408","last_updated":"2025-05-19T17:44:26Z","snapshot_observed_at":"2026-08-07T15:43:00.197948Z","submitted_at":"2025-05-19T17:44:26Z","title":"CoT-Kinetics: A Theoretical Modeling Assessing LRM Reasoning Process","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13408","snapshot_observed_at":"2026-08-07T12:09:03.054149Z","title":"Cot-kinetics: A theoretical modeling assessing lrm reasoning process.arXiv preprint arXiv:2505.13408, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:03.054149Z"},"links":{"cited_paper":"/paper/2505.13408","citing_paper":"/paper/2506.00539"},"observation_digest":"sha256:192c1df1ed8427b0767c020b9b31885138d6587d73eba0a0a20bf80ff703bcf4","observation_id":"c1d10df5-5527-4490-9578-e69f4bc0dc85","resolution":{"observed_at":"2026-08-07T12:09:03.054149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1105.0121","last_updated":"2011-04-30T21:29:08Z","snapshot_observed_at":"2026-08-01T23:49:15.218586Z","submitted_at":"2011-04-30T21:29:08Z","title":"Methods of Hierarchical Clustering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1105.0121","snapshot_observed_at":"2026-08-07T12:09:03.131933Z","title":"Methods of hierarchical clustering.arXiv preprint arXiv:1105.0121, 2011","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:03.131933Z"},"links":{"cited_paper":"/paper/1105.0121","citing_paper":"/paper/2506.00539"},"observation_digest":"sha256:84aaadf8c5ce5815e25754f71c44f3dec146108f7c2a06f1d275f295095cf071","observation_id":"d1674156-629d-4af9-9f73-e7dcc6888ff6","resolution":{"observed_at":"2026-08-07T12:09:03.131933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:03.225444Z","title":"Silhouettes: a graphical aid to the interpretation and validation of cluster analysis.Journal of computational and applied mathematics, 20:53–65, 1987","venue":null,"work_id":null,"year":1987},"citing_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:03.225444Z"},"links":{"citing_paper":"/paper/2506.00539"},"observation_digest":"sha256:5b09c9a94c539994b5ec1296cc6e6133fd070d8c23e90cbfcac362384abdfb9c","observation_id":"00333b33-ec03-47de-b745-e3d1bd363535","resolution":{"observed_at":"2026-08-07T12:09:03.225444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:03.304018Z","title":"A dendrite method for cluster analysis.Communications in Statistics-theory and Methods, 3(1):1–27, 1974","venue":null,"work_id":null,"year":1974},"citing_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:03.304018Z"},"links":{"citing_paper":"/paper/2506.00539"},"observation_digest":"sha256:a0b18810a82369312a8b12a0f9e90d62ebfac109dce8fea774fc6ac4be84982f","observation_id":"aa50cd92-6e53-479a-ae57-4bd157a20113","resolution":{"observed_at":"2026-08-07T12:09:03.304018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:07.712755Z","title":"A cluster separation measure.IEEE transactions on pattern analysis and machine intelligence, (2):224–227, 2009","venue":null,"work_id":"0eb61ce9-1dc7-49a9-bc86-2da299d0a098","year":2009},"citing_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:03.440574Z"},"links":{"citing_paper":"/paper/2506.00539"},"observation_digest":"sha256:37df57b2ded51d5af79e7a7ffb9b6fd59304f953971214d8ab76b90bf73c6a03","observation_id":"bca82fdc-9a2f-471e-bf1b-6e772530ab90","resolution":{"observed_at":"2026-08-07T12:09:07.852623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:07.469391Z","title":null,"venue":null,"work_id":"ab1c32e3-96a6-4b34-a8aa-98058278e485","year":1906},"citing_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:03.516997Z"},"links":{"citing_paper":"/paper/2506.00539"},"observation_digest":"sha256:ef699606830e51f2fb3a36207812ba486a988ce4067079fb52384109861c8783","observation_id":"3285c6a9-3962-4f20-a7e0-e68f3db952a8","resolution":{"observed_at":"2026-08-07T12:09:07.565203Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:07.197776Z","title":"Training agents by reinforcing reasoning, 2025","venue":null,"work_id":"52c19ea0-59a6-478f-8f30-79abefda1944","year":2025},"citing_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:03.619683Z"},"links":{"citing_paper":"/paper/2506.00539"},"observation_digest":"sha256:5bdc9d8674cdfbb4ce1591ee8cdf02b01d5a0f412685c81ce36e345d57f0d679","observation_id":"3cee0ba5-e240-456c-a8e8-3aaa2c5bf7a5","resolution":{"observed_at":"2026-08-07T12:09:07.345382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:06.898489Z","title":"Glee: A unified framework and benchmark for language-based economic environments, 2024","venue":null,"work_id":"c2c1f557-1994-4a91-9796-9ef6c3b6d39d","year":2024},"citing_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:03.705946Z"},"links":{"citing_paper":"/paper/2506.00539"},"observation_digest":"sha256:1dadcd25e9b57edf666a930a46692fdd194850df681e708d43ab52c301f53919","observation_id":"f040559d-b41b-48ae-92a5-ffc0336ca356","resolution":{"observed_at":"2026-08-07T12:09:07.099292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:06.782895Z","title":"Llama 3 model card","venue":null,"work_id":"148c1053-2a3d-4e9a-8797-742f4ab0f5f0","year":2024},"citing_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:03.782318Z"},"links":{"citing_paper":"/paper/2506.00539"},"observation_digest":"sha256:2e2560b409cac67348efd783842f49e1ef3debdf86e3c7a7dc4dc9cebcf9d59f","observation_id":"3865c1e6-fa12-4026-a4bd-f08b25df12c6","resolution":{"observed_at":"2026-08-07T12:09:06.818197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:03.880519Z","title":"Text and code embeddings by contrastive pre-training, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:03.880519Z"},"links":{"citing_paper":"/paper/2506.00539"},"observation_digest":"sha256:b1534da1c73dcb7c856eeb84b7edf1f0a661523484933e170daa564c2aa3309d","observation_id":"459696a0-c5ae-4e1e-9e10-1c9e624a0749","resolution":{"observed_at":"2026-08-07T12:09:03.880519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:04.011359Z","title":"Gpt-4 technical report, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:04.011359Z"},"links":{"citing_paper":"/paper/2506.00539"},"observation_digest":"sha256:64f7eb238a334d2509821e3051bf248a72d7a9025ce3ef3bc7dea3756196081a","observation_id":"2ee2879c-ef7a-4d54-9b9e-abc74446ea9f","resolution":{"observed_at":"2026-08-07T12:09:04.011359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:06.518887Z","title":"Introducing claude 2.1, Nov 2023","venue":null,"work_id":"4c29e755-93df-42c9-a62a-d84672a67adf","year":2023},"citing_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:04.104372Z"},"links":{"citing_paper":"/paper/2506.00539"},"observation_digest":"sha256:b73122bedb9d5dfdcb0e0017d8a589ca9d91fc21f8fd6f377c9abeef774a7b06","observation_id":"aae6b85f-644d-4cc7-a598-cc367b24b11c","resolution":{"observed_at":"2026-08-07T12:09:06.679584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:06.137825Z","title":"Zhang, Han Bao, Hanwei Xu, Haocheng Wang, Haowei Zhang, Honghui Ding, Huajian Xin, Huazuo Gao, Hui Li, Hui Qu, J","venue":null,"work_id":"5967e3d2-7138-4655-b660-600917a05d51","year":2025},"citing_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:04.178352Z"},"links":{"citing_paper":"/paper/2506.00539"},"observation_digest":"sha256:4d312ddb7fb59fec4fb30dbf8c4d23884e9758411937310e8a96f903f7f56026","observation_id":"869581f2-df74-4623-807b-0e43b3fb49e7","resolution":{"observed_at":"2026-08-07T12:09:06.305099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:05.765813Z","title":"Qwen2.5: A party of foundation models, September 2024","venue":null,"work_id":"d259830c-7f29-46ea-810e-4135bf2efab9","year":2024},"citing_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:04.271744Z"},"links":{"citing_paper":"/paper/2506.00539"},"observation_digest":"sha256:b3d2249a21cf00e650542c732dc6897172a6c384c17e8456e454790465888f57","observation_id":"7612ea95-a64f-4ab3-8ca7-c8bef3c4fd24","resolution":{"observed_at":"2026-08-07T12:09:05.910016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:05.516331Z","title":null,"venue":null,"work_id":"a47e1b04-61ae-4416-903c-46a5066f3ade","year":null},"citing_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:04.344497Z"},"links":{"citing_paper":"/paper/2506.00539"},"observation_digest":"sha256:935e0278027daf1a1024fb4d86a323ee6d293255a46e8d1365cf61a8202b6f8a","observation_id":"91bc5c2e-1b1a-40d5-9ef2-e5bd3ba6696e","resolution":{"observed_at":"2026-08-07T12:09:05.625633Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:05.263334Z","title":null,"venue":null,"work_id":"6a316cf0-7251-4932-91c0-a9cf5aa0904b","year":null},"citing_paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:04.438910Z"},"links":{"citing_paper":"/paper/2506.00539"},"observation_digest":"sha256:0ad49dd393b8e34ab6f3f5d900837dd0a3fc2c8c639f6bde94039263137ab23a","observation_id":"fddb8384-c1c3-43e1-8a42-afdff67bd4ba","resolution":{"observed_at":"2026-08-07T12:09:05.376816Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.00539","last_updated":"2025-06-04T13:39:54Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T09:04:37.435563Z","submitted_at":"2025-05-31T12:54:49Z","title":"ARIA: Training Language Agents with Intention-Driven Reward Aggregation"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":1,"verified_fuzzy":10},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 2 inbound Pith citation observations for arXiv:2506.00539."}