{"as_of":"2026-08-22T02:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ecb31b6f996611654bcc785f28fb009b36ff75c06838e56eb72e2e8a26ad9cef","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T09:45:49.665576Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.16257/citation-record","integrity":"/paper/2607.16257/integrity","json":"/paper/2607.16257/citation-record.json","paper":"/paper/2607.16257"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.03262","last_updated":"2025-11-10T15:11:13Z","snapshot_observed_at":"2026-08-16T04:57:30.418363Z","submitted_at":"2025-01-04T02:08:06Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03262","snapshot_observed_at":"2026-08-02T09:45:49.543804Z","title":"K., Xu, H., and Shen, W","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-09T16:36:39.554256Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.543804Z"},"links":{"cited_paper":"/paper/2501.03262","citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:34919abf9203b0098e8440eb72a3f326e707544220c5b4e6e32a5850dc1ab016","observation_id":"f114d361-add9-4ea6-a055-b6a0b6bc87b7","resolution":{"observed_at":"2026-08-02T09:45:49.543804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02039","last_updated":"2026-06-08T03:25:04Z","snapshot_observed_at":"2026-08-17T22:16:47.791161Z","submitted_at":"2024-04-02T15:34:18Z","title":"A Survey on Large Language Model-Based Game Agents","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02039","snapshot_observed_at":"2026-08-02T09:45:49.548413Z","title":"R., Ilhan, F., Tekin, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-09T16:36:39.554256Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.548413Z"},"links":{"cited_paper":"/paper/2404.02039","citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:5f3a33479765bc6e3818a62093eb259171fdd85457091159e22b8ed3f83a001d","observation_id":"d96548a6-2f08-45e0-a554-333d234194e3","resolution":{"observed_at":"2026-08-02T09:45:49.548413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-08-19T11:46:55.171293Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-02T09:45:49.552902Z","title":"Openai o1 system card.arXiv preprint arXiv:2412.16720,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-09T16:36:39.554256Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.552902Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:11d7adaad84d58045f6c425d6acaf341e2766d3845840e22f6e550e6cd332131","observation_id":"6a7d3ae8-eeaf-4855-958e-11c89f6d6b4b","resolution":{"observed_at":"2026-08-02T09:45:49.552902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-08-15T13:17:00.526689Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-02T09:45:49.557487Z","title":"Search-r1: Training llms to reason and leverage search engines with reinforcement learning.arXiv preprint arXiv:2503.09516,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-09T16:36:39.554256Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.557487Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:06a5350b3fa3b574eaa7a29ed79d02a7d6d675c37cb783f0c908a33bcc3f34b9","observation_id":"ba5d6b48-4691-4b86-99e8-66df3c35fabb","resolution":{"observed_at":"2026-08-02T09:45:49.557487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.03551","last_updated":"2017-05-13T21:12:37Z","snapshot_observed_at":"2026-08-13T08:58:47.096400Z","submitted_at":"2017-05-09T21:35:07Z","title":"TriviaQA: A Large Scale Distantly Supervised Challenge Dataset for Reading Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.03551","snapshot_observed_at":"2026-08-02T09:45:49.562419Z","title":"S., and Zettlemoyer, L","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-09T16:36:39.554256Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.562419Z"},"links":{"cited_paper":"/paper/1705.03551","citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:173c8da2450120b43a6984ea216bf15a6b39f009f2aa3ef6c0338d83ed52cfdb","observation_id":"20f932c5-e23c-4d12-bf13-d43e33f49ba3","resolution":{"observed_at":"2026-08-02T09:45:49.562419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10458","last_updated":"2025-10-01T04:55:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:45:54Z","title":"GUI-R1 : A Generalist R1-Style Vision-Language Action Model For GUI Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10458","snapshot_observed_at":"2026-08-02T09:45:49.571527Z","title":"Gui- r1: A generalist r1-style vision-language action model for gui agents.arXiv preprint arXiv:2504.10458,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-09T16:36:39.554256Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.571527Z"},"links":{"cited_paper":"/paper/2504.10458","citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:4d44d8ebd2bb347d3d11de228af35ca8000b523f6bcb8c1c8410b4369c85f70a","observation_id":"9d567aa5-be18-4a84-afc7-17334a4ea033","resolution":{"observed_at":"2026-08-02T09:45:49.571527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11027","last_updated":"2026-05-25T11:34:07Z","snapshot_observed_at":"2026-08-15T19:32:23.225542Z","submitted_at":"2025-05-20T11:28:48Z","title":"From Reasoning to Code: GRPO Optimization for Underrepresented Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11027","snapshot_observed_at":"2026-08-02T09:45:49.579989Z","title":"From reasoning to code: Grpo opti- mization for underrepresented languages.arXiv preprint arXiv:2506.11027,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-09T16:36:39.554256Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.579989Z"},"links":{"cited_paper":"/paper/2506.11027","citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:c3c950fe120eb083d1cac1b5fa14b896fe977173c222c7c42fa09dc05007861f","observation_id":"d8072b01-5ff9-4ae2-b0f2-9a7d00c28c66","resolution":{"observed_at":"2026-08-02T09:45:49.579989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:45:49.584554Z","title":"Adapt: As-needed decompo- sition and planning with language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-09T16:36:39.554256Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.584554Z"},"links":{"citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:ab96292643693e993ddfbb81a67ce044d7562d9866c67b265c8218c5378782ad","observation_id":"4055e064-4f29-42cc-b94e-449dfbbec35f","resolution":{"observed_at":"2026-08-02T09:45:49.584554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:45:49.588777Z","title":"A., and Lewis, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-09T16:36:39.554256Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.588777Z"},"links":{"citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:45e9a9a601aa40274b588cd5a2c4c0ccf356c5ae1ad328bb27dfb3e9aa7d5f77","observation_id":"dc122ef0-c6d1-4017-8f4d-9b4c54bf670f","resolution":{"observed_at":"2026-08-02T09:45:49.588777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-02T09:45:49.593092Z","title":"Schulman, J., Wolski, F., Dhariwal, P., Radford, A., and Klimov, O","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-09T16:36:39.554256Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.593092Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:0dd925bb305be26c86decb167c25ac973c1fd903886dbaaf6fb3c469f0baf706","observation_id":"be1a788c-6562-43b2-89f4-218ee59d5c37","resolution":{"observed_at":"2026-08-02T09:45:49.593092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-02T09:45:49.597133Z","title":"Deepseekmath: Push- ing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-09T16:36:39.554256Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.597133Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:1ad8b4161505dd48e138184f94024fe5805852c87e15452fe06b32e216561912","observation_id":"313da221-8f45-4d14-b924-9fa21835b6d6","resolution":{"observed_at":"2026-08-02T09:45:49.597133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04588","last_updated":"2026-05-19T11:51:42Z","snapshot_observed_at":"2026-08-04T18:36:41.979541Z","submitted_at":"2025-05-07T17:30:22Z","title":"ZeroSearch: Incentivize the Search Capability of LLMs without Searching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04588","snapshot_observed_at":"2026-08-02T09:45:49.601208Z","title":"Zerosearch: In- centivize the search capability of llms without searching","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-09T16:36:39.554256Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.601208Z"},"links":{"cited_paper":"/paper/2505.04588","citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:1344587a3a8d0d243a75f91b4a9c30f4f593a703c39378ffb49e86d99cc7385c","observation_id":"cd6c5b9b-c9c2-421b-962b-f0f5f56503ae","resolution":{"observed_at":"2026-08-02T09:45:49.601208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:45:49.613518Z","title":"Simpletir: End-to-end reinforcement learning for multi-turn tool-integrated reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-09T16:36:39.554256Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.613518Z"},"links":{"citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:87239d3edcdab4678735e4e41bd7b39bce32a84ac917e4daefbd80805805b09e","observation_id":"201aacc8-872c-42c7-9d8e-6006877df8f3","resolution":{"observed_at":"2026-08-02T09:45:49.613518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:45:49.617672Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-09T16:36:39.554256Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.617672Z"},"links":{"citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:0ef8013d1f3f6ea6c765cfad6f09f84ccd9c0ed5ce7502eb92cf059a4f9cdc7b","observation_id":"30bd35b0-5d8f-47b4-820b-8998ed61cd80","resolution":{"observed_at":"2026-08-02T09:45:49.617672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-02T09:45:49.621635Z","title":"The landscape of agentic reinforcement learning for llms: A survey.arXiv preprint arXiv:2509.02547,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-09T16:36:39.554256Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.621635Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:812c7be021b41ac4f1ce9863793cf24249e53e013f6c7930d69c2a859ff518b6","observation_id":"6477b146-22e0-4b29-84b7-91020de15fca","resolution":{"observed_at":"2026-08-02T09:45:49.621635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:45:49.625645Z","title":"and Zhang, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-09T16:36:39.554256Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.625645Z"},"links":{"citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:a79b531a98f84f85e458d0bb52ee79b23748d161afb31df9af0d13e88a550673","observation_id":"c25d05f8-59e8-4e7c-8b30-ae901b57b9b2","resolution":{"observed_at":"2026-08-02T09:45:49.625645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:45:49.630037Z","title":"doi: 10.18653/v1/2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-09T16:36:39.554256Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.630037Z"},"links":{"citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:3f0731108f5e8c2110e4f7acee44cc0f7ebae02d187c996f3621c154e6ca4805","observation_id":"09e75ab7-187a-4056-81d8-d5629d1447ac","resolution":{"observed_at":"2026-08-02T09:45:49.630037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:45:49.634091Z","title":"making-of","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-09T16:36:39.554256Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.634091Z"},"links":{"citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:74e93b3e60039ff321b4950ac2c63581c15ed781994f4c6b1e97ca41c4e78d7d","observation_id":"8cc84f77-a5f7-4edb-8c98-553b685facf8","resolution":{"observed_at":"2026-08-02T09:45:49.634091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:45:49.642356Z","title":"making-of","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-09T16:36:39.554256Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.642356Z"},"links":{"citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:7d27c3f0ffd51b413620d7c9a88153af7d82975697e2bd74dacb08e2860d24e8","observation_id":"db2481b3-ccec-44a0-a7b1-cc4bcf4cb9e0","resolution":{"observed_at":"2026-08-02T09:45:49.642356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:45:49.650631Z","title":"making-of","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-09T16:36:39.554256Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.650631Z"},"links":{"citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:8c8e8988124c3c84b4205c7ab715169efc27972ca9ba7f6ebee88d29472fcb81","observation_id":"4b7ed04b-be6e-4d6f-92b4-9edf4f7450f4","resolution":{"observed_at":"2026-08-02T09:45:49.650631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:45:49.658063Z","title":"making-of","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-09T16:36:39.554256Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.658063Z"},"links":{"citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:49d28a30222901ebeec86f170ebd2fc32d51d2f4bc1c034ebe2088abb580c370","observation_id":"f797b167-8465-40c4-b821-4973b3bccf4a","resolution":{"observed_at":"2026-08-02T09:45:49.658063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:45:49.661908Z","title":"Therefore, the answer is","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-09T16:36:39.554256Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.661908Z"},"links":{"citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:fbee3be44b049af2010b57c650b8853fadec6957f8a4e14613fdc88230206984","observation_id":"eb2a3f79-5d92-49af-9a5a-f1e825255ae9","resolution":{"observed_at":"2026-08-02T09:45:49.661908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:45:49.665576Z","title":"Therefore, the answer is 1982.< /think> <answer>1982< /answer> (As = +0.377) User:Congratulations! You have answered the question correctly!!! 21","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-09T16:36:39.554256Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.665576Z"},"links":{"citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:b8c09bdda57b41a6e11d6803458868f9dbf1f4d76b0c61b1a09d6489492937b7","observation_id":"d67c3502-94fd-48e4-ac78-d705b89928e7","resolution":{"observed_at":"2026-08-02T09:45:49.665576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20073","last_updated":"2025-05-26T17:19:30Z","snapshot_observed_at":"2026-08-13T08:41:26.093022Z","submitted_at":"2025-04-24T17:57:08Z","title":"RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20073","snapshot_observed_at":"2026-08-02T09:45:49.605488Z","title":"N., Liu, L., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-09T16:36:39.554256Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":2008,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.605488Z"},"links":{"cited_paper":"/paper/2504.20073","citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:8dbf34520919404fded8dc68aa22b6d21bc63ddcf17e861924bbc52a29df3f8d","observation_id":"b6a23d0b-ff2c-4156-9c67-44fa9a8e2822","resolution":{"observed_at":"2026-08-02T09:45:49.605488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.00054","last_updated":"2023-12-19T20:14:51Z","snapshot_observed_at":"2026-08-16T15:36:53.214275Z","submitted_at":"2023-04-28T19:05:16Z","title":"LAVA: Data Valuation without Pre-Specified Learning Algorithms","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.00054","snapshot_observed_at":"2026-08-02T09:45:49.567251Z","title":"A., Kang, F., Wang, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-09T16:36:39.554256Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.567251Z"},"links":{"cited_paper":"/paper/2305.00054","citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:56dd276baf213d001bec8ad3327738b87d8cdc039609fe71016e3b9fe665dc58","observation_id":"5ac0cc34-16d4-49af-b040-5518247ae594","resolution":{"observed_at":"2026-08-02T09:45:49.567251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-15T23:25:21.613036Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-08-02T09:45:49.609534Z","title":"Agentgym- rl: Training llm agents for long-horizon decision making through multi-turn reinforcement learning.arXiv preprint arXiv:2509.08755,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-09T16:36:39.554256Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.609534Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:2b2a03f47a310d978c26aaa714f39a299383e7369e54f4f4896a6caa35c3ab2d","observation_id":"763e6f28-3062-4056-96fa-b9052d9b42fb","resolution":{"observed_at":"2026-08-02T09:45:49.609534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10511","last_updated":"2023-07-02T07:21:59Z","snapshot_observed_at":"2026-07-06T14:33:08.041820Z","submitted_at":"2022-12-20T18:30:15Z","title":"When Not to Trust Language Models: Investigating Effectiveness of Parametric and Non-Parametric Memories","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10511","snapshot_observed_at":"2026-08-02T09:45:49.575726Z","title":"When not to trust language models: Investi- gating effectiveness and limitations of parametric and non- parametric memories.arXiv preprint arXiv:2212.10511, 7,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-09T16:36:39.554256Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.575726Z"},"links":{"cited_paper":"/paper/2212.10511","citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:f6b4ed766318b32b8fe1e87e49ce74cf21efe3ca296d3cb70ca81079403f68ed","observation_id":"cbbb27ec-3774-42fd-8c84-f3db1cfc6e06","resolution":{"observed_at":"2026-08-02T09:45:49.575726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-08-14T05:50:17.249446Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-08-02T09:45:49.539339Z","title":"D., Sugawara, S., and Aizawa, A","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-09T16:36:39.554256Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.539339Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:5290cb7295a86c7a9934d2da33b517855d0ad4420a61e1e9c4ab0f2f5388e979","observation_id":"a74b787b-e60c-4ba7-88e0-0eee59648c1b","resolution":{"observed_at":"2026-08-02T09:45:49.539339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05915","last_updated":"2023-10-09T17:58:38Z","snapshot_observed_at":"2026-08-21T19:23:43.679426Z","submitted_at":"2023-10-09T17:58:38Z","title":"FireAct: Toward Language Agent Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05915","snapshot_observed_at":"2026-08-02T09:45:49.534257Z","title":"Fireact: Toward language agent fine-tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-09T16:36:39.554256Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.534257Z"},"links":{"cited_paper":"/paper/2310.05915","citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:8bf53a11bca44c8daf8863e71f5454d9d0fda210694613d19e17c2cb159b864a","observation_id":"0812fa76-c88c-4290-9848-71d20c002f2b","resolution":{"observed_at":"2026-08-02T09:45:49.534257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T16:36:39.554256Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 0 inbound Pith citation observations for arXiv:2607.16257."}