{"as_of":"2026-08-09T20:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:75d53ef8046287f7055975d9969d038f1caf564941d3ae555b0e867240372f14","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T21:44:39.699017Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.27973/citation-record","integrity":"/paper/2607.27973/integrity","json":"/paper/2607.27973/citation-record.json","paper":"/paper/2607.27973"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-07-31T21:44:39.585532Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-08T00:19:31.081356Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.585532Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:d428281a0027078750c614cefa2ddb7b2b75928b7c89ed186a5014f4d19e3668","observation_id":"4b4aa3bc-6628-42d1-a393-165418b0f174","resolution":{"observed_at":"2026-07-31T21:44:39.585532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-07-31T21:44:39.588812Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-08T00:19:31.081356Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.588812Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:81f6dd61a02a4dd4c004536b53ca7aee57520c40eb477d174aa3e01cea3644d6","observation_id":"5831a163-a6c7-44db-8028-17f4af99b395","resolution":{"observed_at":"2026-07-31T21:44:39.588812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-07-31T21:44:39.592129Z","title":"Qwen2.5 technical report.ArXiv, abs/2412.15115, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-08T00:19:31.081356Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.592129Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:4b2cd7a1e3fbc87ae2a0b2e930363495bcb94038ee93b4c05fdeebb65b8c8f9b","observation_id":"b8e22867-69a9-4e42-88da-edfa1627f947","resolution":{"observed_at":"2026-07-31T21:44:39.592129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-07-31T21:44:39.595092Z","title":"Deepseek-v3 technical report.arXiv preprint arXiv:2412.19437, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-08T00:19:31.081356Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.595092Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:6fd79c08198e6cefad493a52d500d0bda48cb78e9edc27fb5c628d351b4410dd","observation_id":"a9fa85a6-9ae5-46c7-a736-b8f3626439dc","resolution":{"observed_at":"2026-07-31T21:44:39.595092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11854","last_updated":"2024-02-25T16:21:00Z","snapshot_observed_at":"2026-07-06T15:29:50.743434Z","submitted_at":"2023-05-19T17:44:34Z","title":"Multimodal Web Navigation with Instruction-Finetuned Foundation Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11854","snapshot_observed_at":"2026-07-31T21:44:39.598107Z","title":"Multimodal web navigation with instruction-finetuned foundation models.arXiv preprint arXiv:2305.11854, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-08T00:19:31.081356Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.598107Z"},"links":{"cited_paper":"/paper/2305.11854","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:528b7cff76a32c33d75df0f7600485c3d4e2b6d37c817f2903dba3d33461b715","observation_id":"1f02e486-dab4-461f-8114-afd539c2ae60","resolution":{"observed_at":"2026-07-31T21:44:39.598107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01614","last_updated":"2024-03-12T23:14:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-03T08:33:09Z","title":"GPT-4V(ision) is a Generalist Web Agent, if Grounded","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01614","snapshot_observed_at":"2026-07-31T21:44:39.601537Z","title":"Gpt-4v (ision) is a generalist web agent, if grounded.arXiv preprint arXiv:2401.01614, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-08T00:19:31.081356Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.601537Z"},"links":{"cited_paper":"/paper/2401.01614","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:e5931928441cf92075010b832ba35d53d83b5bdb44fb87264c3183678eb2dd48","observation_id":"634df6b6-7e15-4fa5-8211-c2c498cd8216","resolution":{"observed_at":"2026-07-31T21:44:39.601537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T21:44:39.604589Z","title":"Embodied agent interface: Benchmarking llms for embodied decision making.Advances in Neural Information Processing Systems, 37:100428–100534, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-08T00:19:31.081356Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.604589Z"},"links":{"citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:1ad64a052c92f3cdbf3644761aba562b57a480292e61342f35ed715a550d9d9d","observation_id":"903a6313-e57f-489c-88f1-55f281659901","resolution":{"observed_at":"2026-07-31T21:44:39.604589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T21:44:39.606756Z","title":"MIT press Cambridge, 1998","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-08T00:19:31.081356Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.606756Z"},"links":{"citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:d718aa2fe197829aa39fe47770e88d068f162628d2ff5b216f50b08d04ef70ea","observation_id":"6556022e-ee80-4c45-81db-d214d24cd033","resolution":{"observed_at":"2026-07-31T21:44:39.606756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T21:44:39.609034Z","title":"Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-08T00:19:31.081356Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.609034Z"},"links":{"citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:14efeb17c548827f02a58f7604ef9d8100795671506c2dc6769bcfd87443d240","observation_id":"385bcef2-03b7-4696-b0e5-0e3a6d3d3b84","resolution":{"observed_at":"2026-07-31T21:44:39.609034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-07-31T21:44:39.611311Z","title":"Openai o1 system card.arXiv preprint arXiv:2412.16720, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-08T00:19:31.081356Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.611311Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:85729c97b4198f2b0e513d1174d81e45fe0fe8762c0253fdd2d134d807337c3c","observation_id":"71c2bca8-b13a-487f-9e18-37234ffc5b1b","resolution":{"observed_at":"2026-07-31T21:44:39.611311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-31T21:44:39.614561Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-08T00:19:31.081356Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.614561Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:ad43535fa73ddf130dee6ea67a21af91f22bfeb26b7241dce3308f8a7195dc7f","observation_id":"411df13f-8af4-443c-8036-881b431581ac","resolution":{"observed_at":"2026-07-31T21:44:39.614561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20073","last_updated":"2025-05-26T17:19:30Z","snapshot_observed_at":"2026-08-08T11:44:11.313729Z","submitted_at":"2025-04-24T17:57:08Z","title":"RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20073","snapshot_observed_at":"2026-07-31T21:44:39.617527Z","title":"Lam, Yiping Lu, Kyunghyun Cho, Jiajun Wu, Fei-Fei Li, Lijuan Wang, Yejin Choi, and Manling Li","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-08T00:19:31.081356Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.617527Z"},"links":{"cited_paper":"/paper/2504.20073","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:1e586890c761fce0855afb9b46c93bb0a6e87a19394601a47ee63e246a4e289a","observation_id":"888a4484-cdc8-4d06-85cc-3db0d89068bb","resolution":{"observed_at":"2026-07-31T21:44:39.617527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10978","last_updated":"2025-10-28T15:11:36Z","snapshot_observed_at":"2026-07-29T19:20:21.974239Z","submitted_at":"2025-05-16T08:26:59Z","title":"Group-in-Group Policy Optimization for LLM Agent Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.10978","snapshot_observed_at":"2026-07-31T21:44:39.620076Z","title":"Group-in-group policy optimization for llm agent training.arXiv preprint arXiv:2505.10978, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-08T00:19:31.081356Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.620076Z"},"links":{"cited_paper":"/paper/2505.10978","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:171bc0bfa6a67a453537b81624cfeadac84e3f3400a515adb526ae42b7f7c635","observation_id":"c8735516-36a0-43e9-89f9-5203bb40c61a","resolution":{"observed_at":"2026-07-31T21:44:39.620076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T21:44:39.622957Z","title":"General agents need world models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-08T00:19:31.081356Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.622957Z"},"links":{"citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:ba2d5eb7694278e27dc23ad60d724807aa9f7c37c3d3dadc1806a52952277585","observation_id":"1c8ae0c1-cf39-4b32-98a2-c000c4af9b68","resolution":{"observed_at":"2026-07-31T21:44:39.622957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.05397","last_updated":"2016-11-16T18:21:29Z","snapshot_observed_at":"2026-08-08T00:00:13.424932Z","submitted_at":"2016-11-16T18:21:29Z","title":"Reinforcement Learning with Unsupervised Auxiliary Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.05397","snapshot_observed_at":"2026-07-31T21:44:39.625477Z","title":"Reinforcement learning with unsupervised auxiliary tasks.arXiv preprint arXiv:1611.05397, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-08T00:19:31.081356Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.625477Z"},"links":{"cited_paper":"/paper/1611.05397","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:7618ad85ee0af9fefbf9492e7a608fa002579d20a91fb2e40b11dfbb3f9e4999","observation_id":"c7e4a8bd-41a0-4f7a-87c1-794798b2141c","resolution":{"observed_at":"2026-07-31T21:44:39.625477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T21:44:39.628079Z","title":"Deep- mdp: Learning continuous latent space models for representation learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-08T00:19:31.081356Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.628079Z"},"links":{"citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:30525b40891f2632fae9554aa2e2b3e8fa15d8a8488093e099a84c06c7f30644","observation_id":"e6db1d2c-16ab-4d3a-9085-5c7787abe26a","resolution":{"observed_at":"2026-07-31T21:44:39.628079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T21:44:39.630204Z","title":"Vlms- guided representation distillation for efficient vision-based reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-08T00:19:31.081356Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.630204Z"},"links":{"citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:7cc47616e45b43f32df0dac00258217990c108ddc33f47c3f2f380e9f8941909","observation_id":"4d86f2f0-9407-47eb-9b2e-6975c1723600","resolution":{"observed_at":"2026-07-31T21:44:39.630204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.05929","last_updated":"2021-05-20T09:15:57Z","snapshot_observed_at":"2026-08-08T02:14:18.940330Z","submitted_at":"2020-07-12T07:38:15Z","title":"Data-Efficient Reinforcement Learning with Self-Predictive Representations","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.05929","snapshot_observed_at":"2026-07-31T21:44:39.632400Z","title":"Data-efficient reinforcement learning with self-predictive representations.arXiv preprint arXiv:2007.05929, 2020","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-08T00:19:31.081356Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.632400Z"},"links":{"cited_paper":"/paper/2007.05929","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:f1069cc8d186735c3f731c02875c98f9adacbfaeb8f9f4e2b66b013cbc798746","observation_id":"5328c020-c40e-4471-a32f-1bef29fd3f08","resolution":{"observed_at":"2026-07-31T21:44:39.632400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.08558","snapshot_observed_at":"2026-07-31T21:44:39.634912Z","title":"Agent learning via early experience.ArXiv, abs/2510.08558, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-08T00:19:31.081356Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.634912Z"},"links":{"cited_paper":"/paper/2510.08558","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:5cd994284d2804395f1857c6b00ad7c74c7606d60df5b725756ed62590c9c537","observation_id":"5d95d0b2-43f3-403f-98bf-6a6ec15cb62e","resolution":{"observed_at":"2026-07-31T21:44:39.634912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T21:44:39.637487Z","title":"Reinforcement world model learning for llm-based agents.arXiv preprint arXiv:2602.05842, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-08T00:19:31.081356Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.637487Z"},"links":{"citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:2e1a834374cb9fda5ce4e6039549dd7149f5154dee2d1f950dbccde00244a171","observation_id":"fb474bf4-dcbe-46be-bb53-1dfdf73bab9c","resolution":{"observed_at":"2026-07-31T21:44:39.637487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T21:44:39.639844Z","title":"Webshop: Towards scalable real-world web interaction with grounded language agents.Advances in Neural Information Processing Systems, 35:20744–20757, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-08T00:19:31.081356Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.639844Z"},"links":{"citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:176c6cae36c1013af710ccd52f44d4e2b14b5a4780b6158ab8dfbcd6d611e161","observation_id":"bdac9022-35f5-449c-8d0b-a75e148c70f1","resolution":{"observed_at":"2026-07-31T21:44:39.639844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.03768","last_updated":"2021-03-14T22:44:38Z","snapshot_observed_at":"2026-08-08T17:40:47.037804Z","submitted_at":"2020-10-08T05:13:36Z","title":"ALFWorld: Aligning Text and Embodied Environments for Interactive Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.03768","snapshot_observed_at":"2026-07-31T21:44:39.642114Z","title":"Alfworld: Aligning text and embodied environments for interactive learning.arXiv preprint arXiv:2010.03768, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-08T00:19:31.081356Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.642114Z"},"links":{"cited_paper":"/paper/2010.03768","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:208fceb4ffe85ea053b77fce750dc873041bd29eb3bd8339400554e38b2ac2f5","observation_id":"4c015d4a-6083-4f83-9e76-5284edfb809e","resolution":{"observed_at":"2026-07-31T21:44:39.642114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07339","last_updated":"2024-08-09T06:16:55Z","snapshot_observed_at":"2026-07-06T17:15:22.551637Z","submitted_at":"2024-01-14T18:12:03Z","title":"CodeAgent: Enhancing Code Generation with Tool-Integrated Agent Systems for Real-World Repo-level Coding Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07339","snapshot_observed_at":"2026-07-31T21:44:39.644614Z","title":"Codeagent: Enhancing code generation with tool-integrated agent systems for real-world repo-level coding challenges.arXiv preprint arXiv:2401.07339, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-08T00:19:31.081356Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.644614Z"},"links":{"cited_paper":"/paper/2401.07339","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:a8da5116e0a9756c4b0c1e9a5c82045564d6a868c1def6a7d2cd1079717ae79e","observation_id":"aac405ef-6282-48e6-be71-c8d28ba29d35","resolution":{"observed_at":"2026-07-31T21:44:39.644614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12045","last_updated":"2024-06-17T19:33:08Z","snapshot_observed_at":"2026-08-08T21:08:39.676079Z","submitted_at":"2024-06-17T19:33:08Z","title":"$\\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12045","snapshot_observed_at":"2026-07-31T21:44:39.647018Z","title":"τ-bench: A benchmark for tool-agent-user interaction in real-world domains.arXiv preprint arXiv:2406.12045, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-08T00:19:31.081356Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.647018Z"},"links":{"cited_paper":"/paper/2406.12045","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:b8527964c89c6dc295dc1cdbd2b9877d586f17ca0bd869979379746c5e379711","observation_id":"65cc9ddf-b3c2-4104-9aed-8f694fcc11c9","resolution":{"observed_at":"2026-07-31T21:44:39.647018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16291","last_updated":"2023-10-19T16:27:03Z","snapshot_observed_at":"2026-08-07T08:29:46.650400Z","submitted_at":"2023-05-25T17:46:38Z","title":"Voyager: An Open-Ended Embodied Agent with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16291","snapshot_observed_at":"2026-07-31T21:44:39.649499Z","title":"V oyager: An open-ended embodied agent with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-08T00:19:31.081356Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.649499Z"},"links":{"cited_paper":"/paper/2305.16291","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:1127663ffb164288bdc3b38c5a1303ededfae49f05728c967b92b8569921b601","observation_id":"2d413b60-1d57-46da-87c7-279b4f935e39","resolution":{"observed_at":"2026-07-31T21:44:39.649499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22648","last_updated":"2025-08-10T06:05:46Z","snapshot_observed_at":"2026-08-07T13:00:07.473210Z","submitted_at":"2025-05-28T17:57:07Z","title":"WebDancer: Towards Autonomous Information Seeking Agency","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22648","snapshot_observed_at":"2026-07-31T21:44:39.651881Z","title":"Webdancer: Towards autonomous information seeking agency.arXiv preprint arXiv:2505.22648, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-08T00:19:31.081356Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.651881Z"},"links":{"cited_paper":"/paper/2505.22648","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:54cf667a7b724bb4126fc1377b919cb0023358a3f1877368b1d05819010ee517","observation_id":"6c0496fa-01bb-4c21-8b8d-35eb7d750d84","resolution":{"observed_at":"2026-07-31T21:44:39.651881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02592","last_updated":"2025-07-03T12:59:07Z","snapshot_observed_at":"2026-08-09T01:03:55.193390Z","submitted_at":"2025-07-03T12:59:07Z","title":"WebSailor: Navigating Super-human Reasoning for Web Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02592","snapshot_observed_at":"2026-07-31T21:44:39.654314Z","title":"Websailor: Navigating super-human reasoning for web agent.arXiv preprint arXiv:2507.02592, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-08T00:19:31.081356Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.654314Z"},"links":{"cited_paper":"/paper/2507.02592","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:0d98e63bc2b1660898342538200a68659eec61b7115cd50959ece89e4d8b7803","observation_id":"d3d1f9e4-8cea-4cb8-a25d-12a5c6f16966","resolution":{"observed_at":"2026-07-31T21:44:39.654314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T21:44:39.656683Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-08T00:19:31.081356Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.656683Z"},"links":{"citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:cde0b5374e29d8ef0dec1e698090ad62c48ea3e189db4130f15ace64c8ebd408","observation_id":"32e21fec-cc70-4b66-83e2-2944416c30cd","resolution":{"observed_at":"2026-07-31T21:44:39.656683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T21:44:39.658791Z","title":"React: Synergizing reasoning and acting in language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-08T00:19:31.081356Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.658791Z"},"links":{"citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:d575aff810147d0a3d85d02da0d034efe1564bb95de360c4edff915cdc917dff","observation_id":"e1bbfc75-3b80-4683-8353-be3af30bad12","resolution":{"observed_at":"2026-07-31T21:44:39.658791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T21:44:39.661240Z","title":"Reflexion: Language agents with verbal reinforcement learning.Advances in Neural Information Processing Systems, 36:8634–8652, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-08T00:19:31.081356Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.661240Z"},"links":{"citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:72b352e47772aa30c343435c073be1f418028700164bf125d239f4b32aeccf34","observation_id":"774269c8-0ef8-4ddf-8c5e-e370ef54b1d2","resolution":{"observed_at":"2026-07-31T21:44:39.661240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-08T07:44:49.921146Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-07-31T21:44:39.663478Z","title":"Fine-tuning language models from human preferences","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-08T00:19:31.081356Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.663478Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:a12be0102caaafecee76fffaceda4914ea8ffe720422a2277662707fce478683","observation_id":"05423b04-eb26-4c2c-a480-7126191203d3","resolution":{"observed_at":"2026-07-31T21:44:39.663478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-31T21:44:39.666212Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-08T00:19:31.081356Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.666212Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:8d7565f7d41182071d2abad3233f1823f850f88bf27a8de11273effc4c92c8f6","observation_id":"189ff840-67d9-4843-8c0e-de4eae2f4613","resolution":{"observed_at":"2026-07-31T21:44:39.666212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-07-31T21:44:39.668576Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-08T00:19:31.081356Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.668576Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:e1328cc2939c1a093333b50d3019e11b0fbeb39aaa2c79c1780ffc83df7e78ec","observation_id":"b915ecb9-cb16-42a9-beb5-851cc140193c","resolution":{"observed_at":"2026-07-31T21:44:39.668576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-07-31T21:44:39.670928Z","title":"Understanding r1-zero-like training: A critical perspective.arXiv preprint arXiv:2503.20783, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-08T00:19:31.081356Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.670928Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:764d34bec2c07cd1018c0b8c2d9f541cc1c17aeb829caa36ce3d948d8cfbc1b5","observation_id":"858ec9ad-6c65-497f-9cb6-c0e3ea8e723b","resolution":{"observed_at":"2026-07-31T21:44:39.670928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-31T21:44:39.673802Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-08T00:19:31.081356Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.673802Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:b8add49fe032f8bd801f183776e93ad2366260eeb75045f56be2b73e1cc4ea09","observation_id":"f06992f8-47c7-4e56-8a08-c7341f06a8c4","resolution":{"observed_at":"2026-07-31T21:44:39.673802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.19849","last_updated":"2025-07-26T07:53:11Z","snapshot_observed_at":"2026-07-06T22:03:15.296567Z","submitted_at":"2025-07-26T07:53:11Z","title":"Agentic Reinforced Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.19849","snapshot_observed_at":"2026-07-31T21:44:39.676348Z","title":"Agentic reinforced policy optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-08T00:19:31.081356Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.676348Z"},"links":{"cited_paper":"/paper/2507.19849","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:6588a7c163c93ee886f8c0b59f68a173490ee63e5a3ba1498c6e01acff6854ad","observation_id":"0ca8784e-c1de-493f-8d81-83c2274d1d71","resolution":{"observed_at":"2026-07-31T21:44:39.676348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01603","last_updated":"2020-03-17T17:10:58Z","snapshot_observed_at":"2026-08-09T02:21:17.479736Z","submitted_at":"2019-12-03T18:57:16Z","title":"Dream to Control: Learning Behaviors by Latent Imagination","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.01603","snapshot_observed_at":"2026-07-31T21:44:39.678831Z","title":"Dream to control: Learning behaviors by latent imagination.arXiv preprint arXiv:1912.01603, 2019","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-08T00:19:31.081356Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.678831Z"},"links":{"cited_paper":"/paper/1912.01603","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:2c4c9789d61d845ef5dffa29fba9beed5228421bb2e0e92934b77af6d837c2c6","observation_id":"d929e877-9682-493b-9c17-ef7bfa0dd1f8","resolution":{"observed_at":"2026-07-31T21:44:39.678831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02193","last_updated":"2022-02-12T20:01:53Z","snapshot_observed_at":"2026-08-02T12:02:13.904371Z","submitted_at":"2020-10-05T17:52:14Z","title":"Mastering Atari with Discrete World Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02193","snapshot_observed_at":"2026-07-31T21:44:39.681305Z","title":"Mastering atari with discrete world models.arXiv preprint arXiv:2010.02193, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-08T00:19:31.081356Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.681305Z"},"links":{"cited_paper":"/paper/2010.02193","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:a63f70c07ece5b63b6d903ffa7f25c3b41c01b0e721d7f7913b7810617272ef4","observation_id":"93875012-557a-42a8-90df-798d46b23199","resolution":{"observed_at":"2026-07-31T21:44:39.681305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.04104","last_updated":"2024-04-17T17:41:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-10T18:12:16Z","title":"Mastering Diverse Domains through World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.04104","snapshot_observed_at":"2026-07-31T21:44:39.683897Z","title":"Mastering diverse domains through world models.arXiv preprint arXiv:2301.04104, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-08T00:19:31.081356Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.683897Z"},"links":{"cited_paper":"/paper/2301.04104","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:1cba18d79ece2e0cd3a22c8b3cba492343e10382b9cf4666a9f4908afb446c0c","observation_id":"6c8da77b-8f99-4c4b-8fb3-d0898bc32cc7","resolution":{"observed_at":"2026-07-31T21:44:39.683897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T21:44:39.686699Z","title":"Reason- ing with language model is planning with world model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-08T00:19:31.081356Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.686699Z"},"links":{"citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:715945a68b69da2d0653f2413324c7e0d0c940106d5b00d762939f7ca7ebf881","observation_id":"9d205fcf-7e3c-482f-8f60-5dbe3578bfcc","resolution":{"observed_at":"2026-07-31T21:44:39.686699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13232","last_updated":"2025-03-29T08:59:09Z","snapshot_observed_at":"2026-08-09T09:04:25.463249Z","submitted_at":"2024-10-17T05:37:00Z","title":"Web Agents with World Models: Learning and Leveraging Environment Dynamics in Web Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13232","snapshot_observed_at":"2026-07-31T21:44:39.688810Z","title":"Web agents with world models: Learning and leveraging environment dynamics in web navigation.arXiv preprint arXiv:2410.13232, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-08T00:19:31.081356Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.688810Z"},"links":{"cited_paper":"/paper/2410.13232","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:ca73f30b9012fb9d52bc5bf23cf1a45183840fb5dc9c89f27e9f4e6e8ee486dd","observation_id":"5aa4ef01-dc0d-47cc-a9e7-253c083f8ffb","resolution":{"observed_at":"2026-07-31T21:44:39.688810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06559","last_updated":"2025-04-01T05:04:47Z","snapshot_observed_at":"2026-08-09T10:42:58.450567Z","submitted_at":"2024-11-10T18:50:51Z","title":"Is Your LLM Secretly a World Model of the Internet? Model-Based Planning for Web Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.06559","snapshot_observed_at":"2026-07-31T21:44:39.691367Z","title":"Is your llm secretly a world model of the internet? model-based planning for web agents.arXiv preprint arXiv:2411.06559, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-08T00:19:31.081356Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.691367Z"},"links":{"cited_paper":"/paper/2411.06559","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:8488b7b97d29b673d975eca4c57302be25196864688f4cfd7e334f80bfe85107","observation_id":"f202d84d-b982-4228-9ab8-288546579a13","resolution":{"observed_at":"2026-07-31T21:44:39.691367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.21024","last_updated":"2025-08-21T05:55:43Z","snapshot_observed_at":"2026-08-07T23:25:11.057504Z","submitted_at":"2025-04-23T02:54:31Z","title":"WebEvolver: Enhancing Web Agent Self-Improvement with Coevolving World Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.21024","snapshot_observed_at":"2026-07-31T21:44:39.693932Z","title":"Webevolver: Enhancing web agent self-improvement with coevolving world model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-08T00:19:31.081356Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.693932Z"},"links":{"cited_paper":"/paper/2504.21024","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:3fd181c527725a90472cf98fef034be853ae4722ca9fd1e9730a7faf0a385979","observation_id":"53c918da-4385-4142-8181-dcf78676b305","resolution":{"observed_at":"2026-07-31T21:44:39.693932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.22844","snapshot_observed_at":"2026-07-31T21:44:39.696164Z","title":"Rlvmr: Reinforce- ment learning with verifiable meta-reasoning rewards for robust long-horizon agents.arXiv preprint arXiv:2507.22844, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-08T00:19:31.081356Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.696164Z"},"links":{"cited_paper":"/paper/2507.22844","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:05979a6bcef8d3255143ce6421f4b8c8f782527ebbba79a58de429b81d15d5c9","observation_id":"6198f19b-ce98-49eb-b616-8555e4fa7ad7","resolution":{"observed_at":"2026-07-31T21:44:39.696164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-31T21:44:39.699017Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-08T00:19:31.081356Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.699017Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:032618716476383b4971a4dbea88104b0021bcc3b8b85529d6437bac4305534a","observation_id":"ff20e295-7b85-4f67-b39b-369ce0b7a07f","resolution":{"observed_at":"2026-07-31T21:44:39.699017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T00:19:31.081356Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":45,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2607.27973."}