{"as_of":"2026-08-11T03:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:775b3ba785968e7fccea1847e4c7d30abbac86b0603d53ee2e8550ced99d325b","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T01:26:41.376368Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T04:19:39.533735Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.17680","last_updated":"2026-06-16T08:48:09Z","snapshot_observed_at":"2026-08-08T02:04:54.343143Z","submitted_at":"2026-06-16T08:48:09Z","title":"EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.17680","snapshot_observed_at":"2026-08-01T21:13:39.900693Z","title":"Hollows Out","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16169","last_updated":"2026-08-02T14:51:38Z","snapshot_observed_at":"2026-08-08T13:31:17.185519Z","submitted_at":"2026-07-17T17:49:05Z","title":"When Does Muon Help Agentic Reinforcement Learning?","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T21:13:39.900693Z"},"links":{"cited_paper":"/paper/2606.17680","citing_paper":"/paper/2607.16169"},"observation_digest":"sha256:63d9da0324e9829e3c99dff9aa3fb7fdaee9a98e71369e870aaebcc76ec53eb6","observation_id":"c431ebe0-6e2d-44c0-80b9-6bc9fc282a77","resolution":{"observed_at":"2026-08-01T21:13:39.900693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.17680","last_updated":"2026-06-16T08:48:09Z","snapshot_observed_at":"2026-08-08T02:04:54.343143Z","submitted_at":"2026-06-16T08:48:09Z","title":"EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.17680","snapshot_observed_at":"2026-08-04T04:19:39.533735Z","title":"Hollows Out","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16169","last_updated":"2026-08-02T14:51:38Z","snapshot_observed_at":"2026-08-08T13:31:17.185519Z","submitted_at":"2026-07-17T17:49:05Z","title":"When Does Muon Help Agentic Reinforcement Learning?","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T04:19:39.533735Z"},"links":{"cited_paper":"/paper/2606.17680","citing_paper":"/paper/2607.16169"},"observation_digest":"sha256:52655fb9a107b53eefecc8c28c7c42b5d706f7dd2f6f7ce2c1b4216249e602f9","observation_id":"cffaf9cb-68a8-49bc-8848-b2a9d3007c82","resolution":{"observed_at":"2026-08-04T04:19:39.533735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.17680/citation-record","integrity":"/paper/2606.17680/integrity","json":"/paper/2606.17680/citation-record.json","paper":"/paper/2606.17680"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:26:41.376368Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.17680","last_updated":"2026-06-16T08:48:09Z","snapshot_observed_at":"2026-08-08T02:04:54.343143Z","submitted_at":"2026-06-16T08:48:09Z","title":"EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T01:26:41.376368Z"},"links":{"citing_paper":"/paper/2606.17680"},"observation_digest":"sha256:29f9d5389123f5331bd27c4568d0b376e7b2156b46c5d8976da062c8fac2bb60","observation_id":"2da6deae-2830-43ff-8545-85e5e7a432bc","resolution":{"observed_at":"2026-06-27T01:26:41.376368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:26:41.376368Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.17680","last_updated":"2026-06-16T08:48:09Z","snapshot_observed_at":"2026-08-08T02:04:54.343143Z","submitted_at":"2026-06-16T08:48:09Z","title":"EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T01:26:41.376368Z"},"links":{"citing_paper":"/paper/2606.17680"},"observation_digest":"sha256:b48b7886c01fb4522ec3700035a92210bb8cc6625f01676b521319d4f6f905d8","observation_id":"711195b7-a11c-44c1-bb2c-845039f4a1ea","resolution":{"observed_at":"2026-06-27T01:26:41.376368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:26:41.376368Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.17680","last_updated":"2026-06-16T08:48:09Z","snapshot_observed_at":"2026-08-08T02:04:54.343143Z","submitted_at":"2026-06-16T08:48:09Z","title":"EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T01:26:41.376368Z"},"links":{"citing_paper":"/paper/2606.17680"},"observation_digest":"sha256:a59388902fc1fe7db37277b6f6660e5bd7a4022bff3e239d9f1e15d10c351ba0","observation_id":"ceeae14e-c6c3-4cc3-a04a-732d383a5ed7","resolution":{"observed_at":"2026-06-27T01:26:41.376368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2606.17680","last_updated":"2026-06-16T08:48:09Z","snapshot_observed_at":"2026-08-08T02:04:54.343143Z","submitted_at":"2026-06-16T08:48:09Z","title":"EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T01:26:41.376368Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2606.17680"},"observation_digest":"sha256:30399856cea8268526f3ffd98c9dfdf78dd66630c4146e9cbc04939f513f1133","observation_id":"4db8a43b-9664-4e21-8ae1-8aff5f08d178","resolution":{"observed_at":"2026-07-03T20:18:57.189097Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10978","last_updated":"2025-10-28T15:11:36Z","snapshot_observed_at":"2026-07-29T19:20:21.974239Z","submitted_at":"2025-05-16T08:26:59Z","title":"Group-in-Group Policy Optimization for LLM Agent Training","version":3},"cited_work":{"arxiv_id":"2505.10978","doi":"10.48550/arxiv.2505.10978","metadata_source":"pith","pith_arxiv_id":"2505.10978","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Group-in-Group Policy Optimization for LLM Agent Training","venue":"cs.LG","work_id":"bc65d492-e6ba-4522-874c-43d2f4fc5191","year":2025},"citing_paper":{"arxiv_id":"2606.17680","last_updated":"2026-06-16T08:48:09Z","snapshot_observed_at":"2026-08-08T02:04:54.343143Z","submitted_at":"2026-06-16T08:48:09Z","title":"EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T01:26:41.376368Z"},"links":{"cited_paper":"/paper/2505.10978","citing_paper":"/paper/2606.17680"},"observation_digest":"sha256:6c3ad7ca728932fcbd56ecf40aec45a9c86da6d8b52d3d9ffcf8bdeab9e6b183","observation_id":"8f3db74c-dcc0-4699-a7f3-80e80c2dd5c4","resolution":{"observed_at":"2026-07-03T20:18:57.192629Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:26:41.376368Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.17680","last_updated":"2026-06-16T08:48:09Z","snapshot_observed_at":"2026-08-08T02:04:54.343143Z","submitted_at":"2026-06-16T08:48:09Z","title":"EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T01:26:41.376368Z"},"links":{"citing_paper":"/paper/2606.17680"},"observation_digest":"sha256:1f1655846874fd71a51888a696c9491476d5b3dd831ae3c1b681b34b6969c501","observation_id":"cd3fc0bc-4930-4247-9293-f421fa75a367","resolution":{"observed_at":"2026-06-27T01:26:41.376368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:26:41.376368Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.17680","last_updated":"2026-06-16T08:48:09Z","snapshot_observed_at":"2026-08-08T02:04:54.343143Z","submitted_at":"2026-06-16T08:48:09Z","title":"EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T01:26:41.376368Z"},"links":{"citing_paper":"/paper/2606.17680"},"observation_digest":"sha256:4d54be4462cfda1478e974158d3a8c60e42adf761da215d559c783393b71458d","observation_id":"9d53c325-dac9-4724-a77c-ae1b4817b3a6","resolution":{"observed_at":"2026-06-27T01:26:41.376368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.04104","last_updated":"2024-04-17T17:41:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-10T18:12:16Z","title":"Mastering Diverse Domains through World Models","version":2},"cited_work":{"arxiv_id":"2301.04104","doi":"10.1126/sciadv.adu2488","metadata_source":"pith","pith_arxiv_id":"2301.04104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mastering Diverse Domains through World Models","venue":"cs.AI","work_id":"6aeb260f-8c7c-4f9c-b98b-067cd7c59acd","year":2023},"citing_paper":{"arxiv_id":"2606.17680","last_updated":"2026-06-16T08:48:09Z","snapshot_observed_at":"2026-08-08T02:04:54.343143Z","submitted_at":"2026-06-16T08:48:09Z","title":"EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T01:26:41.376368Z"},"links":{"cited_paper":"/paper/2301.04104","citing_paper":"/paper/2606.17680"},"observation_digest":"sha256:b21ff69008930e341e68e744183c3fa4d03c34a739864c5daccdd2e58b152dea","observation_id":"b54486c1-4832-45ad-b041-210e05db7849","resolution":{"observed_at":"2026-07-03T20:18:57.172700Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:26:41.376368Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.17680","last_updated":"2026-06-16T08:48:09Z","snapshot_observed_at":"2026-08-08T02:04:54.343143Z","submitted_at":"2026-06-16T08:48:09Z","title":"EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T01:26:41.376368Z"},"links":{"citing_paper":"/paper/2606.17680"},"observation_digest":"sha256:1329e3a6e204e674c3ed2f6f8f72eac278149f2f49d17937aa3401bb17394693","observation_id":"f5bbdc4f-a611-4753-a00b-63bf3205bc8f","resolution":{"observed_at":"2026-06-27T01:26:41.376368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:26:41.376368Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.17680","last_updated":"2026-06-16T08:48:09Z","snapshot_observed_at":"2026-08-08T02:04:54.343143Z","submitted_at":"2026-06-16T08:48:09Z","title":"EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T01:26:41.376368Z"},"links":{"citing_paper":"/paper/2606.17680"},"observation_digest":"sha256:f5f7653a3b5a2eda9305800fc7736a87d0e0d4df72baa675db55cb596c4b5531","observation_id":"a4afef43-0771-4834-92b4-227433559d24","resolution":{"observed_at":"2026-06-27T01:26:41.376368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-07-06T20:51:28.022519Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":"2503.09516","doi":"10.48550/arxiv.2503.09516","metadata_source":"pith","pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","venue":"cs.CL","work_id":"0e0b7549-2bc4-4574-aa7f-588ffa16eaae","year":2025},"citing_paper":{"arxiv_id":"2606.17680","last_updated":"2026-06-16T08:48:09Z","snapshot_observed_at":"2026-08-08T02:04:54.343143Z","submitted_at":"2026-06-16T08:48:09Z","title":"EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T01:26:41.376368Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2606.17680"},"observation_digest":"sha256:8ae8ec574fb8eeea4440ce32044d9597e0a71178b89c2ec340df2d86ffef201e","observation_id":"90130480-67b6-461d-b980-9fc37bc8b88e","resolution":{"observed_at":"2026-07-03T20:18:57.194544Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:26:41.376368Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.17680","last_updated":"2026-06-16T08:48:09Z","snapshot_observed_at":"2026-08-08T02:04:54.343143Z","submitted_at":"2026-06-16T08:48:09Z","title":"EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T01:26:41.376368Z"},"links":{"citing_paper":"/paper/2606.17680"},"observation_digest":"sha256:648fe7a02125b4bda1af0f6ea05d0dfadd06298f0dd57ed4a81772c5e9efcdf4","observation_id":"db926258-f0e9-4868-a4cd-ecc180ae1e06","resolution":{"observed_at":"2026-06-27T01:26:41.376368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2606.17680","last_updated":"2026-06-16T08:48:09Z","snapshot_observed_at":"2026-08-08T02:04:54.343143Z","submitted_at":"2026-06-16T08:48:09Z","title":"EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T01:26:41.376368Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2606.17680"},"observation_digest":"sha256:ef5b877682d95e2045105f4a00db1a5638edc16e57290c17c5f8f28459cb29dd","observation_id":"a1ec3c90-97bc-4be4-b40d-bcf0f832ea4e","resolution":{"observed_at":"2026-07-03T20:18:57.197623Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:26:41.376368Z","title":"Dai, Jakob Uszkoreit, Quoc Le, and Slav Petrov","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.17680","last_updated":"2026-06-16T08:48:09Z","snapshot_observed_at":"2026-08-08T02:04:54.343143Z","submitted_at":"2026-06-16T08:48:09Z","title":"EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T01:26:41.376368Z"},"links":{"citing_paper":"/paper/2606.17680"},"observation_digest":"sha256:58d54680e7e8d1ee39e527dd673004d7dd5c4d9d5562955e6d25f6630d19bc00","observation_id":"cbcb43c0-16b7-4365-9548-dcf06d51e6fd","resolution":{"observed_at":"2026-06-27T01:26:41.376368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:26:41.376368Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.17680","last_updated":"2026-06-16T08:48:09Z","snapshot_observed_at":"2026-08-08T02:04:54.343143Z","submitted_at":"2026-06-16T08:48:09Z","title":"EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T01:26:41.376368Z"},"links":{"citing_paper":"/paper/2606.17680"},"observation_digest":"sha256:fcd5c6bc0fc314b9b0590fb2a7daa12078db1d21a828e8582a41105b21ff7b49","observation_id":"595fd607-6f87-4cd5-a646-60dce89d8a72","resolution":{"observed_at":"2026-06-27T01:26:41.376368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.20022","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T20:18:57.169022Z","title":"arXiv preprint arXiv:2510.20022 , year=","venue":null,"work_id":"10af55e8-d5bc-44a1-941c-f1a5f7be3195","year":2025},"citing_paper":{"arxiv_id":"2606.17680","last_updated":"2026-06-16T08:48:09Z","snapshot_observed_at":"2026-08-08T02:04:54.343143Z","submitted_at":"2026-06-16T08:48:09Z","title":"EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T01:26:41.376368Z"},"links":{"citing_paper":"/paper/2606.17680"},"observation_digest":"sha256:a0e8ccdc5c00ec15f2a3f33eff02cc4c1ec52596f2bfc34de3cf9949aa829de6","observation_id":"a8c97d08-13e7-4678-a77e-d1a5951717dc","resolution":{"observed_at":"2026-07-03T20:18:57.171712Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-07-06T04:29:24.362640Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":"1509.02971","doi":"10.1137/22m1480409","metadata_source":"pith","pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Continuous control with deep reinforcement learning","venue":"cs.LG","work_id":"41a65444-c819-4303-a1f1-b075aa86d40c","year":2015},"citing_paper":{"arxiv_id":"2606.17680","last_updated":"2026-06-16T08:48:09Z","snapshot_observed_at":"2026-08-08T02:04:54.343143Z","submitted_at":"2026-06-16T08:48:09Z","title":"EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T01:26:41.376368Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2606.17680"},"observation_digest":"sha256:a512dab774d0e2748d1b91b364dcb48d8bb3753cad9e2dca9fb03994015ac5c1","observation_id":"83160f63-1a68-4e6e-b3d0-cce42018b71b","resolution":{"observed_at":"2026-07-03T20:18:57.167368Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:26:41.376368Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.17680","last_updated":"2026-06-16T08:48:09Z","snapshot_observed_at":"2026-08-08T02:04:54.343143Z","submitted_at":"2026-06-16T08:48:09Z","title":"EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T01:26:41.376368Z"},"links":{"citing_paper":"/paper/2606.17680"},"observation_digest":"sha256:f77a7e3b66c6e917d51a35f1e98bce45ee505bd29a98aa8cdcd0dd9e35466aab","observation_id":"191ff0ac-4af4-44fa-8b1c-8d5f768ee3ac","resolution":{"observed_at":"2026-06-27T01:26:41.376368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:26:41.376368Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.17680","last_updated":"2026-06-16T08:48:09Z","snapshot_observed_at":"2026-08-08T02:04:54.343143Z","submitted_at":"2026-06-16T08:48:09Z","title":"EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T01:26:41.376368Z"},"links":{"citing_paper":"/paper/2606.17680"},"observation_digest":"sha256:a0364cc8162171215d8d2d0cdbbaef48220caf988b8a534f3272b401d29ca8a6","observation_id":"887d65b6-dfcd-4be6-8423-ff7a7b97d16d","resolution":{"observed_at":"2026-06-27T01:26:41.376368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.19199","doi":"10.48550/arxiv.2509.19199","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentic reinforcement learning with implicit step rewards","venue":"ArXiv.org","work_id":"6eb5e259-3013-4695-8aa8-ec5df9a9d481","year":2025},"citing_paper":{"arxiv_id":"2606.17680","last_updated":"2026-06-16T08:48:09Z","snapshot_observed_at":"2026-08-08T02:04:54.343143Z","submitted_at":"2026-06-16T08:48:09Z","title":"EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T01:26:41.376368Z"},"links":{"citing_paper":"/paper/2606.17680"},"observation_digest":"sha256:a543b957c4fa94223f8c51cfe1a3321e576bdbb15f08073eef081c763a72a5aa","observation_id":"385ab561-0bf8-48ca-a1d1-e64d452494d5","resolution":{"observed_at":"2026-07-03T20:18:57.185413Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21460","last_updated":"2025-03-27T12:50:17Z","snapshot_observed_at":"2026-07-06T20:59:35.694800Z","submitted_at":"2025-03-27T12:50:17Z","title":"Large Language Model Agent: A Survey on Methodology, Applications and Challenges","version":1},"cited_work":{"arxiv_id":"2503.21460","doi":"10.1145/3573051.3596191","metadata_source":"pith","pith_arxiv_id":"2503.21460","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Language Model Agent: A Survey on Methodology, Applications and Challenges","venue":"cs.CL","work_id":"4aff48d9-c46d-41d9-904b-52251e559596","year":2025},"citing_paper":{"arxiv_id":"2606.17680","last_updated":"2026-06-16T08:48:09Z","snapshot_observed_at":"2026-08-08T02:04:54.343143Z","submitted_at":"2026-06-16T08:48:09Z","title":"EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T01:26:41.376368Z"},"links":{"cited_paper":"/paper/2503.21460","citing_paper":"/paper/2606.17680"},"observation_digest":"sha256:cc112f6c06d98f9206da5720250511281a757c33f9d79240cf73a9e11cd60ffa","observation_id":"14d13fc7-2e9b-413f-916c-b255d52a9689","resolution":{"observed_at":"2026-07-03T20:18:57.160536Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:26:41.376368Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.17680","last_updated":"2026-06-16T08:48:09Z","snapshot_observed_at":"2026-08-08T02:04:54.343143Z","submitted_at":"2026-06-16T08:48:09Z","title":"EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T01:26:41.376368Z"},"links":{"citing_paper":"/paper/2606.17680"},"observation_digest":"sha256:084051698d49f6a43b5aededc5fd7504324a543b52d96abc8bd160a9271311f8","observation_id":"f283446d-52e7-4bd4-91ed-b9d299eb7822","resolution":{"observed_at":"2026-06-27T01:26:41.376368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:26:41.376368Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.17680","last_updated":"2026-06-16T08:48:09Z","snapshot_observed_at":"2026-08-08T02:04:54.343143Z","submitted_at":"2026-06-16T08:48:09Z","title":"EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T01:26:41.376368Z"},"links":{"citing_paper":"/paper/2606.17680"},"observation_digest":"sha256:6b2c36fc8595b4c50b19fd5495c8956b484f9d7c5975b920fbcf59e58799ce40","observation_id":"24cfe1d1-9f61-467f-863f-3b75235acf59","resolution":{"observed_at":"2026-06-27T01:26:41.376368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-07-06T03:31:23.521122Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1312.5602","doi":"10.48550/arxiv.1312.5602","metadata_source":"pith","pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Playing Atari with Deep Reinforcement Learning","venue":"cs.LG","work_id":"736a8ddf-e365-4940-ad58-4699fddedb86","year":2013},"citing_paper":{"arxiv_id":"2606.17680","last_updated":"2026-06-16T08:48:09Z","snapshot_observed_at":"2026-08-08T02:04:54.343143Z","submitted_at":"2026-06-16T08:48:09Z","title":"EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T01:26:41.376368Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2606.17680"},"observation_digest":"sha256:c9f3e6ee1f722cc41097bb30eb7972f1fe7b29582f79491fcfde4fcdde2035a0","observation_id":"542bc27a-a086-4963-a80a-3b32caa1ebf0","resolution":{"observed_at":"2026-07-03T20:18:57.163791Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":"2410.21276","doi":"10.1177/15248380231178756","metadata_source":"pith","pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4o System Card","venue":"cs.CL","work_id":"f37bf1c7-4964-4e56-9762-d20da8d9009f","year":2024},"citing_paper":{"arxiv_id":"2606.17680","last_updated":"2026-06-16T08:48:09Z","snapshot_observed_at":"2026-08-08T02:04:54.343143Z","submitted_at":"2026-06-16T08:48:09Z","title":"EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T01:26:41.376368Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2606.17680"},"observation_digest":"sha256:8836dafeb0ff9c344a8ca0ac275e22f2bc0abd3f9c4bd67cbb82c6133315b692","observation_id":"83621a44-098d-4162-bbfe-63102ddac360","resolution":{"observed_at":"2026-07-03T20:18:57.175228Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:26:41.376368Z","title":"Efros, and Trevor Darrell","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.17680","last_updated":"2026-06-16T08:48:09Z","snapshot_observed_at":"2026-08-08T02:04:54.343143Z","submitted_at":"2026-06-16T08:48:09Z","title":"EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T01:26:41.376368Z"},"links":{"citing_paper":"/paper/2606.17680"},"observation_digest":"sha256:27b73ab64ed3dde40631f62cb7cb3f168e55d113a2d4d14d266a6ed43de0032e","observation_id":"775deffa-c14b-4605-a73c-18cf6bbac1b8","resolution":{"observed_at":"2026-06-27T01:26:41.376368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:26:41.376368Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.17680","last_updated":"2026-06-16T08:48:09Z","snapshot_observed_at":"2026-08-08T02:04:54.343143Z","submitted_at":"2026-06-16T08:48:09Z","title":"EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T01:26:41.376368Z"},"links":{"citing_paper":"/paper/2606.17680"},"observation_digest":"sha256:3e20c92252c9c90dfbc42b5326724268cc4acc0dd6554453935c74b42c252a41","observation_id":"34491557-e07a-4181-af45-8d9285cd6d57","resolution":{"observed_at":"2026-06-27T01:26:41.376368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12326","last_updated":"2025-01-21T17:48:10Z","snapshot_observed_at":"2026-07-06T20:23:58.426780Z","submitted_at":"2025-01-21T17:48:10Z","title":"UI-TARS: Pioneering Automated GUI Interaction with Native Agents","version":1},"cited_work":{"arxiv_id":"2501.12326","doi":"10.48550/arxiv.2501.12326","metadata_source":"pith","pith_arxiv_id":"2501.12326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"UI-TARS: Pioneering Automated GUI Interaction with Native Agents","venue":"cs.AI","work_id":"0bbcf263-a46d-4525-a438-11fce3316568","year":2025},"citing_paper":{"arxiv_id":"2606.17680","last_updated":"2026-06-16T08:48:09Z","snapshot_observed_at":"2026-08-08T02:04:54.343143Z","submitted_at":"2026-06-16T08:48:09Z","title":"EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T01:26:41.376368Z"},"links":{"cited_paper":"/paper/2501.12326","citing_paper":"/paper/2606.17680"},"observation_digest":"sha256:6671c5a220030baf802844668f615cfb6d9e8d6374018b3efcabbbb4cb55c0bb","observation_id":"a05e988d-b170-423f-b555-0c057fdecf97","resolution":{"observed_at":"2026-07-03T20:18:57.178975Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:19.638951+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:19.638951+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:26:41.376368Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.17680","last_updated":"2026-06-16T08:48:09Z","snapshot_observed_at":"2026-08-08T02:04:54.343143Z","submitted_at":"2026-06-16T08:48:09Z","title":"EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T01:26:41.376368Z"},"links":{"citing_paper":"/paper/2606.17680"},"observation_digest":"sha256:5542cd2b37fa3f2d422e1bda614b9c5edfb9dd0d5111eb22d350f63ccbea7f58","observation_id":"bd8aef76-be5d-4d49-b438-7c9de81322a2","resolution":{"observed_at":"2026-06-27T01:26:41.376368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2606.17680","last_updated":"2026-06-16T08:48:09Z","snapshot_observed_at":"2026-08-08T02:04:54.343143Z","submitted_at":"2026-06-16T08:48:09Z","title":"EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T01:26:41.376368Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2606.17680"},"observation_digest":"sha256:0f20334c6a4e35b7ae6317a96b48b8c7201d68053d58721241b373bde7e81804","observation_id":"4c868402-7811-45cf-a333-0a0be3b46d78","resolution":{"observed_at":"2026-07-03T20:18:57.159901Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:26:41.376368Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.17680","last_updated":"2026-06-16T08:48:09Z","snapshot_observed_at":"2026-08-08T02:04:54.343143Z","submitted_at":"2026-06-16T08:48:09Z","title":"EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T01:26:41.376368Z"},"links":{"citing_paper":"/paper/2606.17680"},"observation_digest":"sha256:f79f1814bcae63226a092756c5b7f12260c634f490915d28e8740b9a686759b8","observation_id":"41932e52-96f7-481d-b91d-c7e385eca11c","resolution":{"observed_at":"2026-06-27T01:26:41.376368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:26:41.376368Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.17680","last_updated":"2026-06-16T08:48:09Z","snapshot_observed_at":"2026-08-08T02:04:54.343143Z","submitted_at":"2026-06-16T08:48:09Z","title":"EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-27T01:26:41.376368Z"},"links":{"citing_paper":"/paper/2606.17680"},"observation_digest":"sha256:17e112dcf5b51acb02ead9927e2b2701cd7ed0b8ccd3666e3dede0cd3f69fb0f","observation_id":"4ffdb9aa-08bb-4d10-8a99-ac3330400095","resolution":{"observed_at":"2026-06-27T01:26:41.376368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:26:41.376368Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.17680","last_updated":"2026-06-16T08:48:09Z","snapshot_observed_at":"2026-08-08T02:04:54.343143Z","submitted_at":"2026-06-16T08:48:09Z","title":"EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T01:26:41.376368Z"},"links":{"citing_paper":"/paper/2606.17680"},"observation_digest":"sha256:8bc52b953b91afc6e23f6dc077f3fcd860b6e9524425bf9ac84329ded17c3cbe","observation_id":"6da4d6bf-1f95-46cd-a66b-ecb7935d6eff","resolution":{"observed_at":"2026-06-27T01:26:41.376368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01815","last_updated":"2017-12-05T18:45:38Z","snapshot_observed_at":"2026-08-02T00:39:04.960144Z","submitted_at":"2017-12-05T18:45:38Z","title":"Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm","version":1},"cited_work":{"arxiv_id":"1712.01815","doi":"10.48550/arxiv.1712.01815","metadata_source":"pith","pith_arxiv_id":"1712.01815","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm","venue":"cs.AI","work_id":"9978bd70-b9dd-4eb6-928b-66c2d40da222","year":2017},"citing_paper":{"arxiv_id":"2606.17680","last_updated":"2026-06-16T08:48:09Z","snapshot_observed_at":"2026-08-08T02:04:54.343143Z","submitted_at":"2026-06-16T08:48:09Z","title":"EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-27T01:26:41.376368Z"},"links":{"cited_paper":"/paper/1712.01815","citing_paper":"/paper/2606.17680"},"observation_digest":"sha256:e217d684480df114c405ff86b29d25befde8be415a192f60472d4c0b3c41970c","observation_id":"22de5ad0-c187-4b2b-aaca-c2c180df2dfc","resolution":{"observed_at":"2026-07-03T20:18:57.195470Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-02T13:38:12.382503+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T13:38:12.382503+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-08-02T10:52:10.211700Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":"2601.03267","doi":"10.48550/arxiv.2601.03267","metadata_source":"pith","pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"OpenAI GPT-5 System Card","venue":"cs.CL","work_id":"ca87689a-0d29-4476-b504-b65dbbb08af4","year":2025},"citing_paper":{"arxiv_id":"2606.17680","last_updated":"2026-06-16T08:48:09Z","snapshot_observed_at":"2026-08-08T02:04:54.343143Z","submitted_at":"2026-06-16T08:48:09Z","title":"EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-27T01:26:41.376368Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2606.17680"},"observation_digest":"sha256:34afc32b24a1ad248e9cf9971b528e2ea421e4bbec705ea1f10d4a2be22a1b84","observation_id":"3f465248-216c-4a15-b5cc-74de13c56f9b","resolution":{"observed_at":"2026-07-03T20:18:57.139137Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T00:38:24.809631+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T00:38:24.809631+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06471","last_updated":"2025-08-08T17:21:06Z","snapshot_observed_at":"2026-08-11T03:34:09.767397Z","submitted_at":"2025-08-08T17:21:06Z","title":"GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models","version":1},"cited_work":{"arxiv_id":"2508.06471","doi":"10.48550/arxiv.2508.06471","metadata_source":"pith","pith_arxiv_id":"2508.06471","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models","venue":"cs.CL","work_id":"5bb4e5d7-985e-431b-bb0d-75576cdc2950","year":2025},"citing_paper":{"arxiv_id":"2606.17680","last_updated":"2026-06-16T08:48:09Z","snapshot_observed_at":"2026-08-08T02:04:54.343143Z","submitted_at":"2026-06-16T08:48:09Z","title":"EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-27T01:26:41.376368Z"},"links":{"cited_paper":"/paper/2508.06471","citing_paper":"/paper/2606.17680"},"observation_digest":"sha256:4dee59569a8578c1ed8e35e64024e6c80b7c05bd279989a0eb6e7e9dfed33dab","observation_id":"981d3489-4f5f-4eff-b75d-7360eaecfa08","resolution":{"observed_at":"2026-07-03T20:18:57.133814Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-23T05:23:01.474969+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T05:23:01.474969+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:26:41.376368Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.17680","last_updated":"2026-06-16T08:48:09Z","snapshot_observed_at":"2026-08-08T02:04:54.343143Z","submitted_at":"2026-06-16T08:48:09Z","title":"EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-27T01:26:41.376368Z"},"links":{"citing_paper":"/paper/2606.17680"},"observation_digest":"sha256:7204dd9d2bbc2793736cf0f93781c04e224130cdd0faebaf3d3e2c90075f3413","observation_id":"62b62c0c-0c8c-46ff-8159-57f9155dfd16","resolution":{"observed_at":"2026-06-27T01:26:41.376368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:26:41.376368Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.17680","last_updated":"2026-06-16T08:48:09Z","snapshot_observed_at":"2026-08-08T02:04:54.343143Z","submitted_at":"2026-06-16T08:48:09Z","title":"EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-27T01:26:41.376368Z"},"links":{"citing_paper":"/paper/2606.17680"},"observation_digest":"sha256:0f9a0d85801dc2b4f67948ec8d23b17dd7ac421d1349a1ca9ab464b9caa5d326","observation_id":"150e4003-1bf5-4821-b923-a0af688f916d","resolution":{"observed_at":"2026-06-27T01:26:41.376368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:26:41.376368Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.17680","last_updated":"2026-06-16T08:48:09Z","snapshot_observed_at":"2026-08-08T02:04:54.343143Z","submitted_at":"2026-06-16T08:48:09Z","title":"EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-27T01:26:41.376368Z"},"links":{"citing_paper":"/paper/2606.17680"},"observation_digest":"sha256:061b7fabcf54e37260568fd1c1ffd824b443adec20122a6ed3d8be973a78bbde","observation_id":"2283b5a6-f4b1-4ea5-9d9f-51198fbb4209","resolution":{"observed_at":"2026-06-27T01:26:41.376368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12516","last_updated":"2025-04-16T22:27:45Z","snapshot_observed_at":"2026-08-03T00:43:33.338074Z","submitted_at":"2025-04-16T22:27:45Z","title":"BrowseComp: A Simple Yet Challenging Benchmark for Browsing Agents","version":1},"cited_work":{"arxiv_id":"2504.12516","doi":"10.48550/arxiv.2504.12516","metadata_source":"pith","pith_arxiv_id":"2504.12516","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BrowseComp: A Simple Yet Challenging Benchmark for Browsing Agents","venue":"cs.CL","work_id":"25adb508-d97c-49d6-ae43-7a70c2478a34","year":2025},"citing_paper":{"arxiv_id":"2606.17680","last_updated":"2026-06-16T08:48:09Z","snapshot_observed_at":"2026-08-08T02:04:54.343143Z","submitted_at":"2026-06-16T08:48:09Z","title":"EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-27T01:26:41.376368Z"},"links":{"cited_paper":"/paper/2504.12516","citing_paper":"/paper/2606.17680"},"observation_digest":"sha256:406d153d000cdda3e97214ca5c407a104ea679c9cd9579588db09fdbfa20fcf0","observation_id":"0b739ea2-8382-458b-a786-fadaf911452e","resolution":{"observed_at":"2026-07-03T20:18:57.137468Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-09T01:39:11.956106Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":"2404.07972","doi":"10.48550/arxiv.2404.07972","metadata_source":"pith","pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","venue":"cs.AI","work_id":"793d9419-734d-45fe-9f51-d4c5a3a57cf8","year":2024},"citing_paper":{"arxiv_id":"2606.17680","last_updated":"2026-06-16T08:48:09Z","snapshot_observed_at":"2026-08-08T02:04:54.343143Z","submitted_at":"2026-06-16T08:48:09Z","title":"EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-27T01:26:41.376368Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2606.17680"},"observation_digest":"sha256:64a6a34e07ea159b760e18318ea5ebaae4c7cbbcc09d27e81416f0953a1e3194","observation_id":"9fba41a5-172a-477f-9198-c5c2054a91e0","resolution":{"observed_at":"2026-07-03T20:18:57.201947Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.817655+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2606.17680","last_updated":"2026-06-16T08:48:09Z","snapshot_observed_at":"2026-08-08T02:04:54.343143Z","submitted_at":"2026-06-16T08:48:09Z","title":"EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-27T01:26:41.376368Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2606.17680"},"observation_digest":"sha256:eb89e4fb30ecf95b4492eaf9dd3410f3bbc211e90f0c70081dc8642fe07205fd","observation_id":"96b797f5-5b92-40a8-855e-4cc321373a95","resolution":{"observed_at":"2026-07-03T20:18:57.184283Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:26:41.376368Z","title":"Cohen, Ruslan Salakhutdi- nov, and Christopher D","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.17680","last_updated":"2026-06-16T08:48:09Z","snapshot_observed_at":"2026-08-08T02:04:54.343143Z","submitted_at":"2026-06-16T08:48:09Z","title":"EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-27T01:26:41.376368Z"},"links":{"citing_paper":"/paper/2606.17680"},"observation_digest":"sha256:74d06c606cd8b7488c3cf5438535c32226ab7d379eef0d96443acac637b0665b","observation_id":"b3f51b9f-355f-4937-99c8-115368872d69","resolution":{"observed_at":"2026-06-27T01:26:41.376368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:26:41.376368Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.17680","last_updated":"2026-06-16T08:48:09Z","snapshot_observed_at":"2026-08-08T02:04:54.343143Z","submitted_at":"2026-06-16T08:48:09Z","title":"EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-27T01:26:41.376368Z"},"links":{"citing_paper":"/paper/2606.17680"},"observation_digest":"sha256:a07c187e87494ba616d689cb1b67151f54af3b5736e052d28fd55c3b904a77f5","observation_id":"d4640620-2a25-4de7-9308-020bea5490f4","resolution":{"observed_at":"2026-06-27T01:26:41.376368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:26:41.376368Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.17680","last_updated":"2026-06-16T08:48:09Z","snapshot_observed_at":"2026-08-08T02:04:54.343143Z","submitted_at":"2026-06-16T08:48:09Z","title":"EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-27T01:26:41.376368Z"},"links":{"citing_paper":"/paper/2606.17680"},"observation_digest":"sha256:5ffa61c5515a6cc38d324caad0422dcb4c2a2fb02a4aa64c26b6c0d2507e4b84","observation_id":"0fdf2081-60a4-45a1-a430-c37636a34c9a","resolution":{"observed_at":"2026-06-27T01:26:41.376368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:26:41.376368Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.17680","last_updated":"2026-06-16T08:48:09Z","snapshot_observed_at":"2026-08-08T02:04:54.343143Z","submitted_at":"2026-06-16T08:48:09Z","title":"EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-27T01:26:41.376368Z"},"links":{"citing_paper":"/paper/2606.17680"},"observation_digest":"sha256:46b3d7952429dda878f30ad9a520928d124440de8ed1eeb0d39d1050c347d735","observation_id":"d078592e-50f5-4632-80e3-02b3fe68a138","resolution":{"observed_at":"2026-06-27T01:26:41.376368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:26:41.376368Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.17680","last_updated":"2026-06-16T08:48:09Z","snapshot_observed_at":"2026-08-08T02:04:54.343143Z","submitted_at":"2026-06-16T08:48:09Z","title":"EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-27T01:26:41.376368Z"},"links":{"citing_paper":"/paper/2606.17680"},"observation_digest":"sha256:0567773ff2077c8397522d9b71b956892a0806f501eeeb29366824bc7da6729f","observation_id":"769e2d20-5573-43b1-bd61-128d919e409b","resolution":{"observed_at":"2026-06-27T01:26:41.376368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13854","last_updated":"2024-04-16T15:13:18Z","snapshot_observed_at":"2026-08-06T12:47:01.809185Z","submitted_at":"2023-07-25T22:59:32Z","title":"WebArena: A Realistic Web Environment for Building Autonomous Agents","version":4},"cited_work":{"arxiv_id":"2307.13854","doi":"10.48550/arxiv.2307.13854","metadata_source":"pith","pith_arxiv_id":"2307.13854","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebArena: A Realistic Web Environment for Building Autonomous Agents","venue":"cs.AI","work_id":"7058ffd2-a339-4102-89eb-248eeb074652","year":2023},"citing_paper":{"arxiv_id":"2606.17680","last_updated":"2026-06-16T08:48:09Z","snapshot_observed_at":"2026-08-08T02:04:54.343143Z","submitted_at":"2026-06-16T08:48:09Z","title":"EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-27T01:26:41.376368Z"},"links":{"cited_paper":"/paper/2307.13854","citing_paper":"/paper/2606.17680"},"observation_digest":"sha256:e49c590d00d2ec02f2c0b49319c99cc7244c9e05b6e37756244d8ec6928c98c5","observation_id":"21a5a225-3d36-443e-9f07-583c5bb9ae1d","resolution":{"observed_at":"2026-07-03T20:18:57.198518Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-20T18:52:18.85917+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T18:52:18.85917+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.17680","last_updated":"2026-06-16T08:48:09Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T02:04:54.343143Z","submitted_at":"2026-06-16T08:48:09Z","title":"EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":28,"verified_exact":18,"verified_fuzzy":0},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 2 inbound Pith citation observations for arXiv:2606.17680."}