{"as_of":"2026-08-15T21:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8a1acb668af0b9b29330c53d78dfbe1c9c31032629b3551377d346587b929d2c","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:55:06.821160Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T09:33:38.485506Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-15T11:55:33.536071Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23127","snapshot_observed_at":"2026-08-04T09:33:38.485506Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:38.485506Z"},"links":{"cited_paper":"/paper/2506.23127","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:086b1c8f28ec6b5588838867a7b1f45691e121b023f27138721f7bd1451dfa87","observation_id":"6f8873d8-e2c1-4d93-b663-d1c42fe201b3","resolution":{"observed_at":"2026-08-04T09:33:38.485506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2506.23127","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23127","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2506.23127 (2025)","venue":null,"work_id":"bf91b32b-e004-49b0-a06a-17823dade7a4","year":2025},"citing_paper":{"arxiv_id":"2604.07774","last_updated":"2026-04-09T04:01:27Z","snapshot_observed_at":"2026-07-06T22:57:00.904627Z","submitted_at":"2026-04-09T04:01:27Z","title":"RoboAgent: Chaining Basic Capabilities for Embodied Task Planning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T18:15:08.727921Z"},"links":{"cited_paper":"/paper/2506.23127","citing_paper":"/paper/2604.07774"},"observation_digest":"sha256:14c968115672dde9b6471bb836024f9d330fc54fb1ee2c92c695040eb94f9d42","observation_id":"d509ff7e-1e52-432c-8d78-a450afbf3bec","resolution":{"observed_at":"2026-05-11T05:15:57.429654Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2506.23127","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23127","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2506.23127 (2025)","venue":null,"work_id":"bf91b32b-e004-49b0-a06a-17823dade7a4","year":2025},"citing_paper":{"arxiv_id":"2604.16331","last_updated":"2026-03-12T17:54:42Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-03-12T17:54:42Z","title":"BrainMem: Brain-Inspired Evolving Memory for Embodied Agent Task Planning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T11:52:58.630590Z"},"links":{"cited_paper":"/paper/2506.23127","citing_paper":"/paper/2604.16331"},"observation_digest":"sha256:59c74236e413eb24de12fd468f9bac54342aaff7beb61a3078ac7aa1f98a11b5","observation_id":"6ce41588-75c6-48de-8f13-a86b0b9fbce5","resolution":{"observed_at":"2026-05-15T11:55:33.538357Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.23127/citation-record","integrity":"/paper/2506.23127/integrity","json":"/paper/2506.23127/citation-record.json","paper":"/paper/2506.23127"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:55:00.415525Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:00.415525Z"},"links":{"citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:680e939bf9e0322da46c177c493bae422d1bb1e741ed0d4de6a1e7f5afe0d0e7","observation_id":"6cddb675-a768-4624-9741-83ba498cb8ce","resolution":{"observed_at":"2026-08-06T21:55:00.415525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05915","last_updated":"2023-10-09T17:58:38Z","snapshot_observed_at":"2026-08-13T05:53:40.193848Z","submitted_at":"2023-10-09T17:58:38Z","title":"FireAct: Toward Language Agent Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05915","snapshot_observed_at":"2026-08-06T21:55:00.459541Z","title":"Fireact: Toward language agent fine-tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:00.459541Z"},"links":{"cited_paper":"/paper/2310.05915","citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:d46c4f5ad7609815b4a4cd63ac894ff8a5337ca270aa83770ba4ddcb3d7a8240","observation_id":"92f03b00-374b-4a14-9c7c-068dcff9429b","resolution":{"observed_at":"2026-08-06T21:55:00.459541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15649","last_updated":"2024-09-13T09:36:18Z","snapshot_observed_at":"2026-08-13T05:17:14.569117Z","submitted_at":"2023-11-27T09:20:23Z","title":"RoboGPT: an intelligent agent of making embodied long-term decisions for daily instruction tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15649","snapshot_observed_at":"2026-08-06T21:55:00.505894Z","title":"Robogpt: an intelligent agent of making embodied long-term decisions for daily instruction tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:00.505894Z"},"links":{"cited_paper":"/paper/2311.15649","citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:764d9fda22c0bf28518d528c292d20916c2144d80df842f0bc46decbb4c23d09","observation_id":"44fdcf0d-5700-463d-831e-9d8541d497c4","resolution":{"observed_at":"2026-08-06T21:55:00.505894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-13T05:17:50.537148Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10325","snapshot_observed_at":"2026-08-06T21:55:00.569399Z","title":"Process reward models for LLM agents: Practical framework and directions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:00.569399Z"},"links":{"cited_paper":"/paper/2502.10325","citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:8d5e21103983fb4f1bea20d0b11d0e427387202543da4984a3f5f9ed6ea1ec71","observation_id":"46e7171b-ec46-4bee-b76d-f05f0060db78","resolution":{"observed_at":"2026-08-06T21:55:00.569399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-15T17:27:11.980940Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T21:55:00.616168Z","title":"Zhang, Han Bao, Hanwei Xu, Haocheng Wang, Haowei Zhang, Honghui Ding, Huajian Xin, Huazuo Gao, Hui Li, Hui Qu, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:00.616168Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:463492a882be9a97b344456530f32d94572fdb2fae63a97da26eeb45d24eec24","observation_id":"30bfaac9-0107-4ba4-9eac-9899aff3e25f","resolution":{"observed_at":"2026-08-06T21:55:00.616168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2022.31411","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:55:07.636976Z","title":"A survey of embodied AI: from simulators to research tasks","venue":null,"work_id":"a1256a43-a977-4115-b594-873fc46ac6d4","year":2022},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:00.719237Z"},"links":{"citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:e7eb0f0bafed3a44373c1bdc65308d7c06f4c8909e9cdb26ee2ba440ee75d89b","observation_id":"291326ee-5722-4bd0-baa2-1e87c5d81ee1","resolution":{"observed_at":"2026-08-06T21:55:07.711625Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:55:10.422688Z","title":null,"venue":null,"work_id":"13825852-07b4-48c5-aef2-3d7e50423e04","year":1979},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:00.774975Z"},"links":{"citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:be3ba8616cd225dab0b6383c976fb63e3fef3972b150f3c27dfa31ca7536aa0f","observation_id":"b2be25ea-7c01-4204-a2c6-394fa2d1dabf","resolution":{"observed_at":"2026-08-06T21:55:10.547481Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:55:10.195187Z","title":"Chawla, Olaf Wiest, and Xiangliang Zhang","venue":null,"work_id":"130fea09-8640-4590-844e-8c192e327f01","year":2024},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:00.836354Z"},"links":{"citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:b578ea412c37e38422ab0b5cbaaa027091b1df787a825423df33c264ebd84e45","observation_id":"99b878b9-8cba-4204-9b4c-e37587f6fd7a","resolution":{"observed_at":"2026-08-06T21:55:10.308737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-08-12T18:49:18.486177Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-06T21:55:00.918119Z","title":"Open-reasoner-zero: An open source approach to scaling up reinforcement learning on the base model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:00.918119Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:0c243ac8398c4f9f6b420e66d1ab012808eda99d0a24c8ac42482707242e6699","observation_id":"0311ce09-d251-483a-b835-3ca4da948942","resolution":{"observed_at":"2026-08-06T21:55:00.918119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21383","last_updated":"2025-03-27T11:25:22Z","snapshot_observed_at":"2026-08-13T06:50:48.515118Z","submitted_at":"2025-03-27T11:25:22Z","title":"Controlling Large Language Model with Latent Actions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21383","snapshot_observed_at":"2026-08-06T21:55:01.009132Z","title":"Controlling large language model with latent actions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:01.009132Z"},"links":{"cited_paper":"/paper/2503.21383","citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:dfcf0f03d50ac24824046948c41c12487035108e1a2157b312f060d1c001a569","observation_id":"11797ada-e311-4259-bce7-bb4206757cc2","resolution":{"observed_at":"2026-08-06T21:55:01.009132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-08-15T13:17:00.526689Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-06T21:55:01.078098Z","title":"Search-r1: Training llms to reason and leverage search engines with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:01.078098Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:88d0b912a71872fa3fed2aa77a95a5ee3110b26ffcea27dd76fba001c275ea5d","observation_id":"e10d8081-b76b-49ce-8a53-2cfd8c19ab6c","resolution":{"observed_at":"2026-08-06T21:55:01.078098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05366","last_updated":"2025-01-09T16:48:17Z","snapshot_observed_at":"2026-08-15T17:19:59.096854Z","submitted_at":"2025-01-09T16:48:17Z","title":"Search-o1: Agentic Search-Enhanced Large Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05366","snapshot_observed_at":"2026-08-06T21:55:01.138159Z","title":"Search-o1: Agentic search-enhanced large reasoning models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:01.138159Z"},"links":{"cited_paper":"/paper/2501.05366","citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:693fe141a7ee90e9d4a79256bc8f7d5060572c5a902cfb24a4bdb99d4cf4784b","observation_id":"349398af-d142-4647-8926-ff5acfa64ff4","resolution":{"observed_at":"2026-08-06T21:55:01.138159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17419","last_updated":"2025-06-25T02:24:46Z","snapshot_observed_at":"2026-08-10T09:42:17.185681Z","submitted_at":"2025-02-24T18:50:52Z","title":"From System 1 to System 2: A Survey of Reasoning Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17419","snapshot_observed_at":"2026-08-06T21:55:01.191538Z","title":"From system 1 to system 2: A survey of reasoning large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:01.191538Z"},"links":{"cited_paper":"/paper/2502.17419","citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:ce051e250b1215f3bccef9b445b36ae7e7623195bae4c1d4f96df87d92b827fe","observation_id":"0f53b722-1eae-4f6b-a001-79151293c5cb","resolution":{"observed_at":"2026-08-06T21:55:01.191538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:55:01.255445Z","title":"Let's verify step by step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:01.255445Z"},"links":{"citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:28854275d41bc0011e3ad0507ccdf5cd9aa1225a6106ebcfbe6d5ef8d5a783c3","observation_id":"7654a8ce-2bd2-4e0f-b883-0fd401de6487","resolution":{"observed_at":"2026-08-06T21:55:01.255445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02584","last_updated":"2025-02-04T18:58:31Z","snapshot_observed_at":"2026-08-13T13:42:11.974932Z","submitted_at":"2025-02-04T18:58:31Z","title":"QLASS: Boosting Language Agent Inference via Q-Guided Stepwise Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02584","snapshot_observed_at":"2026-08-06T21:55:01.328590Z","title":"Qlass: Boosting language agent inference via q-guided stepwise search","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:01.328590Z"},"links":{"cited_paper":"/paper/2502.02584","citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:b289b24122ccf884c165098bd17bc3375e70864c151c73793499bb387d9ca8bc","observation_id":"c80cf3bd-6b7e-4a89-9abc-fc7703a8b8a9","resolution":{"observed_at":"2026-08-06T21:55:01.328590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06886","last_updated":"2025-08-25T02:20:09Z","snapshot_observed_at":"2026-08-12T23:25:48.824729Z","submitted_at":"2024-07-09T14:14:47Z","title":"Aligning Cyber Space with Physical World: A Comprehensive Survey on Embodied AI","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06886","snapshot_observed_at":"2026-08-06T21:55:01.382412Z","title":"Aligning cyber space with physical world: A comprehensive survey on embodied AI","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:01.382412Z"},"links":{"cited_paper":"/paper/2407.06886","citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:e792f4c837f55cf5401eb1678facdf69f79b1df99e7cffa76c2833b85a152365","observation_id":"cdef8133-077c-4f9b-82d3-ff157b6b2c48","resolution":{"observed_at":"2026-08-06T21:55:01.382412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06520","last_updated":"2026-05-31T09:29:40Z","snapshot_observed_at":"2026-08-07T17:19:13.101842Z","submitted_at":"2025-03-09T08:48:51Z","title":"Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06520","snapshot_observed_at":"2026-08-06T21:55:01.440500Z","title":"Seg-zero: Reasoning-chain guided segmentation via cognitive reinforcement","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:01.440500Z"},"links":{"cited_paper":"/paper/2503.06520","citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:f67418fa25889733a11984247e174c1e942cb29bc7b258af8a83d43d1d541b3f","observation_id":"1a76f25c-b45c-473e-ba67-e1b922a9e1ea","resolution":{"observed_at":"2026-08-06T21:55:01.440500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09583","last_updated":"2025-06-04T08:58:56Z","snapshot_observed_at":"2026-08-02T06:48:43.121988Z","submitted_at":"2023-08-18T14:23:21Z","title":"WizardMath: Empowering Mathematical Reasoning for Large Language Models via Reinforced Evol-Instruct","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09583","snapshot_observed_at":"2026-08-06T21:55:01.518390Z","title":"Wizardmath: Empowering mathematical reasoning for large language models via reinforced evol-instruct","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:01.518390Z"},"links":{"cited_paper":"/paper/2308.09583","citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:370b177dabe84155721ff58a94c908b02f735f60bbbff154360786352a107213","observation_id":"aa62b6a0-3e2f-4f47-9455-ecab2d1090bc","resolution":{"observed_at":"2026-08-06T21:55:01.518390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06781","snapshot_observed_at":"2026-08-06T21:55:01.685340Z","title":"Exploring the limit of outcome reward for learning mathematical reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:01.685340Z"},"links":{"cited_paper":"/paper/2502.06781","citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:43f02838e584bf690e8e914f6cac66fd57b41c7b6e77afff92c60094c75c6110","observation_id":"69dcfd01-d48e-4d21-85dd-be3372de2929","resolution":{"observed_at":"2026-08-06T21:55:01.685340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:55:10.026263Z","title":"FILM: following instructions in language with modular methods","venue":null,"work_id":"01a3aaf3-684c-4530-9e73-dfd221afd2c5","year":2022},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:01.804811Z"},"links":{"citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:e9c00a9a0e73933f344691866cb76f5146d780e101c5e30ba3f314f5b11ffce5","observation_id":"6f85de20-9000-4cc6-82a2-35398d56805f","resolution":{"observed_at":"2026-08-06T21:55:10.129092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:55:09.899045Z","title":"Skill set optimization: Reinforcing language model behavior via transferable skills","venue":null,"work_id":"0a97a393-9dd1-4d7b-9af3-7a8e61c27ff7","year":2024},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:01.956591Z"},"links":{"citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:23d29c843cf7dd4af60aa43ead18133d043571577264bd3e6935d272a4c37828","observation_id":"b199611a-4214-4d9e-8e4f-d1d02f70d8b6","resolution":{"observed_at":"2026-08-06T21:55:09.926905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T21:55:02.134672Z","title":"GPT-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:02.134672Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:3dafecd9c1690ecfae80516be5be691a249aa9fbce2098b2988962cef0f832ed","observation_id":"372079f1-79b5-4900-9ebb-f38615bd7ee4","resolution":{"observed_at":"2026-08-06T21:55:02.134672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19634","last_updated":"2025-03-19T13:55:33Z","snapshot_observed_at":"2026-08-07T20:37:56.716831Z","submitted_at":"2025-02-26T23:57:34Z","title":"MedVLM-R1: Incentivizing Medical Reasoning Capability of Vision-Language Models (VLMs) via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19634","snapshot_observed_at":"2026-08-06T21:55:02.328497Z","title":"Medvlm-r1: Incentivizing medical reasoning capability of vision-language models (vlms) via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:02.328497Z"},"links":{"cited_paper":"/paper/2502.19634","citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:c090276f3b8b89284dea6da4b1abca9b9052810560eae6737ec2943a850cd36a","observation_id":"dbde38d3-4b95-4ad0-9163-63e5af4152cf","resolution":{"observed_at":"2026-08-06T21:55:02.328497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.07199","last_updated":"2024-08-13T20:52:13Z","snapshot_observed_at":"2026-08-14T15:46:52.927758Z","submitted_at":"2024-08-13T20:52:13Z","title":"Agent Q: Advanced Reasoning and Learning for Autonomous AI Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.07199","snapshot_observed_at":"2026-08-06T21:55:02.476705Z","title":"Agent Q: advanced reasoning and learning for autonomous AI agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:02.476705Z"},"links":{"cited_paper":"/paper/2408.07199","citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:d7e10d5acd0bd31912d3cc092799f41e6cbcaba00036ebf71dd9e1d847e6afa1","observation_id":"edfb6089-6ce5-4682-bddf-b787eb2e14f1","resolution":{"observed_at":"2026-08-06T21:55:02.476705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:55:09.661960Z","title":"Agent planning with world knowledge model","venue":null,"work_id":"d26cba8d-8792-4e4e-8ecc-c50e40975d40","year":2024},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:02.602431Z"},"links":{"citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:9fdc52d02bfeee4012e0cf1daf1f437b98024005fc996f5f270cd1b9f94a582e","observation_id":"928ca13b-4213-46a8-af18-cdbadaa4124d","resolution":{"observed_at":"2026-08-06T21:55:09.836841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:55:09.571123Z","title":"Tarr, William W","venue":null,"work_id":"dd8f988a-11d5-4537-b29d-06b25d28b86b","year":2024},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:02.766309Z"},"links":{"citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:61877c1a65b97e1e969d5f9dda1ac5d3f92acd68c5aebec57800e87d4fcc33d6","observation_id":"773b8528-02e7-4ffa-a46f-d9bbb0d3cf37","resolution":{"observed_at":"2026-08-06T21:55:09.612395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T21:55:02.882464Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:02.882464Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:d1075bf50be638ff62c81b8d2636e115c424b0614fdae8c159b41822cf10a94b","observation_id":"cc6260ec-5258-4a64-8d1a-6880233e3d7f","resolution":{"observed_at":"2026-08-06T21:55:02.882464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:55:09.384937Z","title":"Reflexion: language agents with verbal reinforcement learning","venue":null,"work_id":"2ad54149-3d99-4de0-939f-c56cc5a234e3","year":2023},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:03.022168Z"},"links":{"citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:45700371ddbda67bddf2cebc31ee420fbe68b58c7a27f8df64e948fd0c760058","observation_id":"b84dae45-9bbd-4e05-a1fb-2582714e1b90","resolution":{"observed_at":"2026-08-06T21:55:09.485186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:55:09.156945Z","title":"Hausknecht","venue":null,"work_id":"c2ebe0d8-91ef-4704-91ce-5a135f190c20","year":2021},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:03.145214Z"},"links":{"citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:68f1b6b50af0b08746d60262e45a0ff224a080e510f27d3fb7d79e6cea86ee67","observation_id":"88014892-07ad-4018-b6ef-a7cb5a6f0324","resolution":{"observed_at":"2026-08-06T21:55:09.246865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:55:08.853128Z","title":"Agentbank: Towards generalized LLM agents via fine-tuning on 50000+ interaction trajectories","venue":null,"work_id":"81dc6998-228b-4511-8876-668e6531058f","year":2024},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:03.254321Z"},"links":{"citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:56358d3c7b03d693ffd2c86049e9cd99bc69ab866f4e98100b8259fc3dbbfea0","observation_id":"f57c87d5-c1e2-472e-a7fe-5c3815e962c6","resolution":{"observed_at":"2026-08-06T21:55:09.007938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02502","last_updated":"2024-07-10T17:36:25Z","snapshot_observed_at":"2026-08-13T04:03:34.485741Z","submitted_at":"2024-03-04T21:50:29Z","title":"Trial and Error: Exploration-Based Trajectory Optimization for LLM Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02502","snapshot_observed_at":"2026-08-06T21:55:03.345545Z","title":"Trial and error: Exploration-based trajectory optimization for LLM agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:03.345545Z"},"links":{"cited_paper":"/paper/2403.02502","citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:276fe443c132d57d17555bcb9f5f2c98efc8c95af4fbc3d2b33415042e86cb4f","observation_id":"30ea569b-757d-4043-b333-015c580c87eb","resolution":{"observed_at":"2026-08-06T21:55:03.345545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:55:08.652681Z","title":"Adaplanner: Adaptive planning from feedback with language models","venue":null,"work_id":"b07875d1-6048-4c62-8e59-ac736d97cae8","year":2023},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:03.469279Z"},"links":{"citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:6beec97a566860ea17c92dea4e9f925b01bc462259fa1c169d00a83083927d20","observation_id":"8b9603a2-5159-4b2b-a17b-79b7fc87cc1c","resolution":{"observed_at":"2026-08-06T21:55:08.746627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11562","last_updated":"2024-01-25T11:20:16Z","snapshot_observed_at":"2026-08-13T05:00:02.394747Z","submitted_at":"2023-12-17T15:16:13Z","title":"A Survey of Reasoning with Foundation Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11562","snapshot_observed_at":"2026-08-06T21:55:03.633102Z","title":"A survey of reasoning with foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:03.633102Z"},"links":{"cited_paper":"/paper/2312.11562","citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:74a64d6bbae98d9662db1bc04bfd6d10a55d9033347dbd1b934232e0d6af9ef1","observation_id":"82d41c2d-4246-44ec-bca0-328c26073f9f","resolution":{"observed_at":"2026-08-06T21:55:03.633102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17297","last_updated":"2024-03-26T00:53:24Z","snapshot_observed_at":"2026-08-12T16:46:46.561976Z","submitted_at":"2024-03-26T00:53:24Z","title":"InternLM2 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17297","snapshot_observed_at":"2026-08-06T21:55:03.793236Z","title":"Internlm2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:03.793236Z"},"links":{"cited_paper":"/paper/2403.17297","citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:4b1e2619b01f83dc47e0b1209d84822403b5ce6fc35906730cc37d33cfb7c3e2","observation_id":"4237dab2-8f17-4de4-8124-79efe558c357","resolution":{"observed_at":"2026-08-06T21:55:03.793236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-11T01:31:26.242281Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-06T21:55:03.920658Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:03.920658Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:6866dc968acda103227da4fd8def40e360d23ad2a9c4047ff55d1741745fe0b4","observation_id":"70f59dfc-0d62-4f21-802e-c5b1c646d098","resolution":{"observed_at":"2026-08-06T21:55:03.920658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14276","last_updated":"2025-05-29T16:13:21Z","snapshot_observed_at":"2026-08-09T14:56:05.826713Z","submitted_at":"2025-02-20T05:28:44Z","title":"STeCa: Step-level Trajectory Calibration for LLM Agent Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14276","snapshot_observed_at":"2026-08-06T21:55:04.117987Z","title":"Steca: Step-level trajectory calibration for llm agent learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:04.117987Z"},"links":{"cited_paper":"/paper/2502.14276","citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:11d9c49e45a6d646a2f41b2ef190f06bafc23d841b0ce1e6d216a313daec1b96","observation_id":"5c6d6211-4907-4e1e-afef-1f97b687be2d","resolution":{"observed_at":"2026-08-06T21:55:04.117987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16145","last_updated":"2024-12-25T18:54:02Z","snapshot_observed_at":"2026-08-14T19:52:44.391384Z","submitted_at":"2024-12-20T18:49:45Z","title":"Offline Reinforcement Learning for LLM Multi-Step Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16145","snapshot_observed_at":"2026-08-06T21:55:04.280984Z","title":"Offline reinforcement learning for LLM multi-step reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:04.280984Z"},"links":{"cited_paper":"/paper/2412.16145","citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:18bbde6f5702095128cd26c8851190232285b1fb5ce8e0019cf5cd6dad98459a","observation_id":"3c787b02-2301-4e54-b8de-08a800880ea4","resolution":{"observed_at":"2026-08-06T21:55:04.280984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11651","last_updated":"2024-04-16T11:41:13Z","snapshot_observed_at":"2026-08-13T04:15:58.961468Z","submitted_at":"2024-02-18T17:10:07Z","title":"Learning From Failure: Integrating Negative Examples when Fine-tuning Large Language Models as Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11651","snapshot_observed_at":"2026-08-06T21:55:04.444807Z","title":"Learning from failure: Integrating negative examples when fine-tuning large language models as agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:04.444807Z"},"links":{"cited_paper":"/paper/2402.11651","citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:9f1006fc539316b5f6d491c05995e622c338434c1799afe6033443d523b4ba05","observation_id":"73074153-2e5e-44f9-81ac-73f5cfc3c85f","resolution":{"observed_at":"2026-08-06T21:55:04.444807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:55:04.517618Z","title":"Jansen, Marc - Alexandre C \\^ o t \\' e , and Prithviraj Ammanabrolu","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:04.517618Z"},"links":{"citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:ce2c0d5e6e71c32fe34bc7598516a5f85367159c92c9dfd6883ccefd7db264bb","observation_id":"779b1c05-6328-4b05-ab3b-ac7f085a7e96","resolution":{"observed_at":"2026-08-06T21:55:04.517618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10480","last_updated":"2025-03-13T15:49:56Z","snapshot_observed_at":"2026-08-12T19:07:01.752580Z","submitted_at":"2025-03-13T15:49:56Z","title":"World Modeling Makes a Better Planner: Dual Preference Optimization for Embodied Task Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10480","snapshot_observed_at":"2026-08-06T21:55:04.621217Z","title":"World modeling makes a better planner: Dual preference optimization for embodied task planning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:04.621217Z"},"links":{"cited_paper":"/paper/2503.10480","citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:95192dcda7e9c0cab44291a3da559dd8c643dac88ec3bdaad56004c22db07c55","observation_id":"4f8e557f-9eeb-46fc-bf09-8e1b78caf713","resolution":{"observed_at":"2026-08-06T21:55:04.621217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01560","last_updated":"2024-07-08T05:56:47Z","snapshot_observed_at":"2026-08-02T14:50:04.461434Z","submitted_at":"2023-02-03T06:06:27Z","title":"Describe, Explain, Plan and Select: Interactive Planning with Large Language Models Enables Open-World Multi-Task Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.01560","snapshot_observed_at":"2026-08-06T21:55:04.695626Z","title":"Describe, explain, plan and select: Interactive planning with large language models enables open-world multi-task agents","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:04.695626Z"},"links":{"cited_paper":"/paper/2302.01560","citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:8f4eb620e90e627fc2a79d0ff621a693e6c1adceb56f7ad11ad8570ffc6179dd","observation_id":"bb23b17a-7f74-443f-85ac-367da61f1473","resolution":{"observed_at":"2026-08-06T21:55:04.695626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:55:04.775703Z","title":"Chi, Quoc V","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:04.775703Z"},"links":{"citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:0dba11fd30518eeabbdca150ece133baab91ca51879e83b76c13fea743df0b5b","observation_id":"36fc8b99-1a2c-46e7-ad87-53556fddc0e6","resolution":{"observed_at":"2026-08-06T21:55:04.775703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04151","last_updated":"2024-06-06T15:15:41Z","snapshot_observed_at":"2026-08-12T23:48:41.258216Z","submitted_at":"2024-06-06T15:15:41Z","title":"AgentGym: Evolving Large Language Model-based Agents across Diverse Environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04151","snapshot_observed_at":"2026-08-06T21:55:04.850713Z","title":"Agentgym: Evolving large language model-based agents across diverse environments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:04.850713Z"},"links":{"cited_paper":"/paper/2406.04151","citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:374c6217bffea97704b909598dd5fbcf1528112af646ae5357ee2e4b971d68f4","observation_id":"9312c6b6-0e23-4cd2-bc03-6d4bc44f2aa1","resolution":{"observed_at":"2026-08-06T21:55:04.850713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:55:04.969618Z","title":"The rise and potential of large language model based agents: a survey","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:04.969618Z"},"links":{"citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:bc7c5d941d0a4aa88c44b30a312391a5abc099b27d0a2b166037fc58b4af89f3","observation_id":"f3f216b5-4b4e-4209-a147-8f13ab461ca9","resolution":{"observed_at":"2026-08-06T21:55:04.969618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14768","last_updated":"2025-02-20T17:49:26Z","snapshot_observed_at":"2026-08-15T06:02:45.207770Z","submitted_at":"2025-02-20T17:49:26Z","title":"Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14768","snapshot_observed_at":"2026-08-06T21:55:05.071076Z","title":"Logic-rl: Unleashing LLM reasoning with rule-based reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:05.071076Z"},"links":{"cited_paper":"/paper/2502.14768","citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:726445233c8d20bbb30c328d83a4e2958c36a261639d8fe4d324aa725f43430b","observation_id":"fbba7441-fa9f-4444-943d-2d1116594347","resolution":{"observed_at":"2026-08-06T21:55:05.071076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:55:05.154163Z","title":"Watch every step! LLM agent learning via iterative step-level process refinement","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:05.154163Z"},"links":{"citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:e9be8cf97e03f6138f4e0f29aa651fc9ccd602497e52c437007ae1a55d8013d7","observation_id":"9a401f42-8a84-4a96-85aa-d93346523a38","resolution":{"observed_at":"2026-08-06T21:55:05.154163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:55:08.461666Z","title":"Watch every step! LLM agent learning via iterative step-level process refinement","venue":null,"work_id":"3a4fa6e9-0259-4624-b812-299c116037e9","year":2024},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:05.239959Z"},"links":{"citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:d233ae2766f52d41a12d390647b4f6315f0d77f8f5c95329bd0f2f0ac66ba26f","observation_id":"61f5e7dc-8d9f-4914-9e8b-0a5c6114f23a","resolution":{"observed_at":"2026-08-06T21:55:08.527617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T21:55:05.303985Z","title":"Qwen2.5 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:05.303985Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:297be37f91b45117d3ecab4d3d8fefb3052733f95251aecaa4a18e1c580e32c1","observation_id":"5ea0e976-666d-420d-a67b-5d90bd1ddfdc","resolution":{"observed_at":"2026-08-06T21:55:05.303985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16670","last_updated":"2024-10-22T03:59:53Z","snapshot_observed_at":"2026-08-12T22:17:56.081260Z","submitted_at":"2024-10-22T03:59:53Z","title":"CoPS: Empowering LLM Agents with Provable Cross-Task Experience Sharing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16670","snapshot_observed_at":"2026-08-06T21:55:05.375408Z","title":"Cops: Empowering LLM agents with provable cross-task experience sharing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:05.375408Z"},"links":{"cited_paper":"/paper/2410.16670","citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:cfdbbe8bdb1bc2a7c9fe591a3d11dfd3fae154b9367b1ea53be8ded8ef06edef","observation_id":"8c0eeca8-6703-4643-aacd-fdc1955a67d2","resolution":{"observed_at":"2026-08-06T21:55:05.375408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:55:05.442339Z","title":"Narasimhan, and Yuan Cao","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:05.442339Z"},"links":{"citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:4575056c9fa79b14c5e13f6b756f1fab7be67b5000c61e7b64d43194cac59263","observation_id":"b4c4ce4d-1dc0-4c3b-9edb-93ffd23c3513","resolution":{"observed_at":"2026-08-06T21:55:05.442339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:55:08.203681Z","title":"N., Zeyuan Chen, Jianguo Zhang, Devansh Arpit, Ran Xu, Phil Mui, Huan Wang, Caiming Xiong, and Silvio Savarese","venue":null,"work_id":"5998710f-1c02-4af5-8093-6ced299e8f35","year":2024},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:05.501822Z"},"links":{"citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:e0a6b06c3c9ea9473d370111ade71d99013abe5b1e8e955d67f23af5795cbc93","observation_id":"31beb251-bf4e-4270-a5cf-b1ac54fdd52f","resolution":{"observed_at":"2026-08-06T21:55:08.312149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:55:05.594415Z","title":"Agent lumos: Unified and modular training for open-source language agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:05.594415Z"},"links":{"citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:ce54e8d6f03e8b8bd2442255e7b780fcdc7f6eb0bd8cf90113d61d9d2579cac8","observation_id":"3848eb40-f0f0-4ab3-af49-cebe1ec2661c","resolution":{"observed_at":"2026-08-06T21:55:05.594415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06332","last_updated":"2024-05-24T07:09:21Z","snapshot_observed_at":"2026-08-13T04:22:39.632135Z","submitted_at":"2024-02-09T11:22:08Z","title":"InternLM-Math: Open Math Large Language Models Toward Verifiable Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06332","snapshot_observed_at":"2026-08-06T21:55:05.725140Z","title":"Internlm-math: Open math large language models toward verifiable reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:05.725140Z"},"links":{"cited_paper":"/paper/2402.06332","citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:c2de50985ee65621dbfbbf777ded9e0028fcaffa4dbffda65cb2ebe3e98188d7","observation_id":"8084ff0b-4e90-42fa-bc50-6cd0ad92309c","resolution":{"observed_at":"2026-08-06T21:55:05.725140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-15T17:10:35.014170Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11425","snapshot_observed_at":"2026-08-06T21:55:05.817610Z","title":"Agent-r: Training language model agents to reflect via iterative self-training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:05.817610Z"},"links":{"cited_paper":"/paper/2501.11425","citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:8095187064a634258ea3eff4e8ec0967716091f458ebee309def8307f2082e95","observation_id":"60ac31f0-aca5-4678-9ad2-e093e0cffafa","resolution":{"observed_at":"2026-08-06T21:55:05.817610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:55:05.980261Z","title":"Agenttuning: Enabling generalized agent abilities for llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:05.980261Z"},"links":{"citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:3336afe763a94a4ce005d20a5eb0d82050a065bf9d4d26e07c6cf52723c796cf","observation_id":"cd366988-da8b-4428-9b9e-d5d54b3591c0","resolution":{"observed_at":"2026-08-06T21:55:05.980261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v39i25.34924","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Enhancing decision-making for LLM agents via step-level q-value models","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"24b4fe40-023c-48cd-a99f-3f91e424de60","year":2025},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:06.053884Z"},"links":{"citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:7305a4e79db9c7882d44b5c9a5d26193ac42a487e94a55502cf1b660d20ff55d","observation_id":"ac810c3d-7994-44d2-a01e-d81a1b9d02c9","resolution":{"observed_at":"2026-08-06T21:55:07.075035Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:55:08.018062Z","title":"Large language models as commonsense knowledge for large-scale task planning","venue":null,"work_id":"d13e429f-5b5a-47d2-a645-bb19b8cb6a34","year":2023},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:06.177700Z"},"links":{"citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:f9348f74371cb2f78e9384a5af1a19adea092bb3eda8f75b69f9260297f7c715","observation_id":"cfa7755b-703c-4908-98a1-9002c37c780e","resolution":{"observed_at":"2026-08-06T21:55:08.111874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03160","last_updated":"2025-04-17T04:46:08Z","snapshot_observed_at":"2026-08-15T04:33:35.062486Z","submitted_at":"2025-04-04T04:41:28Z","title":"DeepResearcher: Scaling Deep Research via Reinforcement Learning in Real-world Environments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.03160","snapshot_observed_at":"2026-08-06T21:55:06.305305Z","title":"Deepresearcher: Scaling deep research via reinforcement learning in real-world environments, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:06.305305Z"},"links":{"cited_paper":"/paper/2504.03160","citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:93f92baed4d24f421c503e0298c0c4fdbb1d234f535985b6aa6e94886e921370","observation_id":"c298c002-3bf0-4527-bdd5-9f85043486d1","resolution":{"observed_at":"2026-08-06T21:55:06.305305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07870","last_updated":"2023-12-12T04:47:21Z","snapshot_observed_at":"2026-08-13T19:07:57.883096Z","submitted_at":"2023-09-14T17:18:25Z","title":"Agents: An Open-source Framework for Autonomous Language Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07870","snapshot_observed_at":"2026-08-06T21:55:06.427751Z","title":"Agents: An open-source framework for autonomous language agents","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:06.427751Z"},"links":{"cited_paper":"/paper/2309.07870","citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:949d35c4b2e1758468f6d9efcaf7d5457b2e41da1fa050bb42b5f16bb84d4220","observation_id":"606cad4c-3865-416f-8d17-7281ef795196","resolution":{"observed_at":"2026-08-06T21:55:06.427751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:55:07.858895Z","title":"K now A gent: Knowledge-augmented planning for LLM -based agents","venue":null,"work_id":"87e6334f-54c4-44fa-b838-164960cfaa41","year":2025},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:06.534526Z"},"links":{"citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:5fea340c8d9f4ad58a4328ab40cb5f93cfba99fd771c64bfb71fd802ff3d298f","observation_id":"5861ae12-b48c-443d-b637-12da6f2d9901","resolution":{"observed_at":"2026-08-06T21:55:07.941110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:55:06.577975Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:06.577975Z"},"links":{"citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:1a4c0f182184f00ee37235ae2a6f11dfef61b01e5460a05ac9dad53e063a5e26","observation_id":"61970ca3-7b6b-4135-9bf8-8e1a78af80fc","resolution":{"observed_at":"2026-08-06T21:55:06.577975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:55:06.675280Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:06.675280Z"},"links":{"citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:5459ff9556d373f207c9a893481e73222978214164b81b9ca9b22ed97eb0486e","observation_id":"bb9523f3-12e8-4d73-a115-2a0433ca4c7a","resolution":{"observed_at":"2026-08-06T21:55:06.675280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:55:06.732398Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:06.732398Z"},"links":{"citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:bb3fba06371273c0de790d87a57170979e2b8c517da1b9d83906549f6b4d43dd","observation_id":"048ecf1a-75c5-496b-94d8-7d7281645b8f","resolution":{"observed_at":"2026-08-06T21:55:06.732398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T21:55:06.821160Z","title":"K now A gent: Knowledge-Augmented Planning for LLM -Based Agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:06.821160Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:d1cbe5c0356e2e1f737b69158ed4118c1e1acd3d549d56a50ebc7e91f434d703","observation_id":"6f087a48-75c0-4512-99f8-8e14c8b6bd0f","resolution":{"observed_at":"2026-08-06T21:55:06.821160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":49,"verified_exact":1,"verified_fuzzy":13},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 3 inbound Pith citation observations for arXiv:2506.23127."}