{"as_of":"2026-08-11T19:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d26ce9bd9177f17adc2c0ed9617c0175a5c622358d436f153e0bb2994dd7c75f","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T09:33:42.644462Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-14T17:54:50.325820Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-14T17:57:33.302151Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2510.14828","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.14828","snapshot_observed_at":"2026-06-10T02:12:36.666320Z","title":"arXiv preprint arXiv:2510.14828 , year=","venue":null,"work_id":"b462609e-d6c3-40a8-923f-02727828bed6","year":2025},"citing_paper":{"arxiv_id":"2604.07774","last_updated":"2026-04-09T04:01:27Z","snapshot_observed_at":"2026-07-06T22:57:00.904627Z","submitted_at":"2026-04-09T04:01:27Z","title":"RoboAgent: Chaining Basic Capabilities for Embodied Task Planning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-10T18:15:08.727921Z"},"links":{"cited_paper":"/paper/2510.14828","citing_paper":"/paper/2604.07774"},"observation_digest":"sha256:b7928fd2e4d55744ab553039b9c3f3faa0654e6f964cb53d3f5d8e07322cf975","observation_id":"5929a515-634a-42c3-bd96-e4cbe4d82e70","resolution":{"observed_at":"2026-06-10T02:12:36.666320Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2510.14828","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.14828","snapshot_observed_at":"2026-06-10T02:12:36.666320Z","title":"arXiv preprint arXiv:2510.14828 , year=","venue":null,"work_id":"b462609e-d6c3-40a8-923f-02727828bed6","year":2025},"citing_paper":{"arxiv_id":"2605.13775","last_updated":"2026-05-13T16:54:36Z","snapshot_observed_at":"2026-07-06T23:25:16.229144Z","submitted_at":"2026-05-13T16:54:36Z","title":"RoboEvolve: Co-Evolving Planner-Simulator for Robotic Manipulation with Limited Data","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-14T17:54:50.325820Z"},"links":{"cited_paper":"/paper/2510.14828","citing_paper":"/paper/2605.13775"},"observation_digest":"sha256:388b1c5059ba91b267bacec9f530e58a58c7d6cf539feaac6d9e6b24b0bbadc5","observation_id":"6a75c318-e443-42ec-9013-e5b95c201d67","resolution":{"observed_at":"2026-06-10T02:12:36.666320Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2510.14828/citation-record","integrity":"/paper/2510.14828/integrity","json":"/paper/2510.14828/citation-record.json","paper":"/paper/2510.14828"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:33:37.164763Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:37.164763Z"},"links":{"citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:cc7330cf845d7e2be8330a5917419e126ef27ea7de18c23844d52cbaa509a156","observation_id":"9f77073e-0b7e-4236-8853-8e31202b484e","resolution":{"observed_at":"2026-08-04T09:33:37.164763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:33:37.248595Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:37.248595Z"},"links":{"citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:8e97f6bfdebab244e45a87207d22d79d6d52ba19a6912545591dcd38343804b6","observation_id":"f6499bf0-acd5-4286-ad8a-4f31473a4172","resolution":{"observed_at":"2026-08-04T09:33:37.248595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-04T09:33:37.334499Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:37.334499Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:43b79b87a0547367154d8499948502d1aa4e0ffe8fe90283bbe33fbd998c794c","observation_id":"a5cdd6ee-f146-4902-ab57-b49252306109","resolution":{"observed_at":"2026-08-04T09:33:37.334499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:33:37.421925Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:37.421925Z"},"links":{"citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:aba1bc102ef0f97aa371b1c5816c093506eb4b97097df63a64fee43dc88af1ac","observation_id":"1c1435f5-dac0-425b-a2bd-3c3b35d214b8","resolution":{"observed_at":"2026-08-04T09:33:37.421925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11896","last_updated":"2024-06-14T17:49:55Z","snapshot_observed_at":"2026-08-09T00:37:01.766934Z","submitted_at":"2024-06-14T17:49:55Z","title":"DigiRL: Training In-The-Wild Device-Control Agents with Autonomous Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11896","snapshot_observed_at":"2026-08-04T09:33:37.516249Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:37.516249Z"},"links":{"cited_paper":"/paper/2406.11896","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:0e87c5dd672fe009db081b30a5a792b389d6d66c472c844321d1f32502a37e68","observation_id":"47da6e38-1052-4529-9f20-6bc6fe3661f4","resolution":{"observed_at":"2026-08-04T09:33:37.516249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:33:37.596870Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:37.596870Z"},"links":{"citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:d11b8b25cee94cc054ed498de91787736d718773014b7b222fff430a38001d9a","observation_id":"cc88a67d-9a4b-462d-a8cf-84457bdf72d5","resolution":{"observed_at":"2026-08-04T09:33:37.596870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13243","last_updated":"2026-04-17T23:12:55Z","snapshot_observed_at":"2026-08-04T01:21:26.466156Z","submitted_at":"2024-02-20T18:55:09Z","title":"VADv2: End-to-End Vectorized Autonomous Driving via Probabilistic Planning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13243","snapshot_observed_at":"2026-08-04T09:33:37.673101Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:37.673101Z"},"links":{"cited_paper":"/paper/2402.13243","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:524eb3b2c574e12b5089840ad3867ddc0e7e84d63800c4c72b6ceffd680e8aec","observation_id":"76637523-0550-43f2-a75f-7c0ca3167490","resolution":{"observed_at":"2026-08-04T09:33:37.673101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:33:37.732719Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:37.732719Z"},"links":{"citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:527e2471ab1183a29ad4555f2f2a238fcc9f60fcd60ffd2bbe1365db90eb6941","observation_id":"ddd89d9e-e6a6-480b-8d46-62ef500fe2c9","resolution":{"observed_at":"2026-08-04T09:33:37.732719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-04T09:33:37.824221Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:37.824221Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:cec6c7456a813109031d355e9af6e9daea73fe593df1fb7308a075acc2b68741","observation_id":"3c3a89a6-d496-4f2a-ac87-f3a88b90769f","resolution":{"observed_at":"2026-08-04T09:33:37.824221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17161","last_updated":"2025-05-26T17:16:45Z","snapshot_observed_at":"2026-08-09T18:26:12.869738Z","submitted_at":"2025-01-28T18:59:44Z","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17161","snapshot_observed_at":"2026-08-04T09:33:37.915402Z","title":"Le, Sergey Levine, and Yi Ma","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:37.915402Z"},"links":{"cited_paper":"/paper/2501.17161","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:c2cd7e9eeb27b0a2f0167c9e2c15c1950025dc408078f4ff48923dd49c54accd","observation_id":"287e2341-46b4-44fd-b14e-f4aaa56b3342","resolution":{"observed_at":"2026-08-04T09:33:37.915402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:33:37.979590Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:37.979590Z"},"links":{"citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:9e094799c87b70f729eb5e3b3768c20feee43e1f11e7afe4e02f9ea85c61f4af","observation_id":"0c97f4fe-f96b-4e6f-88b6-1daac8b70f17","resolution":{"observed_at":"2026-08-04T09:33:37.979590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-04T09:33:38.035048Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:38.035048Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:264f6710388578599faafe1205b414bfa286315bfcd2b318a70fb2f04eaf5b2d","observation_id":"76db443e-2e45-4aa5-9f20-d86165ee7018","resolution":{"observed_at":"2026-08-04T09:33:38.035048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:33:38.122980Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:38.122980Z"},"links":{"citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:0671affb08d38222e365819406daafe25f65fb68e7e96cbae11728fa3fee5218","observation_id":"007b2173-e4b4-4ab0-aefa-1d67fda17d32","resolution":{"observed_at":"2026-08-04T09:33:38.122980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-04T09:33:38.225037Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:38.225037Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:5adfbbf5bb58f0e622faa4854775c133932b04325f6e3148fc16b5164f0e95ce","observation_id":"663cc9ae-d62e-491c-b3c8-513ccbff3950","resolution":{"observed_at":"2026-08-04T09:33:38.225037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.04918","last_updated":"2022-01-05T07:53:02Z","snapshot_observed_at":"2026-08-06T06:27:22.658410Z","submitted_at":"2021-03-08T17:31:19Z","title":"A Survey of Embodied AI: From Simulators to Research Tasks","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.04918","snapshot_observed_at":"2026-08-04T09:33:38.311414Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:38.311414Z"},"links":{"cited_paper":"/paper/2103.04918","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:a87a51255689ba475a3ced0582752c51014a9a73283edcf376c566c56737aab2","observation_id":"03f72b09-5350-4862-bdd3-4180241fe0f5","resolution":{"observed_at":"2026-08-04T09:33:38.311414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03568","last_updated":"2024-01-25T21:20:27Z","snapshot_observed_at":"2026-07-30T06:39:40.880794Z","submitted_at":"2024-01-07T19:11:18Z","title":"Agent AI: Surveying the Horizons of Multimodal Interaction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03568","snapshot_observed_at":"2026-08-04T09:33:38.396393Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:38.396393Z"},"links":{"cited_paper":"/paper/2401.03568","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:84c1216159f3792cad3fa160986ce892475e1e35732fccb1b13b85a6fae2544b","observation_id":"c3228154-aca9-4dec-9b7a-b40389d2f0c8","resolution":{"observed_at":"2026-08-04T09:33:38.396393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-09T05:53:21.859449Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23127","snapshot_observed_at":"2026-08-04T09:33:38.485506Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:38.485506Z"},"links":{"cited_paper":"/paper/2506.23127","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:7c588cc6cec8db03c39d4066764dc1d2b798b6a0427549f817b86c90a926d52b","observation_id":"6f8873d8-e2c1-4d93-b663-d1c42fe201b3","resolution":{"observed_at":"2026-08-04T09:33:38.485506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:33:38.547736Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:38.547736Z"},"links":{"citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:1e26c5fd56bc3c8e837b76c3edbb388a83c9b276f58c4157090d9a7b41ba03b3","observation_id":"3c6aa1f6-31f5-42e5-b836-6ce307f2176e","resolution":{"observed_at":"2026-08-04T09:33:38.547736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16707","last_updated":"2025-02-23T20:42:15Z","snapshot_observed_at":"2026-08-11T01:14:45.608554Z","submitted_at":"2025-02-23T20:42:15Z","title":"Reflective Planning: Vision-Language Models for Multi-Stage Long-Horizon Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16707","snapshot_observed_at":"2026-08-04T09:33:38.644459Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:38.644459Z"},"links":{"cited_paper":"/paper/2502.16707","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:fa59fe45b911e929a91dcee9918afca53caef38a3b543f39fdeed571db34d21d","observation_id":"a1e41c29-913e-4819-a24b-0f3b5294da57","resolution":{"observed_at":"2026-08-04T09:33:38.644459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-04T09:33:38.707015Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:38.707015Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:9263b46bf62ef6ad7459a2982998f964f6eb047b3003a591a83973bae6901724","observation_id":"95a5c8a6-8a44-46ff-b8ce-25da8195f68b","resolution":{"observed_at":"2026-08-04T09:33:38.707015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:33:38.742058Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:38.742058Z"},"links":{"citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:33494519a618b937824b8fe741a4d4308cb2e552d4baa5190a3db48906fdaf70","observation_id":"9ad1ad25-bd18-4fa8-8088-c594776ae649","resolution":{"observed_at":"2026-08-04T09:33:38.742058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:33:38.828513Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:38.828513Z"},"links":{"citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:d105288a12705aaffa821d93f0d27baa33bf175d37af7ce107042bd149e6026f","observation_id":"90be904b-6709-402a-8fce-10bcad633495","resolution":{"observed_at":"2026-08-04T09:33:38.828513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21257","last_updated":"2025-03-25T05:46:03Z","snapshot_observed_at":"2026-08-11T07:58:41.762570Z","submitted_at":"2025-02-28T17:30:39Z","title":"RoboBrain: A Unified Brain Model for Robotic Manipulation from Abstract to Concrete","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.21257","snapshot_observed_at":"2026-08-04T09:33:38.976923Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:38.976923Z"},"links":{"cited_paper":"/paper/2502.21257","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:d3f72ca9593f64ac6aab79f6c4f79cddb53c8da60c205fc0ede1a9e9726f6a5c","observation_id":"20cb3071-f4eb-4fde-bb10-bec73bd737e6","resolution":{"observed_at":"2026-08-04T09:33:38.976923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07608","last_updated":"2025-03-10T17:59:42Z","snapshot_observed_at":"2026-08-01T16:55:41.453922Z","submitted_at":"2025-03-10T17:59:42Z","title":"AlphaDrive: Unleashing the Power of VLMs in Autonomous Driving via Reinforcement Learning and Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07608","snapshot_observed_at":"2026-08-04T09:33:39.054571Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:39.054571Z"},"links":{"cited_paper":"/paper/2503.07608","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:2048acc2b58bf8635b69399fe9f47159803595113cc0a1a9de026df52764b98f","observation_id":"3e9004e9-3fa5-45a2-8261-efb517b7d826","resolution":{"observed_at":"2026-08-04T09:33:39.054571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.05474","last_updated":"2022-08-26T17:12:17Z","snapshot_observed_at":"2026-07-06T06:14:28.435222Z","submitted_at":"2017-12-14T23:17:24Z","title":"AI2-THOR: An Interactive 3D Environment for Visual AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.05474","snapshot_observed_at":"2026-08-04T09:33:39.183849Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:39.183849Z"},"links":{"cited_paper":"/paper/1712.05474","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:0c068ff771bb18bf39ceb7dc10993bfc905b6908fa194bf11c01c4b795da0de0","observation_id":"7894e5b7-0ba8-48a8-a727-e74e6c2bce8e","resolution":{"observed_at":"2026-08-04T09:33:39.183849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-04T09:33:39.319465Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:39.319465Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:f2b3b10bac888437401d190b0e9e586929c95dedab3800c58042267682ba8979","observation_id":"239f54c4-f565-4212-99fa-7e479d963c5c","resolution":{"observed_at":"2026-08-04T09:33:39.319465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10399","last_updated":"2025-08-14T06:56:16Z","snapshot_observed_at":"2026-08-10T16:57:45.636309Z","submitted_at":"2025-08-14T06:56:16Z","title":"Large Model Empowered Embodied AI: A Survey on Decision-Making and Embodied Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10399","snapshot_observed_at":"2026-08-04T09:33:39.414690Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:39.414690Z"},"links":{"cited_paper":"/paper/2508.10399","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:ce07a763398d96a90cf6bb8877776f489f1dc29bfb695ec90de89e0ebb1a3a07","observation_id":"47e90a23-9977-4161-9e0f-227a905396ff","resolution":{"observed_at":"2026-08-04T09:33:39.414690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06886","last_updated":"2025-08-25T02:20:09Z","snapshot_observed_at":"2026-08-06T16:04:56.349386Z","submitted_at":"2024-07-09T14:14:47Z","title":"Aligning Cyber Space with Physical World: A Comprehensive Survey on Embodied AI","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06886","snapshot_observed_at":"2026-08-04T09:33:39.470901Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:39.470901Z"},"links":{"cited_paper":"/paper/2407.06886","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:dd31db170d899a9e320bc4298d1f5ab4fc8b6ce79d956a29866f7476a5d25cc9","observation_id":"053d6d53-f0ab-48d1-8353-563cfd4304aa","resolution":{"observed_at":"2026-08-04T09:33:39.470901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-05T03:13:54.147007Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-08-04T09:33:39.545675Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:39.545675Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:a88b2379eb4ef97263b3ccf5dfc46274395736c2c51869bba990ffa05b42c367","observation_id":"e972aef4-4091-42b8-9514-11782e3d20d8","resolution":{"observed_at":"2026-08-04T09:33:39.545675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-08-09T01:06:58.674891Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-04T09:33:39.629890Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:39.629890Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:3a2e114ed05effc08220bd1645c69c374eb2785b47d303fd0e7a5512075be93e","observation_id":"9d1e0453-2504-4012-ac5c-c00a62dbcb46","resolution":{"observed_at":"2026-08-04T09:33:39.629890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:33:39.735062Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:39.735062Z"},"links":{"citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:b227b4b0cb7b66f1fe8690c7e3e78024215cd3ed883837492766060c973cac9e","observation_id":"60901f06-4fbb-470e-9d54-7cda08d151cb","resolution":{"observed_at":"2026-08-04T09:33:39.735062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-04T09:33:39.811735Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:39.811735Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:c315a546afa0e794e7cb95c2b94a35ab320cbff8f52a8b0f8d62368b6481cde5","observation_id":"6c37f363-c13a-411c-99cd-3b7ced36bfd9","resolution":{"observed_at":"2026-08-04T09:33:39.811735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:33:39.875355Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:39.875355Z"},"links":{"citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:2b561b8446ecf554c0ddb69aa2718bfe50ee66c3a64f40e115a1f5cda4870f66","observation_id":"ff9aac9d-6f3d-4b0b-8b05-791516e27ebd","resolution":{"observed_at":"2026-08-04T09:33:39.875355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:33:39.950444Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:39.950444Z"},"links":{"citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:35f53736b1487426c3da9bbfc66a34f9dab916307b34f7e81668bc403f086e18","observation_id":"b976c30e-d0f1-475c-9a13-8673b6cd41e2","resolution":{"observed_at":"2026-08-04T09:33:39.950444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:33:40.030018Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:40.030018Z"},"links":{"citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:16573e5308db5aa873a67ece7f00591d88c21bcf37e43037c8f8ed1f05559d55","observation_id":"9f7ee5c6-177d-49ff-9d5c-58239ead11f2","resolution":{"observed_at":"2026-08-04T09:33:40.030018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.01201","last_updated":"2019-11-25T01:39:04Z","snapshot_observed_at":"2026-08-08T06:08:19.946050Z","submitted_at":"2019-04-02T03:52:27Z","title":"Habitat: A Platform for Embodied AI Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.01201","snapshot_observed_at":"2026-08-04T09:33:40.107534Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:40.107534Z"},"links":{"cited_paper":"/paper/1904.01201","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:fe9ed21de377a656b33125f7772971c06557c9f622939589592fae6a592d450d","observation_id":"356fe00a-db9c-4419-bb9a-22d65ee941ed","resolution":{"observed_at":"2026-08-04T09:33:40.107534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00899","last_updated":"2023-11-01T23:40:07Z","snapshot_observed_at":"2026-07-06T16:41:56.099361Z","submitted_at":"2023-11-01T23:40:07Z","title":"RoboVQA: Multimodal Long-Horizon Reasoning for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.00899","snapshot_observed_at":"2026-08-04T09:33:40.163623Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:40.163623Z"},"links":{"cited_paper":"/paper/2311.00899","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:640046303856b31b66940c41715e23ecab28165eabbcbdab39a159d7f4e4eeb0","observation_id":"e5524ead-982f-40f3-8021-cfc34f213871","resolution":{"observed_at":"2026-08-04T09:33:40.163623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-04T09:33:40.222514Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:40.222514Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:9daa6fdcfef106441cb8063c56e2fc295f3db2d06596b857ccf84e9fac72deba","observation_id":"ae0cad2e-052a-4f96-9b80-abbe5e7545ba","resolution":{"observed_at":"2026-08-04T09:33:40.222514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-08-08T20:11:45.308315Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-04T09:33:40.274255Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:40.274255Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:10fb43e785c9b8d01339238ff09738026ce307e6f4e33c07e32aff339be3c5cb","observation_id":"4b282ff1-f0d4-4fb3-982e-3019f96ae079","resolution":{"observed_at":"2026-08-04T09:33:40.274255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-08-04T09:33:40.382324Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:40.382324Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:82f5ca46c02bb7843459c79fa8ff076550b513c0383bb4aca388a904c1134cad","observation_id":"070e2f59-2fb9-4760-a14c-4a030752f44b","resolution":{"observed_at":"2026-08-04T09:33:40.382324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:33:40.470672Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:40.470672Z"},"links":{"citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:164dca229a52c5cac6e13ed992ea9365ac5091bbded9ee336075f695448648b9","observation_id":"6841738b-d346-445d-9af7-c50c12831ce4","resolution":{"observed_at":"2026-08-04T09:33:40.470672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01734","last_updated":"2020-03-31T01:18:33Z","snapshot_observed_at":"2026-07-06T08:41:52.497343Z","submitted_at":"2019-12-03T23:18:59Z","title":"ALFRED: A Benchmark for Interpreting Grounded Instructions for Everyday Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.01734","snapshot_observed_at":"2026-08-04T09:33:40.630287Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:40.630287Z"},"links":{"cited_paper":"/paper/1912.01734","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:d721d887b7d7e7374982decfe7406097ec59fd0c6485bfac6f759cebb70a8a97","observation_id":"23505add-31dc-4721-b5af-dc5c2eb429a2","resolution":{"observed_at":"2026-08-04T09:33:40.630287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04088","last_updated":"2023-03-30T04:50:44Z","snapshot_observed_at":"2026-08-09T23:21:40.566096Z","submitted_at":"2022-12-08T05:46:32Z","title":"LLM-Planner: Few-Shot Grounded Planning for Embodied Agents with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04088","snapshot_observed_at":"2026-08-04T09:33:40.714342Z","title":"Sadler, Wei-Lun Chao, and Yu Su","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:40.714342Z"},"links":{"cited_paper":"/paper/2212.04088","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:d4bf1dfcffffbdb2a070245bfb2629f4351f1691d326b1fe6937bc193bf1ae5a","observation_id":"e829214c-6955-4ef7-a539-c8a444a7be2b","resolution":{"observed_at":"2026-08-04T09:33:40.714342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-04T09:33:40.778430Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:40.778430Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:b0643b2497c18338c5045658104b21701142ca1805182646cde46cd8d23d98e9","observation_id":"29e3a671-a61a-4d50-bdc4-781527c4b06f","resolution":{"observed_at":"2026-08-04T09:33:40.778430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-11T01:31:26.242281Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-04T09:33:40.825945Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:40.825945Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:5913bd509e670bd13b1e496f18e50b1f9fea85202c76451d18f1184f0d3ead04","observation_id":"e38770a1-69dd-46fe-9f6b-2e2af7817e33","resolution":{"observed_at":"2026-08-04T09:33:40.825945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12854","last_updated":"2025-07-28T17:46:50Z","snapshot_observed_at":"2026-08-08T01:11:06.163025Z","submitted_at":"2025-03-17T06:28:25Z","title":"Enhancing LLM Reasoning with Iterative DPO: A Comprehensive Empirical Investigation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12854","snapshot_observed_at":"2026-08-04T09:33:40.888746Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:40.888746Z"},"links":{"cited_paper":"/paper/2503.12854","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:adb02f340ff5964213d0b394334a53b59e558e620b592a6daf36f5d0fdf3f473","observation_id":"62801cd4-ce5a-4f1e-abfb-8c526f5297b7","resolution":{"observed_at":"2026-08-04T09:33:40.888746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:33:40.948686Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:40.948686Z"},"links":{"citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:d6a881c3d673b89e203b1228a0880db36d61f4fbc1ebf2c2417df63d63e81c69","observation_id":"951575bc-7608-422b-8ab0-c162ca620349","resolution":{"observed_at":"2026-08-04T09:33:40.948686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16878","last_updated":"2024-12-22T06:15:25Z","snapshot_observed_at":"2026-08-11T05:59:06.290245Z","submitted_at":"2024-12-22T06:15:25Z","title":"Online Preference-based Reinforcement Learning with Self-augmented Feedback from Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16878","snapshot_observed_at":"2026-08-04T09:33:41.033717Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:41.033717Z"},"links":{"cited_paper":"/paper/2412.16878","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:2491d44e7ec18f36ef54adc8bde8fb18fce8387ac66a5d3f48e03c6f813a7e14","observation_id":"3efd8b4e-e54e-4b28-8dc2-3bce5785d955","resolution":{"observed_at":"2026-08-04T09:33:41.033717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16291","last_updated":"2023-10-19T16:27:03Z","snapshot_observed_at":"2026-08-11T16:01:36.938012Z","submitted_at":"2023-05-25T17:46:38Z","title":"Voyager: An Open-Ended Embodied Agent with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16291","snapshot_observed_at":"2026-08-04T09:33:41.105277Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:41.105277Z"},"links":{"cited_paper":"/paper/2305.16291","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:ad455f60ee2fc5538fde4cbab7679330499ab01565a3b9392e4e5e3ffaa21b19","observation_id":"87f8af6c-ef6f-4912-bfd4-c5f1fef05f77","resolution":{"observed_at":"2026-08-04T09:33:41.105277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:33:41.165390Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:41.165390Z"},"links":{"citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:bc8f29e644a09931ec4332c5671840a9365a3704748f2c9a53c01cb0ee0d6753","observation_id":"abbbf8a1-ad4d-4672-9847-8cecb376950b","resolution":{"observed_at":"2026-08-04T09:33:41.165390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14804","last_updated":"2024-02-22T18:56:38Z","snapshot_observed_at":"2026-08-08T13:47:36.585273Z","submitted_at":"2024-02-22T18:56:38Z","title":"Measuring Multimodal Mathematical Reasoning with MATH-Vision Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14804","snapshot_observed_at":"2026-08-04T09:33:41.282310Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:41.282310Z"},"links":{"cited_paper":"/paper/2402.14804","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:eb6ba0af9e6a3648c304d0c8f4f0ced731f2eb3e4cb9be3a75355225fc6a9ee8","observation_id":"cfd41063-37b0-4fa7-b3d8-dd85676fa80c","resolution":{"observed_at":"2026-08-04T09:33:41.282310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:33:41.226056Z","title":"arXiv:2509.24494 [cs.CL] https://arxiv.org/abs/2509","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:41.226056Z"},"links":{"citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:31ba1223dd4cf6f14abf8aff1bd35bd6952f841def86bb6ac5b3ec6ca392f9d4","observation_id":"e7824725-ce5f-4f52-b8f4-37a09d7b1c71","resolution":{"observed_at":"2026-08-04T09:33:41.226056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18449","last_updated":"2025-12-01T00:16:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-25T18:45:04Z","title":"SWE-RL: Advancing LLM Reasoning via Reinforcement Learning on Open Software Evolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18449","snapshot_observed_at":"2026-08-04T09:33:41.412380Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:41.412380Z"},"links":{"cited_paper":"/paper/2502.18449","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:cb92fc4eaa5c1fca3574fd503bcc23bc94619e63c168fe294ba6dfbb0899c1d2","observation_id":"cd9f6d05-1b05-40a7-99fa-612ad0a20a1a","resolution":{"observed_at":"2026-08-04T09:33:41.412380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.07540","last_updated":"2022-11-14T17:52:27Z","snapshot_observed_at":"2026-08-06T07:25:42.562786Z","submitted_at":"2022-03-14T22:52:34Z","title":"ScienceWorld: Is your Agent Smarter than a 5th Grader?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.07540","snapshot_observed_at":"2026-08-04T09:33:41.370086Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:41.370086Z"},"links":{"cited_paper":"/paper/2203.07540","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:c89a542ad52d260e4ba5a0d8714f9781e313e01d2965d2cfd92a153db02b8af9","observation_id":"08d3e24a-16de-4ef9-9daf-916074e2ae47","resolution":{"observed_at":"2026-08-04T09:33:41.370086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22050","snapshot_observed_at":"2026-08-04T09:33:41.474386Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:41.474386Z"},"links":{"cited_paper":"/paper/2505.22050","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:813aee2fc73460fd1d8bb7ee6fac35e995a76a0b98cfbeadb1b1194ce5d2b581","observation_id":"228d765b-1279-480a-b96e-82f25ef54e93","resolution":{"observed_at":"2026-08-04T09:33:41.474386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07864","last_updated":"2023-09-19T08:29:18Z","snapshot_observed_at":"2026-08-09T18:54:02.679174Z","submitted_at":"2023-09-14T17:12:03Z","title":"The Rise and Potential of Large Language Model Based Agents: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07864","snapshot_observed_at":"2026-08-04T09:33:41.700343Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:41.700343Z"},"links":{"cited_paper":"/paper/2309.07864","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:ffe72158f5d3e159931707570d89039eb9f8a9bd299eefb32902c21077a785ac","observation_id":"68a20794-c4fb-400f-b5e3-ded744db4baa","resolution":{"observed_at":"2026-08-04T09:33:41.700343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01848","last_updated":"2023-07-04T17:58:25Z","snapshot_observed_at":"2026-08-06T10:55:32.798065Z","submitted_at":"2023-07-04T17:58:25Z","title":"Embodied Task Planning with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01848","snapshot_observed_at":"2026-08-04T09:33:41.629369Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:41.629369Z"},"links":{"cited_paper":"/paper/2307.01848","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:0bca24b7d080c1ef898065e16681c42c769555a9297a3d4b7f91fa629584c6ef","observation_id":"f1accbf5-2d65-4d33-890c-c145f07b63a5","resolution":{"observed_at":"2026-08-04T09:33:41.629369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-04T09:33:41.839773Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:41.839773Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:cc3cfa4c2d3e7ff9be54818af7739494cb25a66d30cefbb3687e6a354a9cdfb7","observation_id":"2ce6b19d-f7b0-40cc-bf15-783a3356c17d","resolution":{"observed_at":"2026-08-04T09:33:41.839773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02385","last_updated":"2024-02-04T07:55:01Z","snapshot_observed_at":"2026-08-04T15:45:08.679135Z","submitted_at":"2024-02-04T07:55:01Z","title":"A Survey on Robotics with Foundation Models: toward Embodied AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02385","snapshot_observed_at":"2026-08-04T09:33:41.788473Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:41.788473Z"},"links":{"cited_paper":"/paper/2402.02385","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:762e5e3027feb92fa8f029c576a9f9e9157b3c9d6a2261ba743738501400d27e","observation_id":"7759031b-650e-4aaf-97af-23bb67c10b09","resolution":{"observed_at":"2026-08-04T09:33:41.788473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08693","last_updated":"2025-03-06T19:29:03Z","snapshot_observed_at":"2026-08-07T02:44:43.738657Z","submitted_at":"2024-07-11T17:31:01Z","title":"Robotic Control via Embodied Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08693","snapshot_observed_at":"2026-08-04T09:33:42.041223Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:42.041223Z"},"links":{"cited_paper":"/paper/2407.08693","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:dd6ad15e2c36851303d00216df607c01d5767b90aaf66ad391794393fea95264","observation_id":"3c9ae41d-8adc-41e7-b0f8-0f50a4da9c7d","resolution":{"observed_at":"2026-08-04T09:33:42.041223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03373","last_updated":"2025-02-05T17:13:32Z","snapshot_observed_at":"2026-07-06T20:31:41.231839Z","submitted_at":"2025-02-05T17:13:32Z","title":"Demystifying Long Chain-of-Thought Reasoning in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03373","snapshot_observed_at":"2026-08-04T09:33:41.924759Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:41.924759Z"},"links":{"cited_paper":"/paper/2502.03373","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:f6a6244a229e933d1f43f550aaa0bb6eb4e4e9231b4ce5ea534b6fd3304954c9","observation_id":"e8e7f942-9ec8-44d1-a197-56410fa1ff20","resolution":{"observed_at":"2026-08-04T09:33:41.924759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01718","last_updated":"2025-05-24T04:36:48Z","snapshot_observed_at":"2026-08-10T05:42:26.340829Z","submitted_at":"2025-02-03T18:46:04Z","title":"ACECODER: Acing Coder RL via Automated Test-Case Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01718","snapshot_observed_at":"2026-08-04T09:33:42.262857Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:42.262857Z"},"links":{"cited_paper":"/paper/2502.01718","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:325bbe97aaf3744324862704c438b54ec9102b45e3ead120d0908ca3295afde9","observation_id":"15308678-5de8-4ed6-83b7-e44781a14490","resolution":{"observed_at":"2026-08-04T09:33:42.262857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12823","last_updated":"2023-10-22T16:19:16Z","snapshot_observed_at":"2026-08-07T22:31:11.195198Z","submitted_at":"2023-10-19T15:19:53Z","title":"AgentTuning: Enabling Generalized Agent Abilities for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12823","snapshot_observed_at":"2026-08-04T09:33:42.145467Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:42.145467Z"},"links":{"cited_paper":"/paper/2310.12823","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:bc55733b0efb508398ef08b726461dd8d8c981024348d35ea6ab1c57776d494d","observation_id":"a041484a-e109-4286-b7a9-6420c0b5cf8e","resolution":{"observed_at":"2026-08-04T09:33:42.145467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12937","last_updated":"2025-08-04T04:22:09Z","snapshot_observed_at":"2026-08-06T21:34:54.534751Z","submitted_at":"2025-03-17T08:51:44Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12937","snapshot_observed_at":"2026-08-04T09:33:42.482668Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:42.482668Z"},"links":{"cited_paper":"/paper/2503.12937","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:59ec92ea551aae6bcfe43f7eb902515693d8532f4228fda16665a25ca5ab5149","observation_id":"088f09f5-4de6-462f-879c-1e007c5d2c71","resolution":{"observed_at":"2026-08-04T09:33:42.482668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.00685","last_updated":"2024-02-16T10:28:12Z","snapshot_observed_at":"2026-08-11T17:01:26.634904Z","submitted_at":"2023-04-03T02:17:05Z","title":"Vision-Language Models for Vision Tasks: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.00685","snapshot_observed_at":"2026-08-04T09:33:42.375221Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:42.375221Z"},"links":{"cited_paper":"/paper/2304.00685","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:81e91d63f48e3152bb9dda58d858447f2405e79cce3a312d6e646619cefcc63e","observation_id":"06b7ccd8-d487-4846-ac50-b8239a562185","resolution":{"observed_at":"2026-08-04T09:33:42.375221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-07T22:42:41.639384Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.22844","snapshot_observed_at":"2026-08-04T09:33:42.644462Z","title":"num_train_epochs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:42.644462Z"},"links":{"cited_paper":"/paper/2507.22844","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:dbcf275f71fe7a3b9f39b140a3fb74da00b6a31bd4c08824cafee428466efb8d","observation_id":"f88f39fd-5a20-47bc-aadf-f41e12188cba","resolution":{"observed_at":"2026-08-04T09:33:42.644462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21696","last_updated":"2025-05-14T17:48:02Z","snapshot_observed_at":"2026-08-07T16:32:15.166320Z","submitted_at":"2025-03-27T17:00:51Z","title":"Embodied-Reasoner: Synergizing Visual Search, Reasoning, and Action for Embodied Interactive Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21696","snapshot_observed_at":"2026-08-04T09:33:42.587307Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:42.587307Z"},"links":{"cited_paper":"/paper/2503.21696","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:b51e399608a523a993314c9858b6857c72ebdf38aeddf601196183164cdaf870","observation_id":"eba6f6a2-bc86-409c-ae91-36b052a70dc3","resolution":{"observed_at":"2026-08-04T09:33:42.587307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15190","last_updated":"2025-03-26T07:42:56Z","snapshot_observed_at":"2026-07-06T18:04:30.291363Z","submitted_at":"2024-04-21T08:10:20Z","title":"Socratic Planner: Self-QA-Based Zero-Shot Planning for Embodied Instruction Following","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15190","snapshot_observed_at":"2026-08-04T09:33:40.546288Z","title":"arXiv:2404.15190 [cs.AI] https://arxiv.org/abs/2404.15190","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:40.546288Z"},"links":{"cited_paper":"/paper/2404.15190","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:a5f04f3a1946967727bc4bda0af9deecb18932375b6b22566af1889c19d98c9f","observation_id":"e1099645-a944-49a6-9be7-50fa2d184a26","resolution":{"observed_at":"2026-08-04T09:33:40.546288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","latest_version":3,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":68,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 2 inbound Pith citation observations for arXiv:2510.14828."}