{"as_of":"2026-08-10T06:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:23bccfdc31a9550d027e6684b782f1a946410ffbb76de92d3dbe4c54ff04acca","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:22:26.851204Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T04:50:32.142169Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-17T20:28:15.942007Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"cited_work":{"arxiv_id":"2505.22050","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22050","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rein- forced reasoning for embodied planning","venue":null,"work_id":"1c644f10-1816-4319-a9f0-19b4c1885fff","year":2025},"citing_paper":{"arxiv_id":"2508.13073","last_updated":"2025-09-01T08:10:01Z","snapshot_observed_at":"2026-08-07T15:40:31.068428Z","submitted_at":"2025-08-18T16:45:48Z","title":"Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey","version":2},"reference_index":150,"source":"pdf_text","source_observed_at":"2026-05-17T20:28:15.818016Z"},"links":{"cited_paper":"/paper/2505.22050","citing_paper":"/paper/2508.13073"},"observation_digest":"sha256:c14fdd251edb13d745a84efcd0381ce1be36fdcdbc11b98987402c58cbab4e6b","observation_id":"dc9d4a05-26d6-4f64-b7e6-b01053167dd8","resolution":{"observed_at":"2026-05-17T20:28:15.947442Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22050","snapshot_observed_at":"2026-08-05T04:50:32.142169Z","title":"Reinforced reasoning for embodied planning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.05946","last_updated":"2025-09-07T06:46:03Z","snapshot_observed_at":"2026-08-07T19:21:09.227690Z","submitted_at":"2025-09-07T06:46:03Z","title":"Large Language Models for Next-Generation Wireless Network Management: A Survey and Tutorial","version":1},"reference_index":168,"source":"pdf_text","source_observed_at":"2026-08-05T04:50:32.142169Z"},"links":{"cited_paper":"/paper/2505.22050","citing_paper":"/paper/2509.05946"},"observation_digest":"sha256:76fb0358ea92a48911080b37910a9b54025cf5a6491f3564ae607f0010445a35","observation_id":"8355abd1-3ad3-4a41-b036-c0dc8ba2d1d3","resolution":{"observed_at":"2026-08-05T04:50:32.142169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22050","snapshot_observed_at":"2026-08-04T09:33:41.474386Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:41.474386Z"},"links":{"cited_paper":"/paper/2505.22050","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:79a362a0cda640956835d644f1ff049d308bce646d63f70274646603a9aac450","observation_id":"228d765b-1279-480a-b96e-82f25ef54e93","resolution":{"observed_at":"2026-08-04T09:33:41.474386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"cited_work":{"arxiv_id":"2505.22050","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22050","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rein- forced reasoning for embodied planning","venue":null,"work_id":"1c644f10-1816-4319-a9f0-19b4c1885fff","year":2025},"citing_paper":{"arxiv_id":"2604.07774","last_updated":"2026-04-09T04:01:27Z","snapshot_observed_at":"2026-07-06T22:57:00.904627Z","submitted_at":"2026-04-09T04:01:27Z","title":"RoboAgent: Chaining Basic Capabilities for Embodied Task Planning","version":1},"reference_index":115,"source":"pdf_text","source_observed_at":"2026-05-10T18:15:08.727921Z"},"links":{"cited_paper":"/paper/2505.22050","citing_paper":"/paper/2604.07774"},"observation_digest":"sha256:0a1ba16495d2b247011df70fbfbecedca99f2ca8946f7f7d03a39efcc79f9cb1","observation_id":"d0aefcf2-b090-463b-a156-431113c66b6c","resolution":{"observed_at":"2026-05-11T05:15:57.247031Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"cited_work":{"arxiv_id":"2505.22050","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22050","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rein- forced reasoning for embodied planning","venue":null,"work_id":"1c644f10-1816-4319-a9f0-19b4c1885fff","year":2025},"citing_paper":{"arxiv_id":"2605.00347","last_updated":"2026-05-01T02:05:56Z","snapshot_observed_at":"2026-07-06T23:13:47.082550Z","submitted_at":"2026-05-01T02:05:56Z","title":"Odysseus: Scaling VLMs to 100+ Turn Decision-Making in Games via Reinforcement Learning","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-05-09T20:22:58.061772Z"},"links":{"cited_paper":"/paper/2505.22050","citing_paper":"/paper/2605.00347"},"observation_digest":"sha256:bf528931126f7ca2eda60b68af82598c14203e4b156c94cb3c7c8ddabe0bae5f","observation_id":"29bc1a9f-64c8-42e9-b5c6-1f94a5eab6b9","resolution":{"observed_at":"2026-05-11T15:16:09.217964Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"cited_work":{"arxiv_id":"2505.22050","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22050","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rein- forced reasoning for embodied planning","venue":null,"work_id":"1c644f10-1816-4319-a9f0-19b4c1885fff","year":2025},"citing_paper":{"arxiv_id":"2605.13775","last_updated":"2026-05-13T16:54:36Z","snapshot_observed_at":"2026-07-06T23:25:16.229144Z","submitted_at":"2026-05-13T16:54:36Z","title":"RoboEvolve: Co-Evolving Planner-Simulator for Robotic Manipulation with Limited Data","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-14T17:54:50.325820Z"},"links":{"cited_paper":"/paper/2505.22050","citing_paper":"/paper/2605.13775"},"observation_digest":"sha256:1b025cdc3ad91090974d656e98d497161cf1be55cea62f3adce56c7aa28f9f6c","observation_id":"d7ee1b53-19af-41f1-91ac-da99f4e9d0b8","resolution":{"observed_at":"2026-05-14T17:57:33.219109Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.22050/citation-record","integrity":"/paper/2505.22050/integrity","json":"/paper/2505.22050/citation-record.json","paper":"/paper/2505.22050"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:31.002580Z","title":"URL: https://openai.com/index/ gpt-4o-mini-advancing-cost-efficient-intelligence/","venue":null,"work_id":"00ed51ca-e955-4594-8b7d-0cc436a00402","year":null},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:20.697606Z"},"links":{"citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:0433209f5459981cf007c35dd062226c4bcdbfe675f7274101f3e2166e4f4f17","observation_id":"24e9227a-ffd2-414c-8a7c-fc9cb3a023e7","resolution":{"observed_at":"2026-08-07T13:22:31.068071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:30.840660Z","title":"URL: https://openai.com/index/hello-gpt-4o/","venue":null,"work_id":"453b78f9-1579-4dbe-9edc-f9175a2b9f87","year":null},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:20.785954Z"},"links":{"citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:83dead19ca750cd3bcec5bf1066f39789684410473a9f1597b98e0f850bd138e","observation_id":"65f69c35-873e-4102-b65b-9e0a69ef96ee","resolution":{"observed_at":"2026-08-07T13:22:30.915929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:30.637938Z","title":"URL: https://www.anthropic.com/news/ claude-3-5-sonnet","venue":null,"work_id":"259b35cb-f168-44ef-af69-9ae807f9e8f9","year":null},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:20.861921Z"},"links":{"citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:5112b6b166b43e2cc3c3890f9f6201fa312bcce652fae9b54260c1af8db8ea01","observation_id":"3b59e599-9cd7-4bf1-9ca2-cdcc395a60a3","resolution":{"observed_at":"2026-08-07T13:22:30.704191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:30.419459Z","title":"URL: https://blog","venue":null,"work_id":"492b02d9-c0e6-4946-abcb-4f89c165405d","year":2024},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:20.971449Z"},"links":{"citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:05a438dcbd5b003ad4b597fdc37c46de6428002afe94708836d1cf8f7129ed0f","observation_id":"3eb58784-d7ba-4e28-ad95-8d9006b35e7f","resolution":{"observed_at":"2026-08-07T13:22:30.537405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:30.172611Z","title":"URL: https://ai.meta.com/blog/ llama-3-2-connect-2024-vision-edge-mobile-devices/","venue":null,"work_id":"1d4b1e15-ad54-4fc4-a315-a5e40d6d475f","year":2024},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:21.081823Z"},"links":{"citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:bfef539c416c1f55ae5d159b6e19ad69b40d6151f16c7d2eac01ae9e690b0e24","observation_id":"94ffbd43-4381-4b69-acce-c470cc9f74ba","resolution":{"observed_at":"2026-08-07T13:22:30.286481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-07T13:22:21.227527Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:21.227527Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:ff5d3551899cbf82b3eeb1c57a8e9741c602c85b1c45d179fface3e92d9f67c4","observation_id":"6d72c2fe-222c-4599-935a-6740ea66b12a","resolution":{"observed_at":"2026-08-07T13:22:21.227527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T13:22:21.376588Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:21.376588Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:c6e04f2a108fa400e42fceeac1495bb94fcb19a3ab11158ded2835ecdd0d7703","observation_id":"1466b7fc-2907-4e6d-a50a-285ceff2fbb6","resolution":{"observed_at":"2026-08-07T13:22:21.376588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15649","last_updated":"2024-09-13T09:36:18Z","snapshot_observed_at":"2026-08-07T22:16:39.249340Z","submitted_at":"2023-11-27T09:20:23Z","title":"RoboGPT: an intelligent agent of making embodied long-term decisions for daily instruction tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15649","snapshot_observed_at":"2026-08-07T13:22:21.473781Z","title":"RoboGPT: an intelligent agent of making embodied long- term decisions for daily instruction tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:21.473781Z"},"links":{"cited_paper":"/paper/2311.15649","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:413eabc089a437d822636e1a6cab51c9e6b0703a352554ee3f06a1a0eeec3bc2","observation_id":"15d6ded9-411f-4a3c-8807-c8451aa847fe","resolution":{"observed_at":"2026-08-07T13:22:21.473781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T13:22:21.610900Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:21.610900Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:4873f80de52bbb3eb3ce16de6ababe48b727054e0287fefb449b7517305566ce","observation_id":"ab1fe195-2f7d-4b5c-bb0e-a44cd8a1818e","resolution":{"observed_at":"2026-08-07T13:22:21.610900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01456","last_updated":"2025-09-26T09:25:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-03T15:43:48Z","title":"Process Reinforcement through Implicit Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01456","snapshot_observed_at":"2026-08-07T13:22:21.739893Z","title":"Process reinforcement through implicit rewards","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:21.739893Z"},"links":{"cited_paper":"/paper/2502.01456","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:a599ded32182554079439b95db8be3f828258abd419e316bbe7601df0d747590","observation_id":"7eaaf131-0b02-4d53-bea1-345e82ad6be2","resolution":{"observed_at":"2026-08-07T13:22:21.739893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:29.947703Z","title":"A survey of embodied ai: From simulators to research tasks","venue":null,"work_id":"7be6bdd6-de9c-485c-a8c8-b438e98ee2a1","year":2022},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:21.894396Z"},"links":{"citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:a87070d39814a4a5f3464d6c32bc148f841aa0b5b2d92e948e13eba5a89c8c4c","observation_id":"ba721db9-318d-48eb-bfe2-050a9a589979","resolution":{"observed_at":"2026-08-07T13:22:30.065537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:29.755922Z","title":"Open r1: A fully open reproduction of deepseek-r1, January 2025","venue":null,"work_id":"3c168db3-84c5-45e8-be47-e7e8cad4d0c1","year":2025},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:22.008668Z"},"links":{"citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:0b8ff01973fe1f08ba44a8c39023aa62cb00e47f7a7d3114a26773bc3904aa16","observation_id":"144e999e-c563-48ce-84b8-313f1e88c37d","resolution":{"observed_at":"2026-08-07T13:22:29.814108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:29.554208Z","title":"What can vlms do for zero-shot embodied task planning? In ICML 2024 Workshop on LLMs and Cognition, 2024","venue":null,"work_id":"d4fd95bf-da89-498d-88df-9d146aa3200d","year":2024},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:22.096292Z"},"links":{"citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:d9758da1cbd6772120b0e058783a3b265758d7a8f4c495f61468a11a01a2cf33","observation_id":"521e9aaa-7842-462c-aa30-ced4c358632e","resolution":{"observed_at":"2026-08-07T13:22:29.618245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T13:22:22.190695Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:22.190695Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:3499dcd40d5f4a5bf575d22ae0833ac169f12395f2411900041d04a3aacab9e1","observation_id":"486f722f-2e98-4710-994c-fcb43486f642","resolution":{"observed_at":"2026-08-07T13:22:22.190695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:22.314432Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:22.314432Z"},"links":{"citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:3826ef806a613232550952eac0bdbfb4f2e523015a68f9d27df4be82625b8057","observation_id":"b35a1a89-f812-4f18-8a4e-ba084039e568","resolution":{"observed_at":"2026-08-07T13:22:22.314432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11143","last_updated":"2025-10-09T12:22:46Z","snapshot_observed_at":"2026-07-31T12:28:37.704994Z","submitted_at":"2024-05-20T01:04:40Z","title":"OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11143","snapshot_observed_at":"2026-08-07T13:22:22.439915Z","title":"Open- rlhf: An easy-to-use, scalable and high-performance rlhf framework","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:22.439915Z"},"links":{"cited_paper":"/paper/2405.11143","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:e3ae6ef57bf90dc7fa7b47cf0ac3f69a9041de75792ff3aefb9414b555e3242c","observation_id":"f5814911-feb8-457b-8a69-998ae1b6c810","resolution":{"observed_at":"2026-08-07T13:22:22.439915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17842","last_updated":"2023-12-24T03:48:40Z","snapshot_observed_at":"2026-08-07T02:37:30.672574Z","submitted_at":"2023-11-29T17:46:25Z","title":"Look Before You Leap: Unveiling the Power of GPT-4V in Robotic Vision-Language Planning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17842","snapshot_observed_at":"2026-08-07T13:22:22.543422Z","title":"Look before you leap: Un- veiling the power of GPT-4v in robotic vision-language planning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:22.543422Z"},"links":{"cited_paper":"/paper/2311.17842","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:0c26a510b448edcddb54b4d0059067531598d7f619805f623e16ac5b72c2818c","observation_id":"306cb825-6fc5-49d0-b7ac-c2cf156d7404","resolution":{"observed_at":"2026-08-07T13:22:22.543422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-07T18:44:26.813869Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-07T13:22:22.647159Z","title":"Vision-r1: Incentivizing reasoning capability in multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:22.647159Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:8fa0428f590051809508ed0a092575fcb11558fd23a318832dbf31144f7fc05c","observation_id":"953bad54-af75-45d8-a8f4-18ea783b6597","resolution":{"observed_at":"2026-08-07T13:22:22.647159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21257","last_updated":"2025-03-25T05:46:03Z","snapshot_observed_at":"2026-08-07T17:39:03.240589Z","submitted_at":"2025-02-28T17:30:39Z","title":"RoboBrain: A Unified Brain Model for Robotic Manipulation from Abstract to Concrete","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.21257","snapshot_observed_at":"2026-08-07T13:22:22.795873Z","title":"RoboBrain: A unified brain model for robotic manipulation from abstract to concrete","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:22.795873Z"},"links":{"cited_paper":"/paper/2502.21257","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:bd1dd3d0c19acd07c77697420fd4c5cb0ddb539a9e3972fb690dcdde3eeb810c","observation_id":"0e8cbed3-1426-4168-89c8-6ca6e30aecaa","resolution":{"observed_at":"2026-08-07T13:22:22.795873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.07241","last_updated":"2024-03-13T02:34:31Z","snapshot_observed_at":"2026-07-06T16:06:02.777393Z","submitted_at":"2023-08-14T16:23:21Z","title":"Context-Aware Planning and Environment-Aware Memory for Instruction Following Embodied Agents","version":4},"cited_work":{"arxiv_id":"2308.07241","doi":"10.48550/arxiv.2308.07241","metadata_source":"pith","pith_arxiv_id":"2308.07241","snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Context-Aware Planning and Environment-Aware Memory for Instruction Following Embodied Agents","venue":"cs.RO","work_id":"4dc297ed-016c-47c4-90f7-2c580f8a3ee5","year":2023},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:22.902090Z"},"links":{"cited_paper":"/paper/2308.07241","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:bf99bcccad8b26ea7673fbbfcc92ac9f6752d4f11fbce9c1bcafae10541e47b8","observation_id":"fb0633e3-f0b5-4c7c-8c62-12fad8a46a5a","resolution":{"observed_at":"2026-08-07T13:22:27.092321Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:29.386863Z","title":"Openvla: An open-source vision-language-action model","venue":null,"work_id":"93afe8b0-aa6c-400a-82eb-9f6b7b8cd216","year":null},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:23.000783Z"},"links":{"citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:e96f976378e0da150a65e4d7b27219ed9ad9aa159b93aead3852cb2f1314f6da","observation_id":"015d696c-6ac0-4202-80c8-9d98520e52c0","resolution":{"observed_at":"2026-08-07T13:22:29.432336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.05474","last_updated":"2022-08-26T17:12:17Z","snapshot_observed_at":"2026-07-06T06:14:28.435222Z","submitted_at":"2017-12-14T23:17:24Z","title":"AI2-THOR: An Interactive 3D Environment for Visual AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.05474","snapshot_observed_at":"2026-08-07T13:22:23.067075Z","title":"Ai2-thor: An interactive 3d environment for visual ai","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:23.067075Z"},"links":{"cited_paper":"/paper/1712.05474","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:4cfdbb354cc6de93b822c11ab10722437d68f8577bff88634748eb657cd2d783","observation_id":"59e6988c-2cf4-4ed4-b91d-b3763ddf060e","resolution":{"observed_at":"2026-08-07T13:22:23.067075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-07T13:22:23.131565Z","title":"Videochat-r1: Enhancing spatio-temporal percep- tion via reinforcement fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:23.131565Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:7472dcf8b7270df96a7652bff1294e2a5b188431ba2c10af07f4c3e32d89aa0d","observation_id":"0a9a00ae-3fd0-46c2-be4e-a04520f0240e","resolution":{"observed_at":"2026-08-07T13:22:23.131565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:23.205810Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:23.205810Z"},"links":{"citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:020c9ac738de68b9f4a3eefb65bb1f9209109d67d53f33745a2fb369e0adf5d2","observation_id":"cd364a8c-639e-4932-8fb5-0d90a571eece","resolution":{"observed_at":"2026-08-07T13:22:23.205810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-05T03:13:54.147007Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-08-07T13:22:23.320295Z","title":"Visual-rft: Visual reinforcement fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:23.320295Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:81a54f707d43b46a27820976ed928c7e695ea8f30470d5b10db4e673f340615a","observation_id":"068979f8-27f0-45ce-abe9-af07d4cc13f9","resolution":{"observed_at":"2026-08-07T13:22:23.320295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14093","last_updated":"2026-05-01T01:50:44Z","snapshot_observed_at":"2026-08-04T06:47:25.827167Z","submitted_at":"2024-05-23T01:43:54Z","title":"A Survey on Vision-Language-Action Models for Embodied AI","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14093","snapshot_observed_at":"2026-08-07T13:22:23.425995Z","title":"A survey on vision-language-action models for embodied ai","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:23.425995Z"},"links":{"cited_paper":"/paper/2405.14093","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:1a01ce8609f04f2acdef4a6f5c7f54a0b8ef1e4f52b2ffb858bebf6bf11b68d8","observation_id":"75ed4314-1218-4b26-9220-0e431c3a42f3","resolution":{"observed_at":"2026-08-07T13:22:23.425995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-08-09T01:06:58.674891Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-07T13:22:23.503690Z","title":"Mm-eureka: Exploring the frontiers of multimodal reasoning with rule-based reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:23.503690Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:2e7cf58b854d58b8e5440499e8e721b48eb06d2f797d62c0ffad9fe4ab4ef04e","observation_id":"594ba930-4cde-4303-9a9a-16a9b0917d39","resolution":{"observed_at":"2026-08-07T13:22:23.503690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:29.177292Z","title":"Composi- tional chain-of-thought prompting for large multimodal models","venue":null,"work_id":"933964d6-635f-440c-9036-96ca17ca17cb","year":2024},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:23.564040Z"},"links":{"citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:3adcaf29efc1da69deebb58d46d3c3d748e06496d7784b57808b9c3ec490456b","observation_id":"c4064ed7-2bcd-4381-970d-e4a9ac66cc24","resolution":{"observed_at":"2026-08-07T13:22:29.284038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:29.038156Z","title":"Kam-cot: Knowledge augmented multimodal chain-of-thoughts reasoning","venue":null,"work_id":"4706e53b-ed8c-447c-9694-6f6eb8d6e704","year":2024},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:23.666632Z"},"links":{"citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:ce2dcb3853d187254c05e0f7aa1a8adccb6923cc82ad4f8c6f2a1eb93579ed64","observation_id":"e6233108-f2b8-4000-acc6-16e29d635747","resolution":{"observed_at":"2026-08-07T13:22:29.088642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15021","last_updated":"2023-09-13T23:46:22Z","snapshot_observed_at":"2026-08-09T16:10:12.411367Z","submitted_at":"2023-05-24T11:04:30Z","title":"EmbodiedGPT: Vision-Language Pre-Training via Embodied Chain of Thought","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15021","snapshot_observed_at":"2026-08-07T13:22:23.750410Z","title":"EmbodiedGPT: Vision-language pre-training via embodied chain of thought","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:23.750410Z"},"links":{"cited_paper":"/paper/2305.15021","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:2b0badcdac98b3182233933dce450cc6ca6a93d9daaeb8c4112a5fab60900119","observation_id":"a379916d-3750-496e-bd5e-d1b9bb0b6812","resolution":{"observed_at":"2026-08-07T13:22:23.750410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:23.820276Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:23.820276Z"},"links":{"citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:4c1bec33c06e5c116e78dd42f728af9bfd47a560c267cada842b78ad824cad16","observation_id":"2893fc7d-e8dd-4666-bbd9-bb90b0675797","resolution":{"observed_at":"2026-08-07T13:22:23.820276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:23.927663Z","title":"Reasoning with large language models, a survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:23.927663Z"},"links":{"citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:ea714e7186119820a19255b69a8d6c17900788e20df75b1ea35bac7406110b20","observation_id":"b6b71b1c-ea92-4cd9-9494-f9eafb0d7505","resolution":{"observed_at":"2026-08-07T13:22:23.927663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:24.070429Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:24.070429Z"},"links":{"citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:177cb673059e5ab8df1ec55fa080fcb6d25ff25fc977995301721c63ca02e474","observation_id":"d138363b-8b9b-4f20-9d31-e6b264d3761b","resolution":{"observed_at":"2026-08-07T13:22:24.070429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:28.889984Z","title":"Say- Plan: Grounding large language models using 3d scene graphs for scalable robot task planning","venue":null,"work_id":"2b8c4382-6c1e-4ffc-a2f2-459b2ed0150d","year":null},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:24.159911Z"},"links":{"citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:6502e1af63a7a3b640dd81e3c8f154361160e3e9000e67bdd9461d08cd23b3f1","observation_id":"2ae79c2a-828f-4a90-8707-f0c4835ee5d8","resolution":{"observed_at":"2026-08-07T13:22:28.955807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:24.234147Z","title":"Habitat: A platform for embodied ai research","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:24.234147Z"},"links":{"citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:48aa44e3c6f781f87f3fca4d967889ef931329ae1ad868d5e4b651fe09cf3bdf","observation_id":"2673d062-04d3-4f5a-b57a-7fce5fcb0cac","resolution":{"observed_at":"2026-08-07T13:22:24.234147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T13:22:24.317114Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:24.317114Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:aadbf594a0b2c4c73d40cbea428f5087fe5eb9b4cadca52dd300d007f74e9d5d","observation_id":"d065253d-040a-4b08-a27e-ec1e2567bcfe","resolution":{"observed_at":"2026-08-07T13:22:24.317114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-08-08T20:11:45.308315Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-07T13:22:24.441874Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:24.441874Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:13fb4132d9c5c23430b0342b89ce3be11d05b4106d0413c88eefe44acabaaf40","observation_id":"82715e8d-d392-48f3-ab1c-027a5694d301","resolution":{"observed_at":"2026-08-07T13:22:24.441874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-08-07T13:22:24.515252Z","title":"Hi robot: Open- ended instruction following with hierarchical vision-language-action models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:24.515252Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:d4181dde283421e74b57eca6b9746e2eb66eca9d02a2bd4b8c7e29c1648a17e8","observation_id":"695f2968-25c7-4f31-8cea-ac6239232391","resolution":{"observed_at":"2026-08-07T13:22:24.515252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15190","last_updated":"2025-03-26T07:42:56Z","snapshot_observed_at":"2026-07-06T18:04:30.291363Z","submitted_at":"2024-04-21T08:10:20Z","title":"Socratic Planner: Self-QA-Based Zero-Shot Planning for Embodied Instruction Following","version":2},"cited_work":{"arxiv_id":"2404.15190","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.15190","snapshot_observed_at":"2026-08-07T13:22:27.678443Z","title":"Socratic Planner: Self-QA-Based Zero-Shot Planning for Embodied Instruction Following","venue":"cs.AI","work_id":"0a99cad9-ac59-4472-a6c3-29bdf6efc439","year":2024},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:24.564479Z"},"links":{"cited_paper":"/paper/2404.15190","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:ca00048538dd1569bee83b515536644967bca01335f06acc91ae404c706459e3","observation_id":"ccb339cc-995d-455f-be9d-1b86e9eb32e4","resolution":{"observed_at":"2026-08-07T13:22:27.751720Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:28.663740Z","title":"Alfred: A benchmark for interpreting grounded instructions for everyday tasks","venue":null,"work_id":"7325c373-53a2-4767-9756-2856c63d6dc4","year":2020},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:24.632852Z"},"links":{"citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:4db2f035edf386d6e274d9d123928d4f54f73255e5a27054ee46e9826d36d27d","observation_id":"e46ce3b6-0470-4a02-a8e7-14900943e03c","resolution":{"observed_at":"2026-08-07T13:22:28.729821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:24.721896Z","title":"Tenenbaum, Leslie Kaelbling, and Michael Katz","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:24.721896Z"},"links":{"citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:c31ec9a9ed9ef663c576b880149579a721545401158bd6d241be37f2794d19a1","observation_id":"9082b7a0-ca47-426e-8226-73f21312d533","resolution":{"observed_at":"2026-08-07T13:22:24.721896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.11302","last_updated":"2022-09-22T20:29:49Z","snapshot_observed_at":"2026-08-06T05:32:03.407339Z","submitted_at":"2022-09-22T20:29:49Z","title":"ProgPrompt: Generating Situated Robot Task Plans using Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.11302","snapshot_observed_at":"2026-08-07T13:22:24.847360Z","title":"ProgPrompt: Generating situated robot task plans using large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:24.847360Z"},"links":{"cited_paper":"/paper/2209.11302","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:9cdec1fa33530cc500517ebd245250d87df5cecf986b8bfb03e4352654678b0a","observation_id":"6c45aed3-41bc-4ada-bbe9-090799f28ba2","resolution":{"observed_at":"2026-08-07T13:22:24.847360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02502","last_updated":"2024-07-10T17:36:25Z","snapshot_observed_at":"2026-08-07T22:37:26.229203Z","submitted_at":"2024-03-04T21:50:29Z","title":"Trial and Error: Exploration-Based Trajectory Optimization for LLM Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02502","snapshot_observed_at":"2026-08-07T13:22:24.912504Z","title":"Trial and error: Exploration-based trajectory optimization for llm agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:24.912504Z"},"links":{"cited_paper":"/paper/2403.02502","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:2379b1e98f4d7ea5c9b7f1439d974ef451c1594e7f9fcfd83ece57628fe85c45","observation_id":"5083a2e4-4759-4062-869c-bc31d46e0826","resolution":{"observed_at":"2026-08-07T13:22:24.912504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:25.024255Z","title":"Reason-rft: Reinforcement fine-tuning for visual reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:25.024255Z"},"links":{"citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:902a20e19c455e42906d25c581bda8dbdb871cc4d3f160b328f405705a750cb9","observation_id":"276bf8bd-f071-4bbf-b57f-362978007a35","resolution":{"observed_at":"2026-08-07T13:22:25.024255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T13:22:25.118215Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:25.118215Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:6ef5fef573f023dabbbab36645bfd1f5298569cbc22b5c8e9bd38b2a3b3de418","observation_id":"5a330e41-731c-4acf-98b7-a7e1e58d8eb7","resolution":{"observed_at":"2026-08-07T13:22:25.118215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10480","last_updated":"2025-03-13T15:49:56Z","snapshot_observed_at":"2026-08-07T17:06:43.087953Z","submitted_at":"2025-03-13T15:49:56Z","title":"World Modeling Makes a Better Planner: Dual Preference Optimization for Embodied Task Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10480","snapshot_observed_at":"2026-08-07T13:22:25.221513Z","title":"World modeling makes a better planner: Dual preference optimization for embodied task planning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:25.221513Z"},"links":{"cited_paper":"/paper/2503.10480","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:5e59a78ed13a4ad4258565029957d42b675e71a0de42d3b3f2dc44a343164983","observation_id":"1ef661ec-05e2-4e3e-be61-65c46d171ec2","resolution":{"observed_at":"2026-08-07T13:22:25.221513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12605","last_updated":"2025-03-23T13:47:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-16T18:39:13Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12605","snapshot_observed_at":"2026-08-07T13:22:25.297429Z","title":"Multimodal chain-of-thought reasoning: A comprehensive survey","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:25.297429Z"},"links":{"cited_paper":"/paper/2503.12605","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:5c1c3d6208785c4b53844e58da8fcff8011616fb319339b84184ff8331b255f3","observation_id":"ea7a803f-cf6c-450e-8f42-ca62b9577c92","resolution":{"observed_at":"2026-08-07T13:22:25.297429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06805","last_updated":"2024-01-18T07:31:47Z","snapshot_observed_at":"2026-07-06T17:14:57.853205Z","submitted_at":"2024-01-10T15:29:21Z","title":"Exploring the Reasoning Abilities of Multimodal Large Language Models (MLLMs): A Comprehensive Survey on Emerging Trends in Multimodal Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06805","snapshot_observed_at":"2026-08-07T13:22:25.358034Z","title":"Exploring the reasoning abilities of multimodal large language models (mllms): A comprehensive survey on emerging trends in multimodal reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:25.358034Z"},"links":{"cited_paper":"/paper/2401.06805","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:78964720e0465fe8d1afde6d72de14ed249bdc04c023308e535385d6cc193a5d","observation_id":"41ebaff6-6b3f-4a3f-b640-c6982e3f7ce5","resolution":{"observed_at":"2026-08-07T13:22:25.358034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20073","last_updated":"2025-05-26T17:19:30Z","snapshot_observed_at":"2026-08-08T11:44:11.313729Z","submitted_at":"2025-04-24T17:57:08Z","title":"RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20073","snapshot_observed_at":"2026-08-07T13:22:25.429370Z","title":"Ragen: Understanding self-evolution in llm agents via multi-turn reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:25.429370Z"},"links":{"cited_paper":"/paper/2504.20073","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:37d942855efe90c1ffeef239b02b95c74650591448e3b24f35f6b4ef9956180b","observation_id":"fc5ff3e5-e4fe-45b7-9a14-d9e94a21e443","resolution":{"observed_at":"2026-08-07T13:22:25.429370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:25.565706Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:25.565706Z"},"links":{"citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:64d8233bade711e33f06a7fbdad0a0da5f29b4b3886534f3fd5b7319a1e32d14","observation_id":"15fc3c6d-8b35-4c25-836b-2832a0b31c7f","resolution":{"observed_at":"2026-08-07T13:22:25.565706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01848","last_updated":"2023-07-04T17:58:25Z","snapshot_observed_at":"2026-08-06T10:55:32.798065Z","submitted_at":"2023-07-04T17:58:25Z","title":"Embodied Task Planning with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01848","snapshot_observed_at":"2026-08-07T13:22:25.663807Z","title":"Embodied task planning with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:25.663807Z"},"links":{"cited_paper":"/paper/2307.01848","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:45c8efc469d2190373e111156b815ddf3b0f501aa1d461c5dc751c7515e3405d","observation_id":"5a3083d7-dbd6-4f84-9679-685ec544d6eb","resolution":{"observed_at":"2026-08-07T13:22:25.663807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:25.727513Z","title":"The rise and potential of large language model based agents: A survey","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:25.727513Z"},"links":{"citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:d8a457902acf9803dfead28c566f1eedaa26266725a44cace4038833809eeeb3","observation_id":"4b9d0635-0905-4b8f-a6d7-e53cb7270b75","resolution":{"observed_at":"2026-08-07T13:22:25.727513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02385","last_updated":"2024-02-04T07:55:01Z","snapshot_observed_at":"2026-08-04T15:45:08.679135Z","submitted_at":"2024-02-04T07:55:01Z","title":"A Survey on Robotics with Foundation Models: toward Embodied AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02385","snapshot_observed_at":"2026-08-07T13:22:25.853615Z","title":"A survey on robotics with foundation models: toward embodied ai","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:25.853615Z"},"links":{"cited_paper":"/paper/2402.02385","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:39a11820b5f588dfdf005fb978a4d5cb2d2ed2995c0b56bf0ddfeda14e2dad92","observation_id":"cf71a2cf-9922-41d1-8c85-ac16f9273565","resolution":{"observed_at":"2026-08-07T13:22:25.853615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-07T13:22:25.974006Z","title":"Em- bodiedbench: Comprehensive benchmarking multi-modal large language models for vision-driven embodied agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:25.974006Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:0d135e4698f827d9a8c3568ced07b213a468066105e8d9e44416cd918720b285","observation_id":"33ed233e-2815-4edb-9741-68178e0e3971","resolution":{"observed_at":"2026-08-07T13:22:25.974006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03387","last_updated":"2025-07-29T16:23:02Z","snapshot_observed_at":"2026-08-08T04:13:22.884923Z","submitted_at":"2025-02-05T17:23:45Z","title":"LIMO: Less is More for Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03387","snapshot_observed_at":"2026-08-07T13:22:26.046698Z","title":"Limo: Less is more for reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:26.046698Z"},"links":{"cited_paper":"/paper/2502.03387","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:b768c6d633ba41f1cc859bc1731b3a9a0f305e9d04fd95f5fd33521bc534c350","observation_id":"b0ed911a-61c7-49ab-87f3-87547d71b64f","resolution":{"observed_at":"2026-08-07T13:22:26.046698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:28.500611Z","title":"Robotic control via embodied chain-of-thought reasoning","venue":null,"work_id":"f2eb23d8-177e-41df-9167-dfb7e6be512b","year":2024},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:26.135876Z"},"links":{"citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:c4c088d862774950c30aa49edd95f54d439b5517895ca6f97f6f0cfe28d49564","observation_id":"d3d90c58-7546-4690-99e6-d95fd96565d2","resolution":{"observed_at":"2026-08-07T13:22:28.569347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05273","last_updated":"2025-02-03T04:07:37Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-09-12T09:18:09Z","title":"HiRT: Enhancing Robotic Control with Hierarchical Robot Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05273","snapshot_observed_at":"2026-08-07T13:22:26.186961Z","title":"Hirt: Enhancing robotic control with hierarchical robot transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:26.186961Z"},"links":{"cited_paper":"/paper/2410.05273","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:254e10b99e39480617388b6199c717a2ef1649b853e5858d502b68541f1cbdb4","observation_id":"7b573dbf-8950-48cd-911b-78c2857b79dd","resolution":{"observed_at":"2026-08-07T13:22:26.186961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:26.234405Z","title":"Vision-language models for vision tasks: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:26.234405Z"},"links":{"citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:4fd19a9522e4979ad5bdc77f32839fc1a2615470b4b2a827be3e78521e5955a8","observation_id":"e896157e-17c9-47f5-bca2-da733487fbde","resolution":{"observed_at":"2026-08-07T13:22:26.234405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12937","last_updated":"2025-08-04T04:22:09Z","snapshot_observed_at":"2026-08-06T21:34:54.534751Z","submitted_at":"2025-03-17T08:51:44Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12937","snapshot_observed_at":"2026-08-07T13:22:26.330503Z","title":"R1-vl: Learning to reason with multimodal large language models via step-wise group relative policy optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:26.330503Z"},"links":{"cited_paper":"/paper/2503.12937","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:bd4cfab64713b5337bb8a5371729390dc63ba8ebb126c77cbbd0716638b4b3a1","observation_id":"2401c5a6-982c-49ee-81e2-e35b5de658ad","resolution":{"observed_at":"2026-08-07T13:22:26.330503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21696","last_updated":"2025-05-14T17:48:02Z","snapshot_observed_at":"2026-08-07T16:32:15.166320Z","submitted_at":"2025-03-27T17:00:51Z","title":"Embodied-Reasoner: Synergizing Visual Search, Reasoning, and Action for Embodied Interactive Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21696","snapshot_observed_at":"2026-08-07T13:22:26.448609Z","title":"Embodied-reasoner: Synergizing visual search, reasoning, and action for embodied interactive tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:26.448609Z"},"links":{"cited_paper":"/paper/2503.21696","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:3aff4bf8af95b6b95a9932e305b23ea1aa3c67c243ebeba44368c2271b74f6c4","observation_id":"3365ba74-cedf-4a8a-bb6a-1d6134f17680","resolution":{"observed_at":"2026-08-07T13:22:26.448609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T13:22:26.520134Z","title":"Multimodal chain-of-thought reasoning in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:26.520134Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:8e5c33df35983e43aa4105c9aa6de756363cbbcd4dfc378ec3be4c6598791d30","observation_id":"ba02ac77-4754-4ff3-8aeb-e459fef570f7","resolution":{"observed_at":"2026-08-07T13:22:26.520134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12680","last_updated":"2025-04-17T06:16:11Z","snapshot_observed_at":"2026-08-07T16:01:36.502631Z","submitted_at":"2025-04-17T06:16:11Z","title":"Embodied-R: Collaborative Framework for Activating Embodied Spatial Reasoning in Foundation Models via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12680","snapshot_observed_at":"2026-08-07T13:22:26.571212Z","title":"Embodied-r: Collaborative framework for activating embodied spatial reasoning in foundation models via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:26.571212Z"},"links":{"cited_paper":"/paper/2504.12680","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:3c20c8d83a70e879af6f9121f65d24620d9b8ba843d17b72e0409dc0f49d3099","observation_id":"72e92544-ffec-44c3-805d-e83ce60e3698","resolution":{"observed_at":"2026-08-07T13:22:26.571212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13372","last_updated":"2024-06-27T22:44:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-20T08:08:54Z","title":"LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13372","snapshot_observed_at":"2026-08-07T13:22:26.635776Z","title":"messages","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:26.635776Z"},"links":{"cited_paper":"/paper/2403.13372","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:eec4d0549d922804f389e4bee30eb6f7eaa497b791759c37a0d07d0d31a9c3de","observation_id":"d2b29aa4-dbbc-4fdb-8da3-7385faca2cff","resolution":{"observed_at":"2026-08-07T13:22:26.635776Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:28.256465Z","title":"reasoning_and_reflection\\","venue":null,"work_id":"79090be9-785e-47e6-b4e8-637e7cad5adf","year":null},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:26.700111Z"},"links":{"citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:3d223555dda0eddee69b824e930e2c027d89d8c1a2fe5961793c50acdcb2cf60","observation_id":"1f57eff8-5fb6-4f00-974e-911afd275ee8","resolution":{"observed_at":"2026-08-07T13:22:28.353645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:28.138285Z","title":null,"venue":null,"work_id":"45b989b4-4688-4619-813a-3dc640645fd3","year":null},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":224,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:26.851204Z"},"links":{"citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:5dcc6604b4821180d31f021e01973b0c343a56d82ec90cbf38ef0e2879cc231a","observation_id":"9bede566-deae-4e2d-a0ba-ca8adacd5eec","resolution":{"observed_at":"2026-08-07T13:22:28.207679Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-09T16:11:11.624214Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":47,"verified_exact":2,"verified_fuzzy":15},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 6 inbound Pith citation observations for arXiv:2505.22050."}