{"as_of":"2026-08-21T00:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c0a04887b63374e99a2cf4f5d10c0b6e893ac003eb1c4b7e7efaabfe37c2b27a","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:33:12.777054Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T20:32:29.151581Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T21:00:09.870570Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.12744","last_updated":"2025-05-19T06:00:14Z","snapshot_observed_at":"2026-08-17T20:30:55.214558Z","submitted_at":"2025-05-19T06:00:14Z","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12744","snapshot_observed_at":"2026-08-03T20:32:29.151581Z","title":"Incen- tivizing multimodal reasoning in large models for direct robot manipulation.arXiv preprint arXiv:2505.12744, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19433","last_updated":"2026-05-29T16:37:52Z","snapshot_observed_at":"2026-08-18T00:54:37.494749Z","submitted_at":"2025-11-24T18:59:51Z","title":"Mixture of Horizons in Action Chunking","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T20:32:29.151581Z"},"links":{"cited_paper":"/paper/2505.12744","citing_paper":"/paper/2511.19433"},"observation_digest":"sha256:a60eda6235d67b501b449e618ee7fb1dc7b96c9af39534fd1930ba093821bef9","observation_id":"97ee8c20-695a-4f66-bf59-d38a765773a6","resolution":{"observed_at":"2026-08-03T20:32:29.151581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12744","last_updated":"2025-05-19T06:00:14Z","snapshot_observed_at":"2026-08-17T20:30:55.214558Z","submitted_at":"2025-05-19T06:00:14Z","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12744","snapshot_observed_at":"2026-08-02T22:14:29.619640Z","title":"Incentivizing multimodal reasoning in large models for direct robot manipulation.arXiv preprint arXiv:2505.12744, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.17659","last_updated":"2026-07-15T16:20:07Z","snapshot_observed_at":"2026-08-15T10:49:41.891752Z","submitted_at":"2026-02-19T18:59:20Z","title":"When Vision Overrides Language: Evaluating and Mitigating Counterfactual Failures in VLAs","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T22:14:29.619640Z"},"links":{"cited_paper":"/paper/2505.12744","citing_paper":"/paper/2602.17659"},"observation_digest":"sha256:9ce08fd51a83f8f46fe9b68e23745272e5b4abbfc5ab406d2c4676b60ea4a9ef","observation_id":"7d9088c2-a2cb-4738-b39a-86e8688c1840","resolution":{"observed_at":"2026-08-02T22:14:29.619640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12744","last_updated":"2025-05-19T06:00:14Z","snapshot_observed_at":"2026-08-17T20:30:55.214558Z","submitted_at":"2025-05-19T06:00:14Z","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2505.12744","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.12744","snapshot_observed_at":"2026-07-04T21:00:09.870570Z","title":"Incentivizing multimodal reasoning in large models for direct robot manipulation,","venue":null,"work_id":"706ebd97-be81-4d1a-b3b4-5103c38fa963","year":2025},"citing_paper":{"arxiv_id":"2606.26095","last_updated":"2026-06-24T17:59:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-24T17:59:56Z","title":"Learning Action Priors for Cross-embodiment Robot Manipulation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-25T19:09:56.409766Z"},"links":{"cited_paper":"/paper/2505.12744","citing_paper":"/paper/2606.26095"},"observation_digest":"sha256:e6e3d3cffa3b59a2e57df45ecefc9d6e36ac0d6e1271056793d91fb8f0dc2df6","observation_id":"fc62dda3-bc48-4f55-87eb-adba98446f84","resolution":{"observed_at":"2026-07-04T21:00:09.872094Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.12744/citation-record","integrity":"/paper/2505.12744/integrity","json":"/paper/2505.12744/citation-record.json","paper":"/paper/2505.12744"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-08-18T11:44:22.813405Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-15T20:33:12.553051Z","title":"Do as i can, not as i say: Grounding language in robotic affordances.arXiv preprint arXiv:2204.01691, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.12744","last_updated":"2025-05-19T06:00:14Z","snapshot_observed_at":"2026-08-17T20:30:55.214558Z","submitted_at":"2025-05-19T06:00:14Z","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T20:33:12.553051Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2505.12744"},"observation_digest":"sha256:4314697508a2c10cf166383ddb6aad327fa4b940db195813163597acf846c657","observation_id":"c9437be8-6633-42fe-93ba-a99950227dc9","resolution":{"observed_at":"2026-08-15T20:33:12.553051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-15T20:33:12.558552Z","title":"Qwen2.5-vl technical report.arXiv preprint arXiv:2502.13923, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12744","last_updated":"2025-05-19T06:00:14Z","snapshot_observed_at":"2026-08-17T20:30:55.214558Z","submitted_at":"2025-05-19T06:00:14Z","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T20:33:12.558552Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.12744"},"observation_digest":"sha256:414df1ad0698b5d6a3ce585501f75dfd341650356cdf0032e9b12afd82140ea8","observation_id":"054d140b-ea7f-4dca-a1bc-a6c150433fb9","resolution":{"observed_at":"2026-08-15T20:33:12.558552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-08-16T17:53:54.636855Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-15T20:33:12.562465Z","title":"pi_0: A vision-language-action flow model for general robot control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12744","last_updated":"2025-05-19T06:00:14Z","snapshot_observed_at":"2026-08-17T20:30:55.214558Z","submitted_at":"2025-05-19T06:00:14Z","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T20:33:12.562465Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2505.12744"},"observation_digest":"sha256:bdfa7312b04933490f0de938611927658b57bd9e08688eb47bb214ae022bc54a","observation_id":"1e16e946-49ef-4832-850b-1edf634bf5c5","resolution":{"observed_at":"2026-08-15T20:33:12.562465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-15T20:33:12.567255Z","title":"Rt-1: Robotics transformer for real-world control at scale.arXiv preprint arXiv:2212.06817, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.12744","last_updated":"2025-05-19T06:00:14Z","snapshot_observed_at":"2026-08-17T20:30:55.214558Z","submitted_at":"2025-05-19T06:00:14Z","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T20:33:12.567255Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2505.12744"},"observation_digest":"sha256:f4406e79c68cf393c769ef836fab227cbdde15b4e5f20a4793d10c91e29403ea","observation_id":"da33bb5f-c837-4fb8-a835-2512447dfc05","resolution":{"observed_at":"2026-08-15T20:33:12.567255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-15T20:33:12.571906Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control.arXiv preprint arXiv:2307.15818, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12744","last_updated":"2025-05-19T06:00:14Z","snapshot_observed_at":"2026-08-17T20:30:55.214558Z","submitted_at":"2025-05-19T06:00:14Z","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T20:33:12.571906Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2505.12744"},"observation_digest":"sha256:6e1e82707cb491a832c5bbe1e7edfc67dc44d414a04db2f4fdcc53ea3e1f6202","observation_id":"5cfd8230-3e87-42a8-9973-5e58e278c02c","resolution":{"observed_at":"2026-08-15T20:33:12.571906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00785","last_updated":"2024-10-17T13:41:16Z","snapshot_observed_at":"2026-08-16T13:08:25.687323Z","submitted_at":"2024-10-17T13:41:16Z","title":"IGOR: Image-GOal Representations are the Atomic Control Units for Foundation Models in Embodied AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00785","snapshot_observed_at":"2026-08-15T20:33:12.577205Z","title":"Igor: Image-goal representations are the atomic control units for foundation models in embodied ai.arXiv preprint arXiv:2411.00785, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12744","last_updated":"2025-05-19T06:00:14Z","snapshot_observed_at":"2026-08-17T20:30:55.214558Z","submitted_at":"2025-05-19T06:00:14Z","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T20:33:12.577205Z"},"links":{"cited_paper":"/paper/2411.00785","citing_paper":"/paper/2505.12744"},"observation_digest":"sha256:0a8d870532df0eb941cdf25a5cf0f68de9f28eaf1e779c2c70e7267bc273b76a","observation_id":"606d6697-a9b2-4e10-8309-64266fbc35a7","resolution":{"observed_at":"2026-08-15T20:33:12.577205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:33:12.582124Z","title":"Moto: Latent motion token as the bridging language for robot manipulation.arXiv preprint arXiv:2412.04445, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12744","last_updated":"2025-05-19T06:00:14Z","snapshot_observed_at":"2026-08-17T20:30:55.214558Z","submitted_at":"2025-05-19T06:00:14Z","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T20:33:12.582124Z"},"links":{"citing_paper":"/paper/2505.12744"},"observation_digest":"sha256:8bd3a01dfa620f9586a3747b781e6b0cb974553ddc125f9579f17495bc7a550d","observation_id":"111b15a2-ae6e-41b3-8f13-6e8d87168424","resolution":{"observed_at":"2026-08-15T20:33:12.582124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04137","last_updated":"2024-03-14T04:36:31Z","snapshot_observed_at":"2026-08-08T17:26:38.829859Z","submitted_at":"2023-03-07T18:50:03Z","title":"Diffusion Policy: Visuomotor Policy Learning via Action Diffusion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04137","snapshot_observed_at":"2026-08-15T20:33:12.587177Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion.arXiv preprint arXiv:2303.04137, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12744","last_updated":"2025-05-19T06:00:14Z","snapshot_observed_at":"2026-08-17T20:30:55.214558Z","submitted_at":"2025-05-19T06:00:14Z","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:33:12.587177Z"},"links":{"cited_paper":"/paper/2303.04137","citing_paper":"/paper/2505.12744"},"observation_digest":"sha256:a93a5fcf21213c99a4dd27c3a622f6ed9810a7ec8578e04ce172535189e365ef","observation_id":"3f5ea101-12cc-4bdc-906f-f89c6caf2e26","resolution":{"observed_at":"2026-08-15T20:33:12.587177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:33:13.515138Z","title":"Dynamo: In-domain dynamics pretraining for visuo.Motor Control, 2024","venue":null,"work_id":"6a3a1cb7-7c46-47c7-8c35-25a981cf7276","year":2024},"citing_paper":{"arxiv_id":"2505.12744","last_updated":"2025-05-19T06:00:14Z","snapshot_observed_at":"2026-08-17T20:30:55.214558Z","submitted_at":"2025-05-19T06:00:14Z","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:33:12.592029Z"},"links":{"citing_paper":"/paper/2505.12744"},"observation_digest":"sha256:c21138c64ffad940a6d9fe86d19e3dc5371ab427fe86bfb7591e9d22dea60bf8","observation_id":"e276d1f4-9344-43a9-b333-59525faf413a","resolution":{"observed_at":"2026-08-15T20:33:13.519431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:33:13.499932Z","title":"Fineclip: Self-distilled region-based clip for better fine-grained understanding.Advances in Neural Information Processing Systems, 2024","venue":null,"work_id":"2ab0d947-377e-4130-8917-a3d06cfd19b8","year":2024},"citing_paper":{"arxiv_id":"2505.12744","last_updated":"2025-05-19T06:00:14Z","snapshot_observed_at":"2026-08-17T20:30:55.214558Z","submitted_at":"2025-05-19T06:00:14Z","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T20:33:12.597140Z"},"links":{"citing_paper":"/paper/2505.12744"},"observation_digest":"sha256:91eaa0dcb5770d2c961ecc059275c380bef2d0633257f2e3833102e914867c9e","observation_id":"25f9d2c0-de3e-4921-9b46-32627781030a","resolution":{"observed_at":"2026-08-15T20:33:13.505543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-14T18:47:26.721223Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-15T20:33:12.601561Z","title":"Palm-e: An embodied multimodal language model.arXiv preprint arXiv:2303.03378, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12744","last_updated":"2025-05-19T06:00:14Z","snapshot_observed_at":"2026-08-17T20:30:55.214558Z","submitted_at":"2025-05-19T06:00:14Z","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:33:12.601561Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2505.12744"},"observation_digest":"sha256:882be57af2b4730fa4b3cdb3b10d06b7b85e3ca9a0a3653e1c48e424f35357e2","observation_id":"2310d7c0-ac87-4591-9314-9448a7f5b668","resolution":{"observed_at":"2026-08-15T20:33:12.601561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.13396","last_updated":"2021-09-27T23:42:12Z","snapshot_observed_at":"2026-07-06T11:51:58.310046Z","submitted_at":"2021-09-27T23:42:12Z","title":"Bridge Data: Boosting Generalization of Robotic Skills with Cross-Domain Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.13396","snapshot_observed_at":"2026-08-15T20:33:12.606383Z","title":"Bridge data: Boosting generalization of robotic skills with cross-domain datasets.arXiv preprint arXiv:2109.13396, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.12744","last_updated":"2025-05-19T06:00:14Z","snapshot_observed_at":"2026-08-17T20:30:55.214558Z","submitted_at":"2025-05-19T06:00:14Z","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T20:33:12.606383Z"},"links":{"cited_paper":"/paper/2109.13396","citing_paper":"/paper/2505.12744"},"observation_digest":"sha256:fde8df171816763fe8f65e35ae7e5c7e0c1820ef5380b6f0dbb95be8ffbd2c9e","observation_id":"58f55d5e-666f-48ef-849e-e3f2976303b2","resolution":{"observed_at":"2026-08-15T20:33:12.606383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T20:33:12.610886Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12744","last_updated":"2025-05-19T06:00:14Z","snapshot_observed_at":"2026-08-17T20:30:55.214558Z","submitted_at":"2025-05-19T06:00:14Z","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T20:33:12.610886Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.12744"},"observation_digest":"sha256:cbb684804ff95aba84a9a10afce47fec1440633fab6cda490b037d4d0a08fd00","observation_id":"7a626588-9adc-4552-b445-32193d6d50aa","resolution":{"observed_at":"2026-08-15T20:33:12.610886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:33:12.615147Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.12744","last_updated":"2025-05-19T06:00:14Z","snapshot_observed_at":"2026-08-17T20:30:55.214558Z","submitted_at":"2025-05-19T06:00:14Z","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T20:33:12.615147Z"},"links":{"citing_paper":"/paper/2505.12744"},"observation_digest":"sha256:313b766d023e35d3e1956e4a07c0c8aeeb7ea815fa126ed28b739a385d583ea8","observation_id":"b14d0579-2e9c-457a-aec7-578d4479316b","resolution":{"observed_at":"2026-08-15T20:33:12.615147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:33:12.619297Z","title":"Lora: Low-rank adaptation of large language models.ICLR, 1(2):3, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.12744","last_updated":"2025-05-19T06:00:14Z","snapshot_observed_at":"2026-08-17T20:30:55.214558Z","submitted_at":"2025-05-19T06:00:14Z","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T20:33:12.619297Z"},"links":{"citing_paper":"/paper/2505.12744"},"observation_digest":"sha256:4265141b4ca2c55b35b6971245557a37c85fc56eb25597ea5b346cbd3203e188","observation_id":"9bbd22c5-1ada-438a-81e9-17f19e201937","resolution":{"observed_at":"2026-08-15T20:33:12.619297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03262","last_updated":"2025-11-10T15:11:13Z","snapshot_observed_at":"2026-08-16T04:57:30.418363Z","submitted_at":"2025-01-04T02:08:06Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03262","snapshot_observed_at":"2026-08-15T20:33:12.623781Z","title":"Reinforce++: A simple and efficient approach for aligning large language models.arXiv preprint arXiv:2501.03262, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12744","last_updated":"2025-05-19T06:00:14Z","snapshot_observed_at":"2026-08-17T20:30:55.214558Z","submitted_at":"2025-05-19T06:00:14Z","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:33:12.623781Z"},"links":{"cited_paper":"/paper/2501.03262","citing_paper":"/paper/2505.12744"},"observation_digest":"sha256:e238dc11c97c74a68b5fd901c31f313a50d40e1f248f21af93587e0d862172f9","observation_id":"50121185-7d97-45e8-9ee5-c5b68b326891","resolution":{"observed_at":"2026-08-15T20:33:12.623781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12871","last_updated":"2024-05-09T17:35:44Z","snapshot_observed_at":"2026-08-05T10:01:43.401012Z","submitted_at":"2023-11-18T01:21:38Z","title":"An Embodied Generalist Agent in 3D World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12871","snapshot_observed_at":"2026-08-15T20:33:12.628364Z","title":"An embodied generalist agent in 3d world.arXiv preprint arXiv:2311.12871, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12744","last_updated":"2025-05-19T06:00:14Z","snapshot_observed_at":"2026-08-17T20:30:55.214558Z","submitted_at":"2025-05-19T06:00:14Z","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T20:33:12.628364Z"},"links":{"cited_paper":"/paper/2311.12871","citing_paper":"/paper/2505.12744"},"observation_digest":"sha256:dc013f3965940fa3800b221fd0854256ae21fc5f8823d1de9e2a3539a10e7735","observation_id":"986b2236-b0fb-41ab-87a0-c89adc56dad2","resolution":{"observed_at":"2026-08-15T20:33:12.628364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05973","last_updated":"2023-11-02T06:53:37Z","snapshot_observed_at":"2026-08-05T01:03:23.456778Z","submitted_at":"2023-07-12T07:40:48Z","title":"VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05973","snapshot_observed_at":"2026-08-15T20:33:12.633560Z","title":"V oxposer: Composable 3d value maps for robotic manipulation with language models.arXiv preprint arXiv:2307.05973, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12744","last_updated":"2025-05-19T06:00:14Z","snapshot_observed_at":"2026-08-17T20:30:55.214558Z","submitted_at":"2025-05-19T06:00:14Z","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T20:33:12.633560Z"},"links":{"cited_paper":"/paper/2307.05973","citing_paper":"/paper/2505.12744"},"observation_digest":"sha256:5271f9072dc26aff9871335c18a1fef2dd0356ca6b810fa991f282cb29a9389a","observation_id":"46f8da5e-a78c-424f-a55f-ea76046ce8cd","resolution":{"observed_at":"2026-08-15T20:33:12.633560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01652","last_updated":"2024-11-12T04:33:26Z","snapshot_observed_at":"2026-07-29T23:37:00.228879Z","submitted_at":"2024-09-03T06:45:22Z","title":"ReKep: Spatio-Temporal Reasoning of Relational Keypoint Constraints for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01652","snapshot_observed_at":"2026-08-15T20:33:12.638487Z","title":"Rekep: Spatio-temporal reasoning of relational keypoint constraints for robotic manipulation.arXiv preprint arXiv:2409.01652, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12744","last_updated":"2025-05-19T06:00:14Z","snapshot_observed_at":"2026-08-17T20:30:55.214558Z","submitted_at":"2025-05-19T06:00:14Z","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T20:33:12.638487Z"},"links":{"cited_paper":"/paper/2409.01652","citing_paper":"/paper/2505.12744"},"observation_digest":"sha256:6156421cd13f6598621a042d8945f437782eacc849ab576c782d5729e9732828","observation_id":"303ff475-e242-476a-85db-5a372d88be0a","resolution":{"observed_at":"2026-08-15T20:33:12.638487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-08-19T11:46:55.171293Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-15T20:33:12.643545Z","title":"Openai o1 system card.arXiv preprint arXiv:2412.16720, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12744","last_updated":"2025-05-19T06:00:14Z","snapshot_observed_at":"2026-08-17T20:30:55.214558Z","submitted_at":"2025-05-19T06:00:14Z","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T20:33:12.643545Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2505.12744"},"observation_digest":"sha256:5db2ceba61702e7737e3edac31cdde0db1f1d91fff47ae098f464aca45b44dab","observation_id":"2a5dfefd-cce6-435a-b488-0ad208ff35e0","resolution":{"observed_at":"2026-08-15T20:33:12.643545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:33:12.648186Z","title":"macmillan, 2011","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.12744","last_updated":"2025-05-19T06:00:14Z","snapshot_observed_at":"2026-08-17T20:30:55.214558Z","submitted_at":"2025-05-19T06:00:14Z","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T20:33:12.648186Z"},"links":{"citing_paper":"/paper/2505.12744"},"observation_digest":"sha256:642d3e9fd2e0b05e7dacc991251cfec58a04d12225936ec13e18b1a2fed0cf50","observation_id":"3fef3789-952a-4476-8729-aec616554738","resolution":{"observed_at":"2026-08-15T20:33:12.648186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-08-16T21:53:14.144225Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-15T20:33:12.652973Z","title":"Openvla: An open-source vision-language-action model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12744","last_updated":"2025-05-19T06:00:14Z","snapshot_observed_at":"2026-08-17T20:30:55.214558Z","submitted_at":"2025-05-19T06:00:14Z","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T20:33:12.652973Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2505.12744"},"observation_digest":"sha256:9ad293838630ce8549af5b08df5e3059b369d77d224a0ae7532892a434a9fd03","observation_id":"6e4172b8-3e57-4640-bdb3-cf3dc4763842","resolution":{"observed_at":"2026-08-15T20:33:12.652973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:33:12.657610Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12744","last_updated":"2025-05-19T06:00:14Z","snapshot_observed_at":"2026-08-17T20:30:55.214558Z","submitted_at":"2025-05-19T06:00:14Z","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T20:33:12.657610Z"},"links":{"citing_paper":"/paper/2505.12744"},"observation_digest":"sha256:6d1aef233bb9980e3028b11e23669afa245fa3bd77351fb68e848fe313bdb118","observation_id":"5f107e40-f37e-45ca-825c-956417c6268c","resolution":{"observed_at":"2026-08-15T20:33:12.657610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-08-13T00:43:50.403870Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-15T20:33:12.661855Z","title":"Vision-language foundation models as effective robot imitators.arXiv preprint arXiv:2311.01378, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12744","last_updated":"2025-05-19T06:00:14Z","snapshot_observed_at":"2026-08-17T20:30:55.214558Z","submitted_at":"2025-05-19T06:00:14Z","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T20:33:12.661855Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2505.12744"},"observation_digest":"sha256:6723c35bbb5ebcda904ed7d7f7994187373ba00610c65f802a6a8a76bc2a621b","observation_id":"bb1253bf-5e96-4e42-8e72-246894153c22","resolution":{"observed_at":"2026-08-15T20:33:12.661855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05941","last_updated":"2024-05-09T17:30:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-09T17:30:16Z","title":"Evaluating Real-World Robot Manipulation Policies in Simulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05941","snapshot_observed_at":"2026-08-15T20:33:12.666548Z","title":"Evaluating real-world robot manipulation policies in simulation.arXiv preprint arXiv:2405.05941, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12744","last_updated":"2025-05-19T06:00:14Z","snapshot_observed_at":"2026-08-17T20:30:55.214558Z","submitted_at":"2025-05-19T06:00:14Z","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T20:33:12.666548Z"},"links":{"cited_paper":"/paper/2405.05941","citing_paper":"/paper/2505.12744"},"observation_digest":"sha256:f48dd6627dfd21fbb215202dacd707a351fdbddd25d1ddc391bf773d0614ab91","observation_id":"337af9f0-41c6-439d-950f-33fc041554ac","resolution":{"observed_at":"2026-08-15T20:33:12.666548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:33:13.445997Z","title":"Open-vocabulary semantic segmentation with mask-adapted clip","venue":null,"work_id":"a361cfed-0431-4a0b-9e8c-bf07b1ad6806","year":2023},"citing_paper":{"arxiv_id":"2505.12744","last_updated":"2025-05-19T06:00:14Z","snapshot_observed_at":"2026-08-17T20:30:55.214558Z","submitted_at":"2025-05-19T06:00:14Z","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T20:33:12.670722Z"},"links":{"citing_paper":"/paper/2505.12744"},"observation_digest":"sha256:e0a3990c75b23fdfe120ddf83c56482fd36f1f8a96adac7411b937b0d127e7e2","observation_id":"8dd7c1a0-a8b9-41dd-9eb4-2746304ca2a7","resolution":{"observed_at":"2026-08-15T20:33:13.450848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:33:12.674400Z","title":"Code as policies: Language model programs for embodied control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12744","last_updated":"2025-05-19T06:00:14Z","snapshot_observed_at":"2026-08-17T20:30:55.214558Z","submitted_at":"2025-05-19T06:00:14Z","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T20:33:12.674400Z"},"links":{"citing_paper":"/paper/2505.12744"},"observation_digest":"sha256:6d349975e98e215cfebdcf2f14c1102fad9dbe516f2023408db2fff8c0b48599","observation_id":"d25ab36c-4505-44c6-b94d-37d449624964","resolution":{"observed_at":"2026-08-15T20:33:12.674400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:33:12.678103Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.12744","last_updated":"2025-05-19T06:00:14Z","snapshot_observed_at":"2026-08-17T20:30:55.214558Z","submitted_at":"2025-05-19T06:00:14Z","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T20:33:12.678103Z"},"links":{"citing_paper":"/paper/2505.12744"},"observation_digest":"sha256:11ca7c12a0adde1e3f24677cb78b0799db6743964c91127884e7749a74a7e810","observation_id":"8f31f9f2-cb43-4c08-a1ca-2e79ef004195","resolution":{"observed_at":"2026-08-15T20:33:12.678103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1608.03983","last_updated":"2017-05-03T16:28:09Z","snapshot_observed_at":"2026-07-06T05:06:55.589962Z","submitted_at":"2016-08-13T13:46:05Z","title":"SGDR: Stochastic Gradient Descent with Warm Restarts","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1608.03983","snapshot_observed_at":"2026-08-15T20:33:12.682078Z","title":"Sgdr: Stochastic gradient descent with warm restarts.arXiv preprint arXiv:1608.03983, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.12744","last_updated":"2025-05-19T06:00:14Z","snapshot_observed_at":"2026-08-17T20:30:55.214558Z","submitted_at":"2025-05-19T06:00:14Z","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T20:33:12.682078Z"},"links":{"cited_paper":"/paper/1608.03983","citing_paper":"/paper/2505.12744"},"observation_digest":"sha256:0f786f684ac7630edb23de667d51a6cbbd6bb6868f1a03b3f92a73f1376d3fd3","observation_id":"20cc83de-0d40-4efb-ad29-71bdc6ae1a2f","resolution":{"observed_at":"2026-08-15T20:33:12.682078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-15T20:33:12.686035Z","title":"Decoupled weight decay regularization.arXiv preprint arXiv:1711.05101, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.12744","last_updated":"2025-05-19T06:00:14Z","snapshot_observed_at":"2026-08-17T20:30:55.214558Z","submitted_at":"2025-05-19T06:00:14Z","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T20:33:12.686035Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2505.12744"},"observation_digest":"sha256:d60f217126a05494ee3b8e2b709eb4c91eb4cf22fc941fa1a24a7f9b058f160e","observation_id":"0c920773-b5c1-4072-be56-67ce2a73af87","resolution":{"observed_at":"2026-08-15T20:33:12.686035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-08-13T13:59:48.091257Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08864","snapshot_observed_at":"2026-08-15T20:33:12.689769Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models.arXiv preprint arXiv:2310.08864, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12744","last_updated":"2025-05-19T06:00:14Z","snapshot_observed_at":"2026-08-17T20:30:55.214558Z","submitted_at":"2025-05-19T06:00:14Z","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T20:33:12.689769Z"},"links":{"cited_paper":"/paper/2310.08864","citing_paper":"/paper/2505.12744"},"observation_digest":"sha256:426b14b4ea41142378decc002b3c4b9e8fdd24522461a6768f7f24810382a6e8","observation_id":"92af7a2e-7f78-43c7-899f-37ac6c3d585c","resolution":{"observed_at":"2026-08-15T20:33:12.689769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-15T20:33:12.693826Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.12744","last_updated":"2025-05-19T06:00:14Z","snapshot_observed_at":"2026-08-17T20:30:55.214558Z","submitted_at":"2025-05-19T06:00:14Z","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T20:33:12.693826Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.12744"},"observation_digest":"sha256:ed1c5f38e635b87f30a2618869fc7df21170088044a47e8b8abc8ae195f88a44","observation_id":"21cc9d64-dee7-4f4a-8b34-c857a59247c3","resolution":{"observed_at":"2026-08-15T20:33:12.693826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-15T20:33:12.697547Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12744","last_updated":"2025-05-19T06:00:14Z","snapshot_observed_at":"2026-08-17T20:30:55.214558Z","submitted_at":"2025-05-19T06:00:14Z","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T20:33:12.697547Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.12744"},"observation_digest":"sha256:3558ea9ffa523411f4d9488121db82ec732cdef91979dade111155764ee94936","observation_id":"79013272-2282-41c1-b221-9800cec958a6","resolution":{"observed_at":"2026-08-15T20:33:12.697547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-08-15T20:33:12.702319Z","title":"Hi robot: Open-ended instruction following with hierarchical vision-language-action models.arXiv preprint arXiv:2502.19417, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12744","last_updated":"2025-05-19T06:00:14Z","snapshot_observed_at":"2026-08-17T20:30:55.214558Z","submitted_at":"2025-05-19T06:00:14Z","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T20:33:12.702319Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2505.12744"},"observation_digest":"sha256:d7954a6d3f971e8e051a53e20610c28bccbc8d27535eda1f215a59281423b3a7","observation_id":"5fe58cd1-3f50-4324-92e2-8239cfe36c68","resolution":{"observed_at":"2026-08-15T20:33:12.702319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:33:13.407474Z","title":"Computing euler angles from a rotation matrix.Retrieved on August, 6(2000):39–63, 1999","venue":null,"work_id":"4f476ab9-5f45-4dea-b919-b291dad76096","year":2000},"citing_paper":{"arxiv_id":"2505.12744","last_updated":"2025-05-19T06:00:14Z","snapshot_observed_at":"2026-08-17T20:30:55.214558Z","submitted_at":"2025-05-19T06:00:14Z","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T20:33:12.706679Z"},"links":{"citing_paper":"/paper/2505.12744"},"observation_digest":"sha256:cddabfec3115918b8a0bd5c0e7ce78086da404b1d37d16b13434609ea9e395d3","observation_id":"f5edd807-34a1-45e9-b295-35521afbcc3a","resolution":{"observed_at":"2026-08-15T20:33:13.413930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09783","last_updated":"2025-01-16T18:59:51Z","snapshot_observed_at":"2026-08-15T10:36:09.653529Z","submitted_at":"2025-01-16T18:59:51Z","title":"GeoManip: Geometric Constraints as General Interfaces for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09783","snapshot_observed_at":"2026-08-15T20:33:12.710846Z","title":"Geomanip: Geometric constraints as general interfaces for robot manipulation.arXiv preprint arXiv:2501.09783, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12744","last_updated":"2025-05-19T06:00:14Z","snapshot_observed_at":"2026-08-17T20:30:55.214558Z","submitted_at":"2025-05-19T06:00:14Z","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T20:33:12.710846Z"},"links":{"cited_paper":"/paper/2501.09783","citing_paper":"/paper/2505.12744"},"observation_digest":"sha256:ed16316b59f3073a67da0d0a17062617ecad03cdfdd483dacece358d86b7507e","observation_id":"28c2bee9-4443-448e-a252-fb7b397b257f","resolution":{"observed_at":"2026-08-15T20:33:12.710846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13529","last_updated":"2025-01-23T10:26:48Z","snapshot_observed_at":"2026-08-12T22:35:57.159026Z","submitted_at":"2025-01-23T10:26:48Z","title":"Overcoming Support Dilution for Robust Few-shot Semantic Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13529","snapshot_observed_at":"2026-08-15T20:33:12.715396Z","title":"Overcoming support dilution for robust few-shot semantic segmentation.arXiv preprint arXiv:2501.13529, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12744","last_updated":"2025-05-19T06:00:14Z","snapshot_observed_at":"2026-08-17T20:30:55.214558Z","submitted_at":"2025-05-19T06:00:14Z","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T20:33:12.715396Z"},"links":{"cited_paper":"/paper/2501.13529","citing_paper":"/paper/2505.12744"},"observation_digest":"sha256:faaab0ba155b4eb0339a810b2d377e9e7d654de7583777abcd5b8a2635ddbe60","observation_id":"c746766d-ba61-47ec-9324-b55f220a4ce6","resolution":{"observed_at":"2026-08-15T20:33:12.715396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-08-14T08:22:11.295012Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-15T20:33:12.720092Z","title":"Octo: An open-source generalist robot policy.arXiv preprint arXiv:2405.12213, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12744","last_updated":"2025-05-19T06:00:14Z","snapshot_observed_at":"2026-08-17T20:30:55.214558Z","submitted_at":"2025-05-19T06:00:14Z","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T20:33:12.720092Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2505.12744"},"observation_digest":"sha256:19b276d9c760f8c06525c06c98ddd9514af648cc9ba625683d668f0d84c2b56f","observation_id":"81f954b5-859b-49ca-abc9-faf06bfd477e","resolution":{"observed_at":"2026-08-15T20:33:12.720092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-15T20:33:12.725029Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12744","last_updated":"2025-05-19T06:00:14Z","snapshot_observed_at":"2026-08-17T20:30:55.214558Z","submitted_at":"2025-05-19T06:00:14Z","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T20:33:12.725029Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.12744"},"observation_digest":"sha256:b8a20aa2656419fe6f7919d10ca6b869a9701319c320371ea47597c0fff06184","observation_id":"f6b118d3-7c43-4508-b74f-24c7dfd2b14e","resolution":{"observed_at":"2026-08-15T20:33:12.725029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:33:12.730223Z","title":"Bridgedata v2: A dataset for robot learning at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12744","last_updated":"2025-05-19T06:00:14Z","snapshot_observed_at":"2026-08-17T20:30:55.214558Z","submitted_at":"2025-05-19T06:00:14Z","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T20:33:12.730223Z"},"links":{"citing_paper":"/paper/2505.12744"},"observation_digest":"sha256:cea6eff5f1b47bcff85c29b5178ec3d8ca7207ac84deea3ecd95660c4147b769","observation_id":"7f1396e7-c4ec-4a2d-b5c2-051ccc2a59a8","resolution":{"observed_at":"2026-08-15T20:33:12.730223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09022","last_updated":"2025-03-04T07:42:22Z","snapshot_observed_at":"2026-08-19T18:07:21.627253Z","submitted_at":"2024-11-13T20:59:30Z","title":"DART-LLM: Dependency-Aware Multi-Robot Task Decomposition and Execution using Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.09022","snapshot_observed_at":"2026-08-15T20:33:12.734688Z","title":"Dart-llm: Dependency-aware multi-robot task decomposition and execution using large language models.arXiv preprint arXiv:2411.09022, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12744","last_updated":"2025-05-19T06:00:14Z","snapshot_observed_at":"2026-08-17T20:30:55.214558Z","submitted_at":"2025-05-19T06:00:14Z","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T20:33:12.734688Z"},"links":{"cited_paper":"/paper/2411.09022","citing_paper":"/paper/2505.12744"},"observation_digest":"sha256:74a826f0b3f2f626755ee00965820baff14a1d03ccd95d439e0ff8841a4863ac","observation_id":"0c61ae86-8fcc-43e6-bd73-3bcb10a1334d","resolution":{"observed_at":"2026-08-15T20:33:12.734688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:33:12.740133Z","title":"Q-learning.Machine learning, 8:279–292, 1992","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2505.12744","last_updated":"2025-05-19T06:00:14Z","snapshot_observed_at":"2026-08-17T20:30:55.214558Z","submitted_at":"2025-05-19T06:00:14Z","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T20:33:12.740133Z"},"links":{"citing_paper":"/paper/2505.12744"},"observation_digest":"sha256:0772567aa07d2188ea48efbe9abdcca27776688ee0251177deb882044a97326b","observation_id":"256228c2-1388-40e6-a0b1-5a3249fde096","resolution":{"observed_at":"2026-08-15T20:33:12.740133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:33:12.744820Z","title":"Chain-of-thought prompting elicits reasoning in large language models.Advances in neural information processing systems, 35:24824–24837, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.12744","last_updated":"2025-05-19T06:00:14Z","snapshot_observed_at":"2026-08-17T20:30:55.214558Z","submitted_at":"2025-05-19T06:00:14Z","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T20:33:12.744820Z"},"links":{"citing_paper":"/paper/2505.12744"},"observation_digest":"sha256:05abc1305fb357fbeda098b45fff592197051db3adf7f5ce62999e9d9d5a684b","observation_id":"b3871ed7-281b-4b1f-9f3f-5ee4d1a88593","resolution":{"observed_at":"2026-08-15T20:33:12.744820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-15T20:33:12.749687Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12744","last_updated":"2025-05-19T06:00:14Z","snapshot_observed_at":"2026-08-17T20:30:55.214558Z","submitted_at":"2025-05-19T06:00:14Z","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T20:33:12.749687Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.12744"},"observation_digest":"sha256:6f2675689d30af42a454bbcb8b9a41e7edde0a50c7e2f4c6c30eaf1db75a256a","observation_id":"10a290b1-691d-4070-bb64-2b506ace1192","resolution":{"observed_at":"2026-08-15T20:33:12.749687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00662","last_updated":"2025-05-01T17:03:17Z","snapshot_observed_at":"2026-08-16T19:48:04.887471Z","submitted_at":"2025-05-01T17:03:17Z","title":"DeepCritic: Deliberate Critique with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00662","snapshot_observed_at":"2026-08-15T20:33:12.754141Z","title":"Deepcritic: Deliberate critique with large language models.arXiv preprint arXiv:2505.00662, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12744","last_updated":"2025-05-19T06:00:14Z","snapshot_observed_at":"2026-08-17T20:30:55.214558Z","submitted_at":"2025-05-19T06:00:14Z","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T20:33:12.754141Z"},"links":{"cited_paper":"/paper/2505.00662","citing_paper":"/paper/2505.12744"},"observation_digest":"sha256:1d1d1850e2c898c3cdf7111a8cf6b37fb31e2f9f2226f5eb8d3cd4efaf48d28a","observation_id":"7ad22a85-1b4c-49bd-8103-98a1074fff65","resolution":{"observed_at":"2026-08-15T20:33:12.754141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-08-12T08:06:42.236760Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-08-15T20:33:12.758791Z","title":"Latent action pretraining from videos.arXiv preprint arXiv:2410.11758, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12744","last_updated":"2025-05-19T06:00:14Z","snapshot_observed_at":"2026-08-17T20:30:55.214558Z","submitted_at":"2025-05-19T06:00:14Z","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T20:33:12.758791Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2505.12744"},"observation_digest":"sha256:d73057d576abd79a7f0953db221548719cd097c61af6e5cd571c8c0a019077d9","observation_id":"4dad9383-d3d0-4063-95be-fb7038cdaa81","resolution":{"observed_at":"2026-08-15T20:33:12.758791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-18T05:01:20.543826Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-15T20:33:12.763387Z","title":"Dapo: An open-source llm reinforcement learning system at scale, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12744","last_updated":"2025-05-19T06:00:14Z","snapshot_observed_at":"2026-08-17T20:30:55.214558Z","submitted_at":"2025-05-19T06:00:14Z","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T20:33:12.763387Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.12744"},"observation_digest":"sha256:159a748ac1cac5029b12931e51b01d908fc2d8d907d8c9f6ef2c709288fa2dd0","observation_id":"d1b71996-a53e-46b1-aec7-a7ac379ab7bd","resolution":{"observed_at":"2026-08-15T20:33:12.763387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:33:12.767830Z","title":"Meta-world: A benchmark and evaluation for multi-task and meta reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.12744","last_updated":"2025-05-19T06:00:14Z","snapshot_observed_at":"2026-08-17T20:30:55.214558Z","submitted_at":"2025-05-19T06:00:14Z","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T20:33:12.767830Z"},"links":{"citing_paper":"/paper/2505.12744"},"observation_digest":"sha256:9022a54238057a0d8bbdeffcdfaece5b3cc72d80c09ad2dc5563253cbfb5d99f","observation_id":"5bfb273f-f52f-427f-a7e4-fd445edbdc30","resolution":{"observed_at":"2026-08-15T20:33:12.767830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08693","last_updated":"2025-03-06T19:29:03Z","snapshot_observed_at":"2026-08-07T02:44:43.738657Z","submitted_at":"2024-07-11T17:31:01Z","title":"Robotic Control via Embodied Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08693","snapshot_observed_at":"2026-08-15T20:33:12.772083Z","title":"Robotic control via embodied chain-of-thought reasoning.arXiv preprint arXiv:2407.08693, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12744","last_updated":"2025-05-19T06:00:14Z","snapshot_observed_at":"2026-08-17T20:30:55.214558Z","submitted_at":"2025-05-19T06:00:14Z","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T20:33:12.772083Z"},"links":{"cited_paper":"/paper/2407.08693","citing_paper":"/paper/2505.12744"},"observation_digest":"sha256:8ff252d7b5cb7b56c19ccce1445452da1ae4bd615f6e5b7cbb80b5e863399262","observation_id":"c5dada62-7421-440c-9c94-90048fbaa2e1","resolution":{"observed_at":"2026-08-15T20:33:12.772083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-15T20:33:12.777054Z","title":"put on\" task,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12744","last_updated":"2025-05-19T06:00:14Z","snapshot_observed_at":"2026-08-17T20:30:55.214558Z","submitted_at":"2025-05-19T06:00:14Z","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T20:33:12.777054Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2505.12744"},"observation_digest":"sha256:457ce734803a62c9daf4259c832b8d08ee622cd7c85adbfbc57fb9ad7bb4cefe","observation_id":"a3ad2b89-8e9e-4b9e-9570-0e14eb8bb404","resolution":{"observed_at":"2026-08-15T20:33:12.777054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.12744","last_updated":"2025-05-19T06:00:14Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-17T20:30:55.214558Z","submitted_at":"2025-05-19T06:00:14Z","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":46,"verified_exact":0,"verified_fuzzy":4},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 3 inbound Pith citation observations for arXiv:2505.12744."}