{"as_of":"2026-08-09T21:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2d0b12b77c8a880c8a83f0e3e0a4bb14558ffd510a6a8eee1cb4459e9640c07c","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T13:35:17.995027Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T16:19:18.109203Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T14:42:32.975966Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.07837","last_updated":"2025-05-01T08:09:58Z","snapshot_observed_at":"2026-08-08T16:01:57.577714Z","submitted_at":"2025-02-11T02:16:59Z","title":"RoboBERT: An End-to-end Multimodal Robotic Manipulation Model","version":2},"cited_work":{"arxiv_id":"2502.07837","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.07837","snapshot_observed_at":"2026-08-05T14:42:32.975966Z","title":"RoboBERT: An End-to-end Multimodal Robotic Manipulation Model","venue":"cs.RO","work_id":"275c9b6c-6cd1-499a-80bb-54866bd39d18","year":2025},"citing_paper":{"arxiv_id":"2508.21046","last_updated":"2026-05-27T08:39:30Z","snapshot_observed_at":"2026-08-05T14:42:31.889948Z","submitted_at":"2025-08-28T17:50:58Z","title":"CogVLA: Cognition-Aligned Vision-Language-Action Model via Instruction-Driven Routing & Sparsification","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:32.796221Z"},"links":{"cited_paper":"/paper/2502.07837","citing_paper":"/paper/2508.21046"},"observation_digest":"sha256:ced2595ddc3b7667b23a9ab704a335716770cfad5cbc02751529432ae96315ab","observation_id":"56903bea-c110-41cf-8469-ad8a3d05a1a1","resolution":{"observed_at":"2026-08-05T14:42:32.980451Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07837","last_updated":"2025-05-01T08:09:58Z","snapshot_observed_at":"2026-08-08T16:01:57.577714Z","submitted_at":"2025-02-11T02:16:59Z","title":"RoboBERT: An End-to-end Multimodal Robotic Manipulation Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07837","snapshot_observed_at":"2026-08-05T16:19:18.109203Z","title":"Robobert: An end-to-end multimodal robotic manipulation model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00064","last_updated":"2026-06-16T08:11:54Z","snapshot_observed_at":"2026-08-09T10:06:57.890575Z","submitted_at":"2025-08-26T06:25:54Z","title":"OpenTie: Open-vocabulary Sequential Rebar Tying System","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T16:19:18.109203Z"},"links":{"cited_paper":"/paper/2502.07837","citing_paper":"/paper/2509.00064"},"observation_digest":"sha256:31c160f7b02a7e1df658614f8e00785fb4e4c6bcbc8baa828a6713ba9cc31201","observation_id":"da82a024-e335-4b76-b380-0c0dbd40b647","resolution":{"observed_at":"2026-08-05T16:19:18.109203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.07837/citation-record","integrity":"/paper/2502.07837/integrity","json":"/paper/2502.07837/citation-record.json","paper":"/paper/2502.07837"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2312.07843","last_updated":"2023-12-13T02:20:42Z","snapshot_observed_at":"2026-07-06T17:00:53.532910Z","submitted_at":"2023-12-13T02:20:42Z","title":"Foundation Models in Robotics: Applications, Challenges, and the Future","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07843","snapshot_observed_at":"2026-08-08T13:35:17.878324Z","title":"Firoozi, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07837","last_updated":"2025-05-01T08:09:58Z","snapshot_observed_at":"2026-08-08T16:01:57.577714Z","submitted_at":"2025-02-11T02:16:59Z","title":"RoboBERT: An End-to-end Multimodal Robotic Manipulation Model","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T13:35:17.878324Z"},"links":{"cited_paper":"/paper/2312.07843","citing_paper":"/paper/2502.07837"},"observation_digest":"sha256:da1935b1de820f61f9add3a1ead213cca6ad86bda7eb704f09aca9431f1b8222","observation_id":"adb62bd7-2af9-46bf-8332-0ccd657c53e6","resolution":{"observed_at":"2026-08-08T13:35:17.878324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-08T13:35:17.882033Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07837","last_updated":"2025-05-01T08:09:58Z","snapshot_observed_at":"2026-08-08T16:01:57.577714Z","submitted_at":"2025-02-11T02:16:59Z","title":"RoboBERT: An End-to-end Multimodal Robotic Manipulation Model","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T13:35:17.882033Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2502.07837"},"observation_digest":"sha256:247b86426efafb91ddb116ef7b4c1314c1a9f6dc2f898a5412de5a353883a121","observation_id":"a5a5dec7-0536-402e-b65b-24890623dc09","resolution":{"observed_at":"2026-08-08T13:35:17.882033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-08T13:35:17.892459Z","title":"Cheang, G","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07837","last_updated":"2025-05-01T08:09:58Z","snapshot_observed_at":"2026-08-08T16:01:57.577714Z","submitted_at":"2025-02-11T02:16:59Z","title":"RoboBERT: An End-to-end Multimodal Robotic Manipulation Model","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T13:35:17.892459Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2502.07837"},"observation_digest":"sha256:8a98dca3aa76c1ae047885c19e08dd6708bccd3ab6d0e77f9be9072c120175c3","observation_id":"d8444895-aa39-440a-81df-09e0df18a715","resolution":{"observed_at":"2026-08-08T13:35:17.892459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14457","last_updated":"2025-02-04T13:33:56Z","snapshot_observed_at":"2026-08-08T16:01:45.516788Z","submitted_at":"2023-12-22T06:15:03Z","title":"QUAR-VLA: Vision-Language-Action Model for Quadruped Robots","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14457","snapshot_observed_at":"2026-08-08T13:35:17.896147Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.07837","last_updated":"2025-05-01T08:09:58Z","snapshot_observed_at":"2026-08-08T16:01:57.577714Z","submitted_at":"2025-02-11T02:16:59Z","title":"RoboBERT: An End-to-end Multimodal Robotic Manipulation Model","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T13:35:17.896147Z"},"links":{"cited_paper":"/paper/2312.14457","citing_paper":"/paper/2502.07837"},"observation_digest":"sha256:a22add21cd636bdaebc2341a2492da8fffcceadbff00571e3ca9d1720e7e4280","observation_id":"6018e123-0281-453c-ba93-24c71b211be0","resolution":{"observed_at":"2026-08-08T13:35:17.896147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-08T13:35:17.900184Z","title":"Black, N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07837","last_updated":"2025-05-01T08:09:58Z","snapshot_observed_at":"2026-08-08T16:01:57.577714Z","submitted_at":"2025-02-11T02:16:59Z","title":"RoboBERT: An End-to-end Multimodal Robotic Manipulation Model","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T13:35:17.900184Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2502.07837"},"observation_digest":"sha256:c14cac4f19aca99e52de76c4f71ac3038954b1158b6f5a6879a3a70f08da21fa","observation_id":"31abfe62-070c-42dd-9f5f-63f1a178cc7e","resolution":{"observed_at":"2026-08-08T13:35:17.900184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-05T20:54:58.855446Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-08T13:35:17.903956Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07837","last_updated":"2025-05-01T08:09:58Z","snapshot_observed_at":"2026-08-08T16:01:57.577714Z","submitted_at":"2025-02-11T02:16:59Z","title":"RoboBERT: An End-to-end Multimodal Robotic Manipulation Model","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T13:35:17.903956Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2502.07837"},"observation_digest":"sha256:fcdc8dd6c73e98a4ad468a461797062cbe1364906fd5c564a3eb1711395000b7","observation_id":"71c95e1a-7b16-4ade-90ca-b0ae8150b446","resolution":{"observed_at":"2026-08-08T13:35:17.903956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:35:18.333311Z","title":null,"venue":null,"work_id":"cf84d947-e159-4b54-9ff3-00b22aa83c82","year":null},"citing_paper":{"arxiv_id":"2502.07837","last_updated":"2025-05-01T08:09:58Z","snapshot_observed_at":"2026-08-08T16:01:57.577714Z","submitted_at":"2025-02-11T02:16:59Z","title":"RoboBERT: An End-to-end Multimodal Robotic Manipulation Model","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T13:35:17.907436Z"},"links":{"citing_paper":"/paper/2502.07837"},"observation_digest":"sha256:5937f36b5a3f77979fa9408ff0cdb6dfb2d6235c4b1edc4a3b7823d3d430fcf1","observation_id":"c5b68e23-2c74-482a-bb3b-5881bcba62ec","resolution":{"observed_at":"2026-08-08T13:35:18.336835Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-08T13:35:17.914171Z","title":"Intelligence, K","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.07837","last_updated":"2025-05-01T08:09:58Z","snapshot_observed_at":"2026-08-08T16:01:57.577714Z","submitted_at":"2025-02-11T02:16:59Z","title":"RoboBERT: An End-to-end Multimodal Robotic Manipulation Model","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T13:35:17.914171Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2502.07837"},"observation_digest":"sha256:957a994ba241cb2104de27264e1474073b57552e31b463a08594a5c92db40dcd","observation_id":"3db73d55-6573-4453-b996-deb13ffd9372","resolution":{"observed_at":"2026-08-08T13:35:17.914171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:35:18.323787Z","title":"Zheng, Y","venue":null,"work_id":"83d32134-2801-4a01-9e78-171c0057800c","year":null},"citing_paper":{"arxiv_id":"2502.07837","last_updated":"2025-05-01T08:09:58Z","snapshot_observed_at":"2026-08-08T16:01:57.577714Z","submitted_at":"2025-02-11T02:16:59Z","title":"RoboBERT: An End-to-end Multimodal Robotic Manipulation Model","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T13:35:17.917735Z"},"links":{"citing_paper":"/paper/2502.07837"},"observation_digest":"sha256:351e390161be44f05d09aefe5b5497566340b4cee7e851852300a2bffa35eab2","observation_id":"363838cd-b5e7-4b7a-9613-8fb8a0a7eae9","resolution":{"observed_at":"2026-08-08T13:35:18.327127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-08T13:35:17.924828Z","title":"Brohan, N","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07837","last_updated":"2025-05-01T08:09:58Z","snapshot_observed_at":"2026-08-08T16:01:57.577714Z","submitted_at":"2025-02-11T02:16:59Z","title":"RoboBERT: An End-to-end Multimodal Robotic Manipulation Model","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T13:35:17.924828Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2502.07837"},"observation_digest":"sha256:f93b40b8d13fdb671d6ce13784ab7e1c8918a7adb4ba1792bcb3a9bb9129f86f","observation_id":"712173da-ff6f-40e0-b2ff-c0167849426c","resolution":{"observed_at":"2026-08-08T13:35:17.924828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10345","last_updated":"2025-06-05T21:26:08Z","snapshot_observed_at":"2026-08-02T17:44:41.340688Z","submitted_at":"2024-12-13T18:40:51Z","title":"TraceVLA: Visual Trace Prompting Enhances Spatial-Temporal Awareness for Generalist Robotic Policies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10345","snapshot_observed_at":"2026-08-08T13:35:17.921106Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07837","last_updated":"2025-05-01T08:09:58Z","snapshot_observed_at":"2026-08-08T16:01:57.577714Z","submitted_at":"2025-02-11T02:16:59Z","title":"RoboBERT: An End-to-end Multimodal Robotic Manipulation Model","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T13:35:17.921106Z"},"links":{"cited_paper":"/paper/2412.10345","citing_paper":"/paper/2502.07837"},"observation_digest":"sha256:19e7da909328fa11e8a9c47318c19aac264834ad9bd0260f247d72ea5cf486bc","observation_id":"895a4736-8dc7-45fc-a407-b7f43b10b959","resolution":{"observed_at":"2026-08-08T13:35:17.921106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-08T13:35:17.931999Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07837","last_updated":"2025-05-01T08:09:58Z","snapshot_observed_at":"2026-08-08T16:01:57.577714Z","submitted_at":"2025-02-11T02:16:59Z","title":"RoboBERT: An End-to-end Multimodal Robotic Manipulation Model","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T13:35:17.931999Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2502.07837"},"observation_digest":"sha256:a28a852f10dd5a09904e3929fe9b2cd02f98f197ebab01c21e0390bfd0edecef","observation_id":"77df53d3-22b7-49a5-96d3-a1c82f3589f8","resolution":{"observed_at":"2026-08-08T13:35:17.931999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-08-08T01:53:43.555672Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08864","snapshot_observed_at":"2026-08-08T13:35:17.928078Z","title":"Collaboration, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07837","last_updated":"2025-05-01T08:09:58Z","snapshot_observed_at":"2026-08-08T16:01:57.577714Z","submitted_at":"2025-02-11T02:16:59Z","title":"RoboBERT: An End-to-end Multimodal Robotic Manipulation Model","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T13:35:17.928078Z"},"links":{"cited_paper":"/paper/2310.08864","citing_paper":"/paper/2502.07837"},"observation_digest":"sha256:7e8ca90917399e1d6435af89105285190d4148f635863ff199fc3fd67170d49e","observation_id":"ce6d1edd-e04b-4e13-8971-5a415b250dd3","resolution":{"observed_at":"2026-08-08T13:35:17.928078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03967","last_updated":"2024-10-28T09:52:09Z","snapshot_observed_at":"2026-07-06T18:41:35.995594Z","submitted_at":"2024-07-04T14:36:49Z","title":"Investigating the Role of Instruction Variety and Task Difficulty in Robotic Manipulation Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03967","snapshot_observed_at":"2026-08-08T13:35:17.942366Z","title":"Parekh, N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07837","last_updated":"2025-05-01T08:09:58Z","snapshot_observed_at":"2026-08-08T16:01:57.577714Z","submitted_at":"2025-02-11T02:16:59Z","title":"RoboBERT: An End-to-end Multimodal Robotic Manipulation Model","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T13:35:17.942366Z"},"links":{"cited_paper":"/paper/2407.03967","citing_paper":"/paper/2502.07837"},"observation_digest":"sha256:e5cba33ac9cd27e4040b136066cbe2119b1fb656a1a81ae36f94ef7736407dee","observation_id":"e4bf4176-93a7-41d2-9951-be61be1db1b5","resolution":{"observed_at":"2026-08-08T13:35:17.942366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:35:18.313955Z","title":null,"venue":null,"work_id":"c58f92f0-aa53-4368-b53b-04a7cacf4c50","year":null},"citing_paper":{"arxiv_id":"2502.07837","last_updated":"2025-05-01T08:09:58Z","snapshot_observed_at":"2026-08-08T16:01:57.577714Z","submitted_at":"2025-02-11T02:16:59Z","title":"RoboBERT: An End-to-end Multimodal Robotic Manipulation Model","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T13:35:17.935369Z"},"links":{"citing_paper":"/paper/2502.07837"},"observation_digest":"sha256:2efb204b4fdc520a26e59a9a007a68f84963973b88f02b6411721795adcef045","observation_id":"2b02956e-5cd1-4461-a849-8ba5ba89c8b0","resolution":{"observed_at":"2026-08-08T13:35:18.317376Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:35:18.290981Z","title":"Devlin, M.-W","venue":null,"work_id":"4443ded8-44a1-4c1f-9426-50c0e5453fe0","year":2019},"citing_paper":{"arxiv_id":"2502.07837","last_updated":"2025-05-01T08:09:58Z","snapshot_observed_at":"2026-08-08T16:01:57.577714Z","submitted_at":"2025-02-11T02:16:59Z","title":"RoboBERT: An End-to-end Multimodal Robotic Manipulation Model","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T13:35:17.949513Z"},"links":{"citing_paper":"/paper/2502.07837"},"observation_digest":"sha256:824304c9a91c34eb4597ce3ec8e1b1516758a8c9a9cff12ebc3672856be0cd2d","observation_id":"b4baf917-d1d1-4fcf-a897-33af7c94ff51","resolution":{"observed_at":"2026-08-08T13:35:18.294452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-08T13:35:17.952646Z","title":"Dosovitskiy, L","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.07837","last_updated":"2025-05-01T08:09:58Z","snapshot_observed_at":"2026-08-08T16:01:57.577714Z","submitted_at":"2025-02-11T02:16:59Z","title":"RoboBERT: An End-to-end Multimodal Robotic Manipulation Model","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T13:35:17.952646Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2502.07837"},"observation_digest":"sha256:339032757a59abbec9150546fe7ca739bb55d09fad0f4f84cab44ab448046279","observation_id":"70e766d1-75b9-4697-84b9-261f9ee1c594","resolution":{"observed_at":"2026-08-08T13:35:17.952646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.06173","last_updated":"2022-03-11T18:58:10Z","snapshot_observed_at":"2026-08-06T13:06:27.360959Z","submitted_at":"2022-03-11T18:58:10Z","title":"Masked Visual Pre-training for Motor Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.06173","snapshot_observed_at":"2026-08-08T13:35:17.945753Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07837","last_updated":"2025-05-01T08:09:58Z","snapshot_observed_at":"2026-08-08T16:01:57.577714Z","submitted_at":"2025-02-11T02:16:59Z","title":"RoboBERT: An End-to-end Multimodal Robotic Manipulation Model","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T13:35:17.945753Z"},"links":{"cited_paper":"/paper/2203.06173","citing_paper":"/paper/2502.07837"},"observation_digest":"sha256:1ce842c0402f3d14c45b0aaf6de807abb7bb456e3a756b4601ac49a013a70282","observation_id":"23599994-dff3-4869-b2ff-db2b76d926f2","resolution":{"observed_at":"2026-08-08T13:35:17.945753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04137","last_updated":"2024-03-14T04:36:31Z","snapshot_observed_at":"2026-08-08T17:26:38.829859Z","submitted_at":"2023-03-07T18:50:03Z","title":"Diffusion Policy: Visuomotor Policy Learning via Action Diffusion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04137","snapshot_observed_at":"2026-08-08T13:35:17.959570Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07837","last_updated":"2025-05-01T08:09:58Z","snapshot_observed_at":"2026-08-08T16:01:57.577714Z","submitted_at":"2025-02-11T02:16:59Z","title":"RoboBERT: An End-to-end Multimodal Robotic Manipulation Model","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T13:35:17.959570Z"},"links":{"cited_paper":"/paper/2303.04137","citing_paper":"/paper/2502.07837"},"observation_digest":"sha256:af30bff89e30563e4f22e440953cf1b9d1808af11112594156811ce0ff296afc","observation_id":"87db2b57-ef1c-4a1e-b4a5-561474a8b3af","resolution":{"observed_at":"2026-08-08T13:35:17.959570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:35:18.280666Z","title":"Redmon, S","venue":null,"work_id":"b7cbe500-aae1-4945-87d8-c7125568b912","year":2016},"citing_paper":{"arxiv_id":"2502.07837","last_updated":"2025-05-01T08:09:58Z","snapshot_observed_at":"2026-08-08T16:01:57.577714Z","submitted_at":"2025-02-11T02:16:59Z","title":"RoboBERT: An End-to-end Multimodal Robotic Manipulation Model","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T13:35:17.963128Z"},"links":{"citing_paper":"/paper/2502.07837"},"observation_digest":"sha256:0410eef6f5f6ff31399aadd613a7cedae89adf2d39005285fb3a2be34902ce06","observation_id":"86701c11-5685-4011-a95d-d276babb8f20","resolution":{"observed_at":"2026-08-08T13:35:18.284111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-08T13:35:17.956170Z","title":"Awadalla, I","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07837","last_updated":"2025-05-01T08:09:58Z","snapshot_observed_at":"2026-08-08T16:01:57.577714Z","submitted_at":"2025-02-11T02:16:59Z","title":"RoboBERT: An End-to-end Multimodal Robotic Manipulation Model","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T13:35:17.956170Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2502.07837"},"observation_digest":"sha256:578d5d7aed0ce2baa0b3cd21d234c293dc719a765530f6768388f47ad60c4596","observation_id":"5a4c5e7b-9efd-414c-9e8b-0426c3e7ce1c","resolution":{"observed_at":"2026-08-08T13:35:17.956170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:35:18.270204Z","title":null,"venue":null,"work_id":"5708cf25-1fce-41c9-ace8-b1b6865a190d","year":2022},"citing_paper":{"arxiv_id":"2502.07837","last_updated":"2025-05-01T08:09:58Z","snapshot_observed_at":"2026-08-08T16:01:57.577714Z","submitted_at":"2025-02-11T02:16:59Z","title":"RoboBERT: An End-to-end Multimodal Robotic Manipulation Model","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T13:35:17.969062Z"},"links":{"citing_paper":"/paper/2502.07837"},"observation_digest":"sha256:b595db9f7d011c85884aa45cc1ee603e26187b1d249c7e908446b35e5042e909","observation_id":"a16ec596-b8fe-4d96-991e-569811456faf","resolution":{"observed_at":"2026-08-08T13:35:18.273630Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:35:18.259932Z","title":null,"venue":null,"work_id":"88d3329e-bbf5-4e98-8f26-fe8ad1a393bc","year":2022},"citing_paper":{"arxiv_id":"2502.07837","last_updated":"2025-05-01T08:09:58Z","snapshot_observed_at":"2026-08-08T16:01:57.577714Z","submitted_at":"2025-02-11T02:16:59Z","title":"RoboBERT: An End-to-end Multimodal Robotic Manipulation Model","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T13:35:17.971822Z"},"links":{"citing_paper":"/paper/2502.07837"},"observation_digest":"sha256:a01e9ac2d6a9b6a628c1f56adc82dd2c37a28d44fb45690f60e7a88c6e4b7334","observation_id":"66527ec3-719f-4687-b60f-636b69af9eda","resolution":{"observed_at":"2026-08-08T13:35:18.263498Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.09412","last_updated":"2018-04-27T21:39:25Z","snapshot_observed_at":"2026-08-08T10:28:19.597631Z","submitted_at":"2017-10-25T18:30:49Z","title":"mixup: Beyond Empirical Risk Minimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.09412","snapshot_observed_at":"2026-08-08T13:35:17.966023Z","title":"Zhang, M","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.07837","last_updated":"2025-05-01T08:09:58Z","snapshot_observed_at":"2026-08-08T16:01:57.577714Z","submitted_at":"2025-02-11T02:16:59Z","title":"RoboBERT: An End-to-end Multimodal Robotic Manipulation Model","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T13:35:17.966023Z"},"links":{"cited_paper":"/paper/1710.09412","citing_paper":"/paper/2502.07837"},"observation_digest":"sha256:ada383e927684cff25c9283bd4ea324e7332de7ce3024046c7f37ef3d5b488c3","observation_id":"1191ba0b-3fb3-4f4b-aabe-eeaa3c4f8e88","resolution":{"observed_at":"2026-08-08T13:35:17.966023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02359","last_updated":"2024-11-04T18:26:08Z","snapshot_observed_at":"2026-08-08T09:32:42.494751Z","submitted_at":"2024-11-04T18:26:08Z","title":"DeeR-VLA: Dynamic Inference of Multimodal Large Language Models for Efficient Robot Execution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02359","snapshot_observed_at":"2026-08-08T13:35:17.978234Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07837","last_updated":"2025-05-01T08:09:58Z","snapshot_observed_at":"2026-08-08T16:01:57.577714Z","submitted_at":"2025-02-11T02:16:59Z","title":"RoboBERT: An End-to-end Multimodal Robotic Manipulation Model","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T13:35:17.978234Z"},"links":{"cited_paper":"/paper/2411.02359","citing_paper":"/paper/2502.07837"},"observation_digest":"sha256:61ebf6c332fd80da2e98ff88ccd3fb45e899d78959fee20bd7a49247a3d00ae8","observation_id":"493762bb-afc6-4ce5-8fc7-df011cc7f8a6","resolution":{"observed_at":"2026-08-08T13:35:17.978234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12953","last_updated":"2024-12-17T14:34:51Z","snapshot_observed_at":"2026-07-06T20:08:38.939649Z","submitted_at":"2024-12-17T14:34:51Z","title":"Efficient Diffusion Transformer Policies with Mixture of Expert Denoisers for Multitask Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12953","snapshot_observed_at":"2026-08-08T13:35:17.980889Z","title":"Reuss, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07837","last_updated":"2025-05-01T08:09:58Z","snapshot_observed_at":"2026-08-08T16:01:57.577714Z","submitted_at":"2025-02-11T02:16:59Z","title":"RoboBERT: An End-to-end Multimodal Robotic Manipulation Model","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T13:35:17.980889Z"},"links":{"cited_paper":"/paper/2412.12953","citing_paper":"/paper/2502.07837"},"observation_digest":"sha256:94ac44f1949dccf65a979d3471ac570774759251a7cb9afbe4317742917f518b","observation_id":"7017187b-85e5-45de-b4e9-08d49bc5bd47","resolution":{"observed_at":"2026-08-08T13:35:17.980889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13139","last_updated":"2023-12-21T05:34:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-20T16:00:43Z","title":"Unleashing Large-Scale Video Generative Pre-training for Visual Robot Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13139","snapshot_observed_at":"2026-08-08T13:35:17.974873Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07837","last_updated":"2025-05-01T08:09:58Z","snapshot_observed_at":"2026-08-08T16:01:57.577714Z","submitted_at":"2025-02-11T02:16:59Z","title":"RoboBERT: An End-to-end Multimodal Robotic Manipulation Model","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T13:35:17.974873Z"},"links":{"cited_paper":"/paper/2312.13139","citing_paper":"/paper/2502.07837"},"observation_digest":"sha256:82cdf0f255539af4882caf37f9be777ce2bc052f229c04e307f00fff6a4f4a71","observation_id":"75386785-ad26-455d-a1a6-a7de9388192d","resolution":{"observed_at":"2026-08-08T13:35:17.974873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-08T13:35:17.987816Z","title":"Brohan, N","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07837","last_updated":"2025-05-01T08:09:58Z","snapshot_observed_at":"2026-08-08T16:01:57.577714Z","submitted_at":"2025-02-11T02:16:59Z","title":"RoboBERT: An End-to-end Multimodal Robotic Manipulation Model","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T13:35:17.987816Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2502.07837"},"observation_digest":"sha256:740f294067bbdc93ec877a9ec12b2e869fe173e029fa5f28a43b36c91c39963f","observation_id":"f191a758-f3a3-4c17-8278-c03777108578","resolution":{"observed_at":"2026-08-08T13:35:17.987816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:35:18.247787Z","title":"Bharadhwaj, J","venue":null,"work_id":"d1a02281-7219-47a6-9dc3-6de5f30474a3","year":null},"citing_paper":{"arxiv_id":"2502.07837","last_updated":"2025-05-01T08:09:58Z","snapshot_observed_at":"2026-08-08T16:01:57.577714Z","submitted_at":"2025-02-11T02:16:59Z","title":"RoboBERT: An End-to-end Multimodal Robotic Manipulation Model","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T13:35:17.991524Z"},"links":{"citing_paper":"/paper/2502.07837"},"observation_digest":"sha256:d6d2c6127d2c6f46daf9a7e46f5037ab2cb3736966fb5c7b1069a8daf4567509","observation_id":"3cabb79e-177d-47c9-b835-03da80f5c557","resolution":{"observed_at":"2026-08-08T13:35:18.252620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10885","last_updated":"2024-07-25T14:30:22Z","snapshot_observed_at":"2026-07-06T17:31:17.058043Z","submitted_at":"2024-02-16T18:43:02Z","title":"3D Diffuser Actor: Policy Diffusion with 3D Scene Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10885","snapshot_observed_at":"2026-08-08T13:35:17.984082Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07837","last_updated":"2025-05-01T08:09:58Z","snapshot_observed_at":"2026-08-08T16:01:57.577714Z","submitted_at":"2025-02-11T02:16:59Z","title":"RoboBERT: An End-to-end Multimodal Robotic Manipulation Model","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T13:35:17.984082Z"},"links":{"cited_paper":"/paper/2402.10885","citing_paper":"/paper/2502.07837"},"observation_digest":"sha256:97be54dc6c682d73f53efede19f1e53e2b8925c371e7b11a457018e5b5f3bf0a","observation_id":"9d2ff0bd-8669-4996-b2fa-c137f5e69a3c","resolution":{"observed_at":"2026-08-08T13:35:17.984082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.01918","last_updated":"2023-09-05T03:14:39Z","snapshot_observed_at":"2026-07-06T16:14:17.621050Z","submitted_at":"2023-09-05T03:14:39Z","title":"RoboAgent: Generalization and Efficiency in Robot Manipulation via Semantic Augmentations and Action Chunking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.01918","snapshot_observed_at":"2026-08-08T13:35:17.995027Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07837","last_updated":"2025-05-01T08:09:58Z","snapshot_observed_at":"2026-08-08T16:01:57.577714Z","submitted_at":"2025-02-11T02:16:59Z","title":"RoboBERT: An End-to-end Multimodal Robotic Manipulation Model","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-08T13:35:17.995027Z"},"links":{"cited_paper":"/paper/2309.01918","citing_paper":"/paper/2502.07837"},"observation_digest":"sha256:6eae0507ff7d1c1fe8a11038f6fe9bcae6161154aa83ba9540da6be8ce475380","observation_id":"70bc5cb1-dc57-477e-a6bc-967e70847956","resolution":{"observed_at":"2026-08-08T13:35:17.995027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19650","last_updated":"2024-11-29T12:06:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-29T12:06:03Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19650","snapshot_observed_at":"2026-08-08T13:35:17.910731Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07837","last_updated":"2025-05-01T08:09:58Z","snapshot_observed_at":"2026-08-08T16:01:57.577714Z","submitted_at":"2025-02-11T02:16:59Z","title":"RoboBERT: An End-to-end Multimodal Robotic Manipulation Model","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T13:35:17.910731Z"},"links":{"cited_paper":"/paper/2411.19650","citing_paper":"/paper/2502.07837"},"observation_digest":"sha256:c70f5c0a3631ee37adbbeededdd3797e49dd1fe80d38ee18f65ddb1beedc705f","observation_id":"cac6b13d-4204-462b-850f-31dc61de8bc3","resolution":{"observed_at":"2026-08-08T13:35:17.910731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:35:18.303426Z","title":null,"venue":null,"work_id":"42b09cef-914a-48fc-88fb-ae2947a09ad8","year":null},"citing_paper":{"arxiv_id":"2502.07837","last_updated":"2025-05-01T08:09:58Z","snapshot_observed_at":"2026-08-08T16:01:57.577714Z","submitted_at":"2025-02-11T02:16:59Z","title":"RoboBERT: An End-to-end Multimodal Robotic Manipulation Model","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-08T13:35:17.938794Z"},"links":{"citing_paper":"/paper/2502.07837"},"observation_digest":"sha256:b03a965076c2a803f85f92172a2104a078c4694fa2dcbdf2bb12f81680cdddb8","observation_id":"cdf073b0-61b9-4343-8523-9c11c4cc59f3","resolution":{"observed_at":"2026-08-08T13:35:18.306785Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.07837","last_updated":"2025-05-01T08:09:58Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-08T16:01:57.577714Z","submitted_at":"2025-02-11T02:16:59Z","title":"RoboBERT: An End-to-end Multimodal Robotic Manipulation Model"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":4},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 2 inbound Pith citation observations for arXiv:2502.07837."}