{"as_of":"2026-08-13T03:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1088ba3b3320dbf787bbb460822a1bd411f46e9ea8a1bc6c8e7153ff8d9e796f","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:44:08.215410Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.24156/citation-record","integrity":"/paper/2505.24156/integrity","json":"/paper/2505.24156/citation-record.json","paper":"/paper/2505.24156"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:03.876268Z","title":"Peract2: Benchmarking and learning for robotic bimanual manipulation tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:03.876268Z"},"links":{"citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:205b98ee9e23af515b9fd615ec4ebb0aa245509938ebec05e11fd95cb0ff25ef","observation_id":"2fac1c56-cc2f-4620-a7b0-064742dec1e4","resolution":{"observed_at":"2026-08-07T12:44:03.876268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02920","last_updated":"2025-04-16T17:31:39Z","snapshot_observed_at":"2026-08-12T22:51:18.950363Z","submitted_at":"2024-09-04T17:59:52Z","title":"RoboTwin: Dual-Arm Robot Benchmark with Generative Digital Twins (early version)","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02920","snapshot_observed_at":"2026-08-07T12:44:03.940078Z","title":"Robotwin: Dual-arm robot benchmark with generative digital twins (early version).arXiv preprint arXiv:2409.02920, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:03.940078Z"},"links":{"cited_paper":"/paper/2409.02920","citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:5aa91095d19fff00178611b8a5911a7ae0aae1fe0fb983b743ab6c430226f162","observation_id":"bcaf170e-95de-4a17-86b4-7433c74a3e05","resolution":{"observed_at":"2026-08-07T12:44:03.940078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:12.637918Z","title":"Zhao, Vikash Kumar, Sergey Levine, and Chelsea Finn","venue":null,"work_id":"5b41987e-2af6-4d35-b951-5280a043d6ae","year":2023},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:04.004285Z"},"links":{"citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:862b69bd842c9917ed2e4b592f12f1c4a2a711cfe352cd67e1518fef666de296","observation_id":"a31546b0-097f-4998-86f7-64d31e6aeabb","resolution":{"observed_at":"2026-08-07T12:44:12.780640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:12.481585Z","title":"Sukhatme","venue":null,"work_id":"f65ee83a-f76c-45ae-976a-223814d710bd","year":2024},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:04.057663Z"},"links":{"citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:9f8bade94e25c1b6c1a8ab104c699c640fddcb8fe2d1f669776f10af164db249","observation_id":"54af4f5a-da69-45e5-b09f-8b5933de8208","resolution":{"observed_at":"2026-08-07T12:44:12.551504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:12.346925Z","title":"Stabilize to act: Learning to coordinate for bimanual manipulation","venue":null,"work_id":"a6b5fb83-4590-454a-8e1c-8f4a3d982370","year":2023},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:04.088995Z"},"links":{"citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:f7246af6f19dc44ddc01d994db812843a61443f0a7641b7c56cc5b136bac8d3d","observation_id":"56c91c17-8459-4094-8113-bb94cca24cfb","resolution":{"observed_at":"2026-08-07T12:44:12.422940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:04.247130Z","title":"Taco: Benchmarking generalizable bimanual tool-action-object understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:04.247130Z"},"links":{"citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:64f72c1053067e51fa0b399d1036ac9d4c9b469b4faec46e94e01096b76e3788","observation_id":"0430fe08-44b4-4835-aae1-d6576339ab25","resolution":{"observed_at":"2026-08-07T12:44:04.247130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:11.857049Z","title":"Towards human-level bimanual dexterous manipulation with reinforcement learning.Advances in Neural Information Processing Systems, 35:5150–5163, 2022","venue":null,"work_id":"0dbda67d-9317-4520-938e-b4df500e2bb5","year":2022},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:04.288605Z"},"links":{"citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:e924ead9cba6711f085075ae6fe71f71f3a22c0674ba5879784a04e097c962ee","observation_id":"e137aa09-a528-4cbf-9254-a739d9d3dd01","resolution":{"observed_at":"2026-08-07T12:44:11.938001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:11.687464Z","title":"Bi-touch: Bimanual tactile manipulation with sim-to-real deep reinforcement learning.IEEE Robotics and Automation Letters, 8(9):5472–5479, 2023","venue":null,"work_id":"60dbb802-9b71-4dab-9c91-c6833a2bf84f","year":2023},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:04.377233Z"},"links":{"citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:e5fa9fefa6b5eabcf1aa53902e14e8f0d8cb96b964c2d4379f5d23d12cd30cab","observation_id":"1e851552-939d-4968-a1d5-99057804227b","resolution":{"observed_at":"2026-08-07T12:44:11.772299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-07T12:44:04.482160Z","title":"Openvla: An open-source vision-language-action model.arXiv preprint arXiv:2406.09246, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:04.482160Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:17cd4df990340e69d7691208689983e09ef9f624eff136d2d7153c8e0612e2ee","observation_id":"b00183a8-b25b-4217-a162-3b8d970974bf","resolution":{"observed_at":"2026-08-07T12:44:04.482160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-07T12:44:04.565880Z","title":"π0: A vision-language-action flow model for general robot control, 2024.URL https://arxiv","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:04.565880Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:dae6478b11f76452404f0dccd8d6a3034a1cf9229cdaef03f76e37e7790871e5","observation_id":"d6a663d2-4eb8-4385-a608-6c619c808dff","resolution":{"observed_at":"2026-08-07T12:44:04.565880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07864","last_updated":"2025-03-01T08:57:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-10T12:33:46Z","title":"RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07864","snapshot_observed_at":"2026-08-07T12:44:04.614233Z","title":"Rdt-1b: a diffusion foundation model for bimanual manipulation.arXiv preprint arXiv:2410.07864, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:04.614233Z"},"links":{"cited_paper":"/paper/2410.07864","citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:2bc7d66bdb60a4870e74f545a396224f6b75fd77535ca53e393afecce23d6005","observation_id":"0408ea97-8c40-43cb-9232-0a03ef86a20e","resolution":{"observed_at":"2026-08-07T12:44:04.614233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-07T12:44:04.662193Z","title":"Gr00t n1: An open foundation model for generalist humanoid robots.arXiv preprint arXiv:2503.14734, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:04.662193Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:4a9b57ea5bc3dd573ac55b0ecdfcecb2b24ee63df0881df77f86568cb426f1b2","observation_id":"6a5143d7-b632-43db-b835-ab8acb693f40","resolution":{"observed_at":"2026-08-07T12:44:04.662193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06669","last_updated":"2025-08-04T04:50:21Z","snapshot_observed_at":"2026-08-04T23:08:22.516431Z","submitted_at":"2025-03-09T15:40:29Z","title":"AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06669","snapshot_observed_at":"2026-08-07T12:44:04.720791Z","title":"Agibot world colosseo: A large-scale manipulation platform for scalable and intelligent embodied systems.arXiv preprint arXiv:2503.06669, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:04.720791Z"},"links":{"cited_paper":"/paper/2503.06669","citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:104dbabb4304eafcff902bfb7110e1c61d58817b0e25d26462d4853a14b63a5e","observation_id":"7d75ce22-ca01-4944-ac0b-53e1aca7ee89","resolution":{"observed_at":"2026-08-07T12:44:04.720791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:11.556604Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":"6fed3aff-4240-4f6f-857b-fd53a34a7b06","year":2025},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:04.806817Z"},"links":{"citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:168cc373bf0db43c13cca166ae9e749c9ced12bb9bedbaafdd786ed0f95ecc1c","observation_id":"c4286d83-0b49-482e-8780-22cbafe551a9","resolution":{"observed_at":"2026-08-07T12:44:11.619306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:11.448093Z","title":"Open-television: Teleoperation with immersive active visual feedback","venue":null,"work_id":"273d515f-7c93-4c95-aedf-afc8746de9b7","year":2024},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:04.848490Z"},"links":{"citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:04c9146e4a017543b82316368c0728c92443d4b43c0f91eec9d41cdcdc040df3","observation_id":"6073b6e8-ad1b-42a6-a8d4-eb0e1cf6aa34","resolution":{"observed_at":"2026-08-07T12:44:11.489368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13877","last_updated":"2025-05-27T01:46:53Z","snapshot_observed_at":"2026-07-06T20:09:14.917734Z","submitted_at":"2024-12-18T14:17:16Z","title":"RoboMIND: Benchmark on Multi-embodiment Intelligence Normative Data for Robot Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13877","snapshot_observed_at":"2026-08-07T12:44:04.884308Z","title":"Robomind: Benchmark on multi-embodiment intelligence normative data for robot manipulation.arXiv preprint arXiv:2412.13877, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:04.884308Z"},"links":{"cited_paper":"/paper/2412.13877","citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:5b0da2c203bad656b2032c4397f0e3191ba72fc748450d769d2a6e4f6bcf059e","observation_id":"0bf92015-6fa3-4b81-869b-0b24459e896e","resolution":{"observed_at":"2026-08-07T12:44:04.884308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:04.940244Z","title":"Motion-i2v: Consistent and controllable image-to-video generation with explicit motion modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:04.940244Z"},"links":{"citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:a5d860b93577b6ab5e0d877af4a6e859a845b564ccc536616f9f8d8ba53a00f3","observation_id":"eb0a3954-2c33-4201-87a8-179a45056f8c","resolution":{"observed_at":"2026-08-07T12:44:04.940244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:05.020864Z","title":"Raft: Recurrent all-pairs field transforms for optical flow","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:05.020864Z"},"links":{"citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:464d293b5ac773ff98a38b807f8091466844e7d5682bd66bf62460b9b98038ed","observation_id":"61677f15-766e-43c4-ad4d-81e8968df44c","resolution":{"observed_at":"2026-08-07T12:44:05.020864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:05.098999Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion.The International Journal of Robotics Research, page 02783649241273668, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:05.098999Z"},"links":{"citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:fa42be24f76e6e4e4e498cec54a7609051499f55ef96d9e873b0eeabc6c4d319","observation_id":"cd00a0c8-fdf3-41fc-990d-0c67755ed727","resolution":{"observed_at":"2026-08-07T12:44:05.098999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:11.286925Z","title":"Learning manipulation by sequencing motor primitives with a two-armed robot","venue":null,"work_id":"fc1048c4-831f-4fd3-80b6-2597cca6aaef","year":2016},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:05.146131Z"},"links":{"citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:d8ccd008b80a22c8f0e7ff55f7e3b91f8b3cd2980ac901f0a0cc2bc404789d13","observation_id":"2eccbf07-e555-4e86-97bf-6d047b2b7b58","resolution":{"observed_at":"2026-08-07T12:44:11.373458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:11.132128Z","title":"A system for imitation learning of contact-rich bimanual manipulation policies","venue":null,"work_id":"3fe572a2-95d1-467b-b532-be95f4364d1a","year":2022},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:05.197668Z"},"links":{"citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:2df77e03b1cad9c5cc307c0c58d23780f7bbe62e9534ba0367606b480f5ea0d0","observation_id":"f3228e6d-c88d-4ca3-8bda-a61f047d91c5","resolution":{"observed_at":"2026-08-07T12:44:11.239931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:11.015294Z","title":"Deep imitation learning for bimanual robotic manipulation.Advances in neural information processing systems, 33:2327–2337, 2020","venue":null,"work_id":"84724624-9f01-4004-a0d1-635cd74f7458","year":2020},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:05.285339Z"},"links":{"citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:b20903f71632b87b0943a127a5cc2722cac912368a73ebfbe655c54f3e146ffc","observation_id":"5d8336de-a3bf-4548-87df-43ea6ebf4ae6","resolution":{"observed_at":"2026-08-07T12:44:11.068028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10506","last_updated":"2024-06-18T18:11:07Z","snapshot_observed_at":"2026-08-13T00:53:11.671999Z","submitted_at":"2024-03-15T17:45:44Z","title":"HumanoidBench: Simulated Humanoid Benchmark for Whole-Body Locomotion and Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10506","snapshot_observed_at":"2026-08-07T12:44:05.423644Z","title":"Humanoid- bench: Simulated humanoid benchmark for whole-body locomotion and manipulation.arXiv preprint arXiv:2403.10506, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:05.423644Z"},"links":{"cited_paper":"/paper/2403.10506","citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:4eae8ba9f7fc7aeb0c9f8b38af2d0c8e552d23cf631695d4293348221f548f5e","observation_id":"15afa95b-f4d9-4901-969a-88adc9cd4342","resolution":{"observed_at":"2026-08-07T12:44:05.423644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:10.871100Z","title":"Bigym: A demo-driven mobile bi-manual manipulation benchmark","venue":null,"work_id":"64e5dddf-d898-48fc-95f3-da968c356fad","year":null},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:05.507727Z"},"links":{"citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:4c6358890f8693b583240f60a79e7c7711d4aab9309b5cbd3e76e9ed6265a735","observation_id":"a5e7fb93-c5d5-4fa0-b5da-c3a0372b47c6","resolution":{"observed_at":"2026-08-07T12:44:10.942838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:10.589985Z","title":"Zhao, and Chelsea Finn","venue":null,"work_id":"8c078da4-f502-4b6f-8b8c-c4ad30dbb4cc","year":2024},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:05.693363Z"},"links":{"citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:c2d248d5791291c1cfdd8b35681cbc67afbf4eabb6887f26a86baee3ee21b89f","observation_id":"1c11c2fe-234f-4b6c-8226-0a098b1da6b1","resolution":{"observed_at":"2026-08-07T12:44:10.670542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:10.365537Z","title":"Mimicgen: A data generation system for scalable robot learning using human demonstrations","venue":null,"work_id":"7773b85f-82d3-4ab0-b10b-9a717fa8a9a2","year":2023},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:05.753884Z"},"links":{"citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:0b2f9fb2a10d53456f319ed8d45318abf6ba3bbf44e4ff37cdd1e0b7af67aad6","observation_id":"167d60bd-69cf-4f17-82e8-9cd07240c600","resolution":{"observed_at":"2026-08-07T12:44:10.514527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:10.026549Z","title":"Dexmimicgen: Automated data generation for bimanual dexterous manipulation via imitation learning","venue":null,"work_id":"e3630f74-4975-4aeb-8128-986ebdabdfa4","year":2025},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:05.795213Z"},"links":{"citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:72fdd1a72b6dd623972745c0023ddd1ea1bba4d662f4fa9bb6f67dbc9f3eeff7","observation_id":"d272dfd6-bcb4-4c07-a694-0a90644aaa95","resolution":{"observed_at":"2026-08-07T12:44:10.167669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:12.015702Z","title":"Bi-kvil: Keypoints-based visual imitation learning of bimanual manipulation tasks","venue":null,"work_id":"a4efc23d-f6a9-425d-a67e-efd2fb244e82","year":2024},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:05.857117Z"},"links":{"citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:87a4dd8fc1bc062f66e531192ee07deb29473ed38a90435ff2beff7369a3b1de","observation_id":"1eb90710-51fb-4167-9347-2ce984bc88d0","resolution":{"observed_at":"2026-08-07T12:44:12.095500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:12.163116Z","title":"Interactive imitation learning of bimanual movement primitives.IEEE/ASME Transactions on Mechatronics, 2023","venue":null,"work_id":"b348ccb8-396d-4ad7-a02f-13effab4d6be","year":2023},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:05.939426Z"},"links":{"citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:dd537c4ead9c8df765e9da14c2298f288b83ab4c8b4df1238630d5843fd3b9be","observation_id":"1dd43b64-256b-4be9-9f06-9c35b259422b","resolution":{"observed_at":"2026-08-07T12:44:12.265045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:09.732103Z","title":"InterACT: Inter-dependency aware action chunking with hierarchical attention transformers for bimanual manipulation","venue":null,"work_id":"9d053ca0-810e-4cb8-9855-950ce43b1cae","year":2024},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:05.991148Z"},"links":{"citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:9d3d6e5a42aaa795e26a51bdb25d5a9804babf1cdf9894895943ce1c58ae52f7","observation_id":"60c6a14d-e412-4b26-9edf-55b1e1b1aa56","resolution":{"observed_at":"2026-08-07T12:44:09.833950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-07T12:44:06.059408Z","title":"Octo: An open-source generalist robot policy.arXiv preprint arXiv:2405.12213, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:06.059408Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:538575331ec9c42f0334b8f1acb8d9bcc8ac9e63c402ee962cd7990bfb4fd2af","observation_id":"c28b8204-994e-4025-a49b-910d8f7ab99d","resolution":{"observed_at":"2026-08-07T12:44:06.059408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-07-06T20:26:31.558337Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15830","snapshot_observed_at":"2026-08-07T12:44:06.124651Z","title":"Spatialvla: Exploring spatial representations for visual-language-action model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:06.124651Z"},"links":{"cited_paper":"/paper/2501.15830","citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:c8c953165b7043209f642ca2bdd84846d328041dd247da4b1cb930b672838fd1","observation_id":"5b935397-c482-4cc6-9d71-910456882a75","resolution":{"observed_at":"2026-08-07T12:44:06.124651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19650","last_updated":"2024-11-29T12:06:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-29T12:06:03Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19650","snapshot_observed_at":"2026-08-07T12:44:06.193883Z","title":"Cogact: A foundational vision-language-action model for synergizing cognition and action in robotic manipulation.arXiv preprint arXiv:2411.19650, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:06.193883Z"},"links":{"cited_paper":"/paper/2411.19650","citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:c1e7e87e15108ef2b452185e17935d13e9c8cf0ce41cc6a4bd22778750b6b13a","observation_id":"231118b3-8f9b-4594-a547-cde708953bfe","resolution":{"observed_at":"2026-08-07T12:44:06.193883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:06.269803Z","title":"Dexgraspvla: A vision-language-action framework towards general dexterous grasping.arXiv preprint arXiv:2502.20900, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:06.269803Z"},"links":{"citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:31999fb2ca18df8f785cde0e9229140e6c995be4673382eea5d5af8f7e1a2995","observation_id":"3e83782f-60aa-4ab7-a5c5-87baef0780f6","resolution":{"observed_at":"2026-08-07T12:44:06.269803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20384","last_updated":"2025-04-14T11:39:39Z","snapshot_observed_at":"2026-08-08T15:01:31.551177Z","submitted_at":"2025-03-26T10:05:38Z","title":"MoLe-VLA: Dynamic Layer-skipping Vision Language Action Model via Mixture-of-Layers for Efficient Robot Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20384","snapshot_observed_at":"2026-08-07T12:44:06.343233Z","title":"Mole-vla: Dynamic layer-skipping vision language action model via mixture-of-layers for efficient robot manipulation.arXiv preprint arXiv:2503.20384, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:06.343233Z"},"links":{"cited_paper":"/paper/2503.20384","citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:af965bfdd3240e4c1662b0b43742812f7d404a30aaf61419cb1abc189938b66b","observation_id":"6f11c451-0ad3-4ec4-acac-2e7d5d3fa5d5","resolution":{"observed_at":"2026-08-07T12:44:06.343233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:06.440163Z","title":"Learning an actionable dis- crete diffusion policy via large-scale actionless video pre-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:06.440163Z"},"links":{"citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:c532987a7207461c4939f475503d3c07534feb5513315f8e45bced80150bf104","observation_id":"18a086b1-d1e2-4298-95f8-2b4e561103c0","resolution":{"observed_at":"2026-08-07T12:44:06.440163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:06.539740Z","title":"Video diffusion models.Advances in Neural Information Processing Systems, 35:8633–8646, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:06.539740Z"},"links":{"citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:e7b5871623c621f2aff313d898fc4384f2c15b89e6249b3272a5b3ef0370d1aa","observation_id":"bee84a65-eff2-407f-86dd-eab3fd439225","resolution":{"observed_at":"2026-08-07T12:44:06.539740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-08-12T19:21:15.526321Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-08-07T12:44:06.609040Z","title":"Cogvideo: Large-scale pretraining for text-to-video generation via transformers.arXiv preprint arXiv:2205.15868, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:06.609040Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:bfc81a88f0515a98c7c9381761e8da3dd2ce3287e8733f4dcf5f7c97e468adfd","observation_id":"5bcbadb6-88c3-414d-8bb9-ca315084392a","resolution":{"observed_at":"2026-08-07T12:44:06.609040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:06.677872Z","title":"Learning universal policies via text-guided video generation.Advances in neural information processing systems, 36:9156–9172, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:06.677872Z"},"links":{"citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:b583afe9a757ee9529603cf3169e02660b7dc4e877592d8d35c5a0762f0ac166","observation_id":"da57f813-7684-47be-ac5b-b5790e4c2d0f","resolution":{"observed_at":"2026-08-07T12:44:06.677872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:09.619154Z","title":"Tenenbaum","venue":null,"work_id":"429000c6-8939-4ffe-a31d-a234016c3af0","year":2024},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:06.744303Z"},"links":{"citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:5ccff8c3f59e82241771103583ea893c2638525b688c4a6329909f42242c833f","observation_id":"5c371ed9-8661-4b74-bd73-2598e2f92313","resolution":{"observed_at":"2026-08-07T12:44:09.653079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:09.518605Z","title":"Grounding video models to actions through goal conditioned exploration","venue":null,"work_id":"4fe29b73-f654-430e-a54a-31025b423154","year":2025},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:06.847418Z"},"links":{"citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:45fa321d9acae8ff6210555e20d1f5e9d2cf7ef180c925ff5c78ad36810a6ca7","observation_id":"d116d889-5c4c-4831-b474-abd130333a4f","resolution":{"observed_at":"2026-08-07T12:44:09.592222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:09.178839Z","title":"Robodreamer: Learning compositional world models for robot imagination","venue":null,"work_id":"f9503ec2-350a-4672-b4be-13a538ca7af7","year":2024},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:06.922885Z"},"links":{"citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:e5810c65f9ba0a2a7d74816e312d0b28d2e9a756e5998236966fb92f3615c9cc","observation_id":"34c42fec-0338-40a2-9cf2-cdec63d56755","resolution":{"observed_at":"2026-08-07T12:44:09.299336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:09.137199Z","title":"Vidman: Exploiting implicit dynamics from video diffusion model for effective robot manipulation.Advances in Neural Information Processing Systems, 37:41051–41075, 2024","venue":null,"work_id":"f5200275-9749-4cb9-b288-d24473036634","year":2024},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:07.016998Z"},"links":{"citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:16a8b18f56f19b2294e375a63560491d2be383e29e1c15fa7170f17cc51a2873","observation_id":"3cefc23a-d791-41c4-a1b5-45c13c0bb7ff","resolution":{"observed_at":"2026-08-07T12:44:09.148044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20404","last_updated":"2024-12-29T08:52:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-29T08:52:49Z","title":"Open-Sora: Democratizing Efficient Video Production for All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20404","snapshot_observed_at":"2026-08-07T12:44:07.109191Z","title":"Open-sora: Democratizing efficient video production for all.arXiv preprint arXiv:2412.20404, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:07.109191Z"},"links":{"cited_paper":"/paper/2412.20404","citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:c319d212337221f107a583cbbfdf25c3aceeead445b45a74e796b8666aabfe16","observation_id":"3d7bb084-2812-4bb6-9c60-6fdca5151224","resolution":{"observed_at":"2026-08-07T12:44:07.109191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:07.210196Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models: Open x-embodiment collaboration 0","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:07.210196Z"},"links":{"citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:f4141257acecf1e59486e3d203d87ba99a35c35011b8beb0ce16ff2b7053444f","observation_id":"2768bf18-0f9c-4e5f-8f63-771cb17a482c","resolution":{"observed_at":"2026-08-07T12:44:07.210196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14540","last_updated":"2025-07-29T16:48:03Z","snapshot_observed_at":"2026-08-12T23:38:08.227738Z","submitted_at":"2024-06-20T17:50:16Z","title":"IRASim: A Fine-Grained World Model for Robot Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14540","snapshot_observed_at":"2026-08-07T12:44:07.307769Z","title":"Irasim: Learning interactive real-robot action simulators.arXiv preprint arXiv:2406.14540, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:07.307769Z"},"links":{"cited_paper":"/paper/2406.14540","citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:5459108cd16e1eb100a72e9501d75b9d7f2aba40e90f56b26f4fb9b7e162b998","observation_id":"d80fbe2f-7cd1-40ee-9807-32de246ad89f","resolution":{"observed_at":"2026-08-07T12:44:07.307769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12822","last_updated":"2024-11-24T19:37:04Z","snapshot_observed_at":"2026-08-12T22:33:25.044761Z","submitted_at":"2024-10-01T13:48:31Z","title":"AVID: Adapting Video Diffusion Models to World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12822","snapshot_observed_at":"2026-08-07T12:44:07.372300Z","title":"Avid: Adapting video diffusion models to world models.arXiv preprint arXiv:2410.12822, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:07.372300Z"},"links":{"cited_paper":"/paper/2410.12822","citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:2785f8760e6b977aced9a9d8cc23d36dc29a4adcb9411bdb4f12d84ee53c2ad6","observation_id":"34e5f4aa-5e0c-4837-8273-c8eea0c9a849","resolution":{"observed_at":"2026-08-07T12:44:07.372300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:08.931957Z","title":"AdaWM: Adaptive world model based planning for autonomous driving","venue":null,"work_id":"81ecc4d7-ef80-42a7-b6e6-d3f9730d6084","year":2025},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:07.423391Z"},"links":{"citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:c48fdda90250179a4260bf15d8049a8e80507287d56d493ceba830dece8e5bf9","observation_id":"e1c12c8f-e986-43f3-8d92-73890d0503f6","resolution":{"observed_at":"2026-08-07T12:44:09.049168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:08.757386Z","title":"Flowformer++: Masked cost volume autoencoding for pretraining optical flow estimation","venue":null,"work_id":"740e4e20-8356-4c52-9c49-f74af7d366b2","year":2023},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:07.497484Z"},"links":{"citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:11167809d56040b198e0e288c0b62d6d7269b95119903f3797f4132ace1afc88","observation_id":"8d20f82c-8c48-4edd-a587-1ff4ce3d668d","resolution":{"observed_at":"2026-08-07T12:44:08.813360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03954","last_updated":"2024-09-27T02:43:48Z","snapshot_observed_at":"2026-08-01T16:34:39.855742Z","submitted_at":"2024-03-06T18:58:49Z","title":"3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03954","snapshot_observed_at":"2026-08-07T12:44:07.559077Z","title":"3d diffusion policy: Generalizable visuomotor policy learning via simple 3d representations.arXiv preprint arXiv:2403.03954, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:07.559077Z"},"links":{"cited_paper":"/paper/2403.03954","citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:3727fdb8b6417f13a3f23d75dfe6ff44c2363a41dcdfae56f659c822ca002475","observation_id":"650addb1-45ad-418b-9f65-ca3a1138b024","resolution":{"observed_at":"2026-08-07T12:44:07.559077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:07.632798Z","title":"Image quality metrics: Psnr vs","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:07.632798Z"},"links":{"citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:78c171a32fd5e99e372db75b597e87d22d28a3c0c9986043c925eaa08b463a68","observation_id":"3a264020-d2e0-4d8d-a3a7-a8611b32084e","resolution":{"observed_at":"2026-08-07T12:44:07.632798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:07.718410Z","title":"Image quality assessment: from error visibility to structural similarity.IEEE transactions on image processing, 13(4):600–612, 2004","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:07.718410Z"},"links":{"citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:5126970448157a35f062bb05e599475d17130301ed57bc80b05af2c3ce869424","observation_id":"a590c559-8eca-4f32-a6a0-249a978f4b86","resolution":{"observed_at":"2026-08-07T12:44:07.718410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:07.790593Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:07.790593Z"},"links":{"citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:c1af8eb74f07613f6a54de829d33f856849182f14a1d0f87e91c22e323a18bd8","observation_id":"031ffeed-379c-4cf0-b6be-1a3a8a29b77e","resolution":{"observed_at":"2026-08-07T12:44:07.790593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-08-11T02:30:38.877941Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-07T12:44:07.872644Z","title":"Towards accurate generative models of video: A new metric & challenges.arXiv preprint arXiv:1812.01717, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:07.872644Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:17cb0af6aa270e4383755ed6da8ffbbb384958dd08a3fc8de2d495907fc9ebb0","observation_id":"7927f42b-564d-48ce-9124-096462d42db5","resolution":{"observed_at":"2026-08-07T12:44:07.872644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03162","last_updated":"2024-07-03T14:35:35Z","snapshot_observed_at":"2026-08-12T23:29:32.902032Z","submitted_at":"2024-07-03T14:35:35Z","title":"Bunny-VisionPro: Real-Time Bimanual Dexterous Teleoperation for Imitation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03162","snapshot_observed_at":"2026-08-07T12:44:07.953294Z","title":"Bunny-visionpro: Real-time bimanual dexterous teleoperation for imitation learning.arXiv preprint arXiv:2407.03162, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:07.953294Z"},"links":{"cited_paper":"/paper/2407.03162","citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:eae4263cf4d84ea59bd7e990714b0839de600ea4f3af7183ec034ed834b71a36","observation_id":"46889b61-55be-4ffa-b472-269bd1302727","resolution":{"observed_at":"2026-08-07T12:44:07.953294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08858","last_updated":"2024-06-13T06:44:46Z","snapshot_observed_at":"2026-08-12T23:43:53.764034Z","submitted_at":"2024-06-13T06:44:46Z","title":"OmniH2O: Universal and Dexterous Human-to-Humanoid Whole-Body Teleoperation and Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08858","snapshot_observed_at":"2026-08-07T12:44:08.033340Z","title":"Omnih2o: Universal and dexterous human-to-humanoid whole-body teleoperation and learning.arXiv preprint arXiv:2406.08858, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:08.033340Z"},"links":{"cited_paper":"/paper/2406.08858","citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:7da2dfa25eb3f819cc0217f9e99ac0d4b119ec8c9dcae0934e0bdfa1846ec56d","observation_id":"1cd04788-5a2c-48be-ba50-222e4c3e00a0","resolution":{"observed_at":"2026-08-07T12:44:08.033340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:08.139200Z","title":"Using apple vision pro to train and control robots, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:08.139200Z"},"links":{"citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:b4034e892cf6ee3b08714a0b7aed4627707d8eb77126ce736853f45d7d4e1685","observation_id":"179cb5ee-4512-475f-b9e9-989c0d8982f7","resolution":{"observed_at":"2026-08-07T12:44:08.139200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:08.543249Z","title":"Grasp the rope on the box and pull together to bring the box closer","venue":null,"work_id":"653df9f3-f7e3-47f2-94d4-0f894320c6b6","year":2019},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:08.215410Z"},"links":{"citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:c0e581aa2a9f5896515caf482f1367cf1b616057e47e2415bc2e1a001b43cf79","observation_id":"ac0e4fe9-bc07-4976-9e0c-bfabf194b869","resolution":{"observed_at":"2026-08-07T12:44:08.641167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:10.729788Z","title":null,"venue":null,"work_id":"171a7702-8ef6-4cae-a379-b99ba5ecaa1f","year":null},"citing_paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:05.600471Z"},"links":{"citing_paper":"/paper/2505.24156"},"observation_digest":"sha256:f91271bb2803bf1cc579b6ddaa3a9e2b0ce4d5110b5156090732e1bb9c540d2b","observation_id":"2b3325ee-2e6d-4d9a-9643-4f982f124578","resolution":{"observed_at":"2026-08-07T12:44:10.796678Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.24156","last_updated":"2025-05-30T03:01:21Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T15:02:40.006255Z","submitted_at":"2025-05-30T03:01:21Z","title":"Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":0,"verified_fuzzy":24},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 0 inbound Pith citation observations for arXiv:2505.24156."}