{"as_of":"2026-08-09T22:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0cabc8c5cc8fc46908f697c6be2d8de3ce260ba1e06f727f81c3668f5bbb1539","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T12:21:16.963000Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.02542/citation-record","integrity":"/paper/2607.02542/integrity","json":"/paper/2607.02542/citation-record.json","paper":"/paper/2607.02542"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-07-12T12:21:16.963000Z","title":"Do as i can, not as i say: Grounding language in robotic affordances, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02542","last_updated":"2026-06-24T00:25:44Z","snapshot_observed_at":"2026-08-06T14:11:26.812383Z","submitted_at":"2026-06-24T00:25:44Z","title":"iFLYTEK-Embodied-Omni Technical Report","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T12:21:16.963000Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2607.02542"},"observation_digest":"sha256:c049d587cf15844482b8da8f4c9f6f02b656fba0175f90b7f8c38b836e3b5881","observation_id":"6e2751ee-0004-4416-a67b-6be8ee22ac04","resolution":{"observed_at":"2026-07-12T12:21:16.963000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-07-12T12:21:16.963000Z","title":"URLhttps://arxiv.org/ abs/2410.24164","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02542","last_updated":"2026-06-24T00:25:44Z","snapshot_observed_at":"2026-08-06T14:11:26.812383Z","submitted_at":"2026-06-24T00:25:44Z","title":"iFLYTEK-Embodied-Omni Technical Report","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-12T12:21:16.963000Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2607.02542"},"observation_digest":"sha256:62ff1b14f6992435fdceac834ba09f95f5b96f29ad785697e74da354d03d88f7","observation_id":"0f3c5a8a-1b89-4599-86ce-f50c0db5f981","resolution":{"observed_at":"2026-07-12T12:21:16.963000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-07-12T12:21:16.963000Z","title":"π0.5: a vision-language-action model with open-world generalization, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02542","last_updated":"2026-06-24T00:25:44Z","snapshot_observed_at":"2026-08-06T14:11:26.812383Z","submitted_at":"2026-06-24T00:25:44Z","title":"iFLYTEK-Embodied-Omni Technical Report","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-12T12:21:16.963000Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2607.02542"},"observation_digest":"sha256:3e160d4b029a6f6ca15ee0fd2411e1c1292114dcb8b93787e15d6905aa1b1b22","observation_id":"3bf54f10-1d96-4af2-a14c-49da641d554e","resolution":{"observed_at":"2026-07-12T12:21:16.963000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T12:21:16.963000Z","title":"Agibot world colosseo: A large-scale manipulation platform for scalable and intelligent embodied systems,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02542","last_updated":"2026-06-24T00:25:44Z","snapshot_observed_at":"2026-08-06T14:11:26.812383Z","submitted_at":"2026-06-24T00:25:44Z","title":"iFLYTEK-Embodied-Omni Technical Report","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-12T12:21:16.963000Z"},"links":{"citing_paper":"/paper/2607.02542"},"observation_digest":"sha256:a1081f8af6efe79b133cfbe6e1afbd285eaf05cf70af8215693fc9eb258e45e8","observation_id":"14eb1fcb-07f8-481f-800c-9b7a015c1a78","resolution":{"observed_at":"2026-07-12T12:21:16.963000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06669","last_updated":"2025-08-04T04:50:21Z","snapshot_observed_at":"2026-08-04T23:08:22.516431Z","submitted_at":"2025-03-09T15:40:29Z","title":"AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06669","snapshot_observed_at":"2026-07-12T12:21:16.963000Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02542","last_updated":"2026-06-24T00:25:44Z","snapshot_observed_at":"2026-08-06T14:11:26.812383Z","submitted_at":"2026-06-24T00:25:44Z","title":"iFLYTEK-Embodied-Omni Technical Report","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-12T12:21:16.963000Z"},"links":{"cited_paper":"/paper/2503.06669","citing_paper":"/paper/2607.02542"},"observation_digest":"sha256:3e09e9d7875879ae7b8466c98f3cd50274c949ad2440d208d3607c0bab4044b4","observation_id":"186f6040-da03-458c-8e24-815e5b4cd2ac","resolution":{"observed_at":"2026-07-12T12:21:16.963000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T12:21:16.963000Z","title":"Learning universal policies via text-guided video generation, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02542","last_updated":"2026-06-24T00:25:44Z","snapshot_observed_at":"2026-08-06T14:11:26.812383Z","submitted_at":"2026-06-24T00:25:44Z","title":"iFLYTEK-Embodied-Omni Technical Report","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-12T12:21:16.963000Z"},"links":{"citing_paper":"/paper/2607.02542"},"observation_digest":"sha256:f4fe5c3d1027ce598f141f2b041f526853c75ce525d94e4e8b56267e787c2224","observation_id":"9e728008-efab-41f7-a881-0db805d360f9","resolution":{"observed_at":"2026-07-12T12:21:16.963000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.04261","last_updated":"2017-06-15T21:15:13Z","snapshot_observed_at":"2026-08-07T16:53:02.994435Z","submitted_at":"2017-06-13T21:26:19Z","title":"The \"something something\" video database for learning and evaluating visual common sense","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.04261","snapshot_observed_at":"2026-07-12T12:21:16.963000Z","title":"something something","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.02542","last_updated":"2026-06-24T00:25:44Z","snapshot_observed_at":"2026-08-06T14:11:26.812383Z","submitted_at":"2026-06-24T00:25:44Z","title":"iFLYTEK-Embodied-Omni Technical Report","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-12T12:21:16.963000Z"},"links":{"cited_paper":"/paper/1706.04261","citing_paper":"/paper/2607.02542"},"observation_digest":"sha256:a581e44a5b978715774642f5bf0cf00813c629835e83676550080b88fa42dccb","observation_id":"02496fb4-be63-4472-adb3-5ee9d78284ca","resolution":{"observed_at":"2026-07-12T12:21:16.963000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.07058","last_updated":"2022-03-11T19:40:26Z","snapshot_observed_at":"2026-07-06T11:57:42.646453Z","submitted_at":"2021-10-13T22:19:32Z","title":"Ego4D: Around the World in 3,000 Hours of Egocentric Video","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.07058","snapshot_observed_at":"2026-07-12T12:21:16.963000Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02542","last_updated":"2026-06-24T00:25:44Z","snapshot_observed_at":"2026-08-06T14:11:26.812383Z","submitted_at":"2026-06-24T00:25:44Z","title":"iFLYTEK-Embodied-Omni Technical Report","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-12T12:21:16.963000Z"},"links":{"cited_paper":"/paper/2110.07058","citing_paper":"/paper/2607.02542"},"observation_digest":"sha256:a13d188c47b8d89a5b5dfe0a852d739c886b464a75a12f0008201117dca1f893","observation_id":"bdd799a9-e5b1-4425-b886-bb1651d94de2","resolution":{"observed_at":"2026-07-12T12:21:16.963000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T12:21:16.963000Z","title":"Scene reconstruction with functional objects for robot autonomy.International Journal of Computer Vision (IJCV), 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02542","last_updated":"2026-06-24T00:25:44Z","snapshot_observed_at":"2026-08-06T14:11:26.812383Z","submitted_at":"2026-06-24T00:25:44Z","title":"iFLYTEK-Embodied-Omni Technical Report","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-12T12:21:16.963000Z"},"links":{"citing_paper":"/paper/2607.02542"},"observation_digest":"sha256:50b332c0cec54eb616e74b2fb43ea70883e00b6dc81fc2f92de95d9c6427d77a","observation_id":"d6e44eb9-c443-4b43-ae64-36e5fcc19403","resolution":{"observed_at":"2026-07-12T12:21:16.963000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11709","last_updated":"2026-03-09T06:44:42Z","snapshot_observed_at":"2026-07-06T21:25:23.371749Z","submitted_at":"2025-05-16T21:34:47Z","title":"EgoDex: Learning Dexterous Manipulation from Large-Scale Egocentric Video","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11709","snapshot_observed_at":"2026-07-12T12:21:16.963000Z","title":"Egodex: Learning dexterous manipulation from large-scale egocentric video, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02542","last_updated":"2026-06-24T00:25:44Z","snapshot_observed_at":"2026-08-06T14:11:26.812383Z","submitted_at":"2026-06-24T00:25:44Z","title":"iFLYTEK-Embodied-Omni Technical Report","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-12T12:21:16.963000Z"},"links":{"cited_paper":"/paper/2505.11709","citing_paper":"/paper/2607.02542"},"observation_digest":"sha256:b28e3bb92c9e927dffe2878f39d0713ef477ea1669af8af1a1750976beae3cd6","observation_id":"5e4b373d-0184-4b1c-935d-c357c7705b58","resolution":{"observed_at":"2026-07-12T12:21:16.963000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14803","last_updated":"2025-05-04T04:28:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T12:48:40Z","title":"Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14803","snapshot_observed_at":"2026-07-12T12:21:16.963000Z","title":"Video prediction policy: A generalist robot policy with predictive visual representations, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02542","last_updated":"2026-06-24T00:25:44Z","snapshot_observed_at":"2026-08-06T14:11:26.812383Z","submitted_at":"2026-06-24T00:25:44Z","title":"iFLYTEK-Embodied-Omni Technical Report","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-12T12:21:16.963000Z"},"links":{"cited_paper":"/paper/2412.14803","citing_paper":"/paper/2607.02542"},"observation_digest":"sha256:d00f8fac3d8b1c2b0439bfb812beee59819e8afb7b7fe1d03d43377853f29926","observation_id":"96931867-b544-4cf3-a5b9-6df02b8f1a60","resolution":{"observed_at":"2026-07-12T12:21:16.963000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05608","last_updated":"2022-07-12T15:20:48Z","snapshot_observed_at":"2026-08-08T09:48:52.583612Z","submitted_at":"2022-07-12T15:20:48Z","title":"Inner Monologue: Embodied Reasoning through Planning with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.05608","snapshot_observed_at":"2026-07-12T12:21:16.963000Z","title":"Inner monologue: Embodied reasoning through planning with language models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02542","last_updated":"2026-06-24T00:25:44Z","snapshot_observed_at":"2026-08-06T14:11:26.812383Z","submitted_at":"2026-06-24T00:25:44Z","title":"iFLYTEK-Embodied-Omni Technical Report","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-12T12:21:16.963000Z"},"links":{"cited_paper":"/paper/2207.05608","citing_paper":"/paper/2607.02542"},"observation_digest":"sha256:10773c4437454fb12b3bc228e7c5a54851419f33a8be91a3b47cf48d0388eb87","observation_id":"36ebdec1-5b99-44f5-94d3-504ac052be60","resolution":{"observed_at":"2026-07-12T12:21:16.963000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12945","last_updated":"2025-04-22T17:57:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-19T17:48:38Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12945","snapshot_observed_at":"2026-07-12T12:21:16.963000Z","title":"Droid: A large-scale in-the-wild robot manipulation dataset, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02542","last_updated":"2026-06-24T00:25:44Z","snapshot_observed_at":"2026-08-06T14:11:26.812383Z","submitted_at":"2026-06-24T00:25:44Z","title":"iFLYTEK-Embodied-Omni Technical Report","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-12T12:21:16.963000Z"},"links":{"cited_paper":"/paper/2403.12945","citing_paper":"/paper/2607.02542"},"observation_digest":"sha256:31636cdd7d21259b3f52879616633edeb4d8a7ca9abea20fd41b38b524fa7e73","observation_id":"e1f1d589-f776-405c-9673-a75e97945aff","resolution":{"observed_at":"2026-07-12T12:21:16.963000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T12:21:16.963000Z","title":"Openvla: An open-source vision-language-action model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02542","last_updated":"2026-06-24T00:25:44Z","snapshot_observed_at":"2026-08-06T14:11:26.812383Z","submitted_at":"2026-06-24T00:25:44Z","title":"iFLYTEK-Embodied-Omni Technical Report","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-12T12:21:16.963000Z"},"links":{"citing_paper":"/paper/2607.02542"},"observation_digest":"sha256:2aa5876e890a0db13791d7660cce8841fb0e83d1672b41d5a9c3c3ac2607ee08","observation_id":"22984ed6-0152-42ab-897a-620be1bbc561","resolution":{"observed_at":"2026-07-12T12:21:16.963000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.16163","last_updated":"2026-01-22T18:09:30Z","snapshot_observed_at":"2026-08-06T02:05:52.408905Z","submitted_at":"2026-01-22T18:09:30Z","title":"Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.16163","snapshot_observed_at":"2026-07-12T12:21:16.963000Z","title":"Cosmos policy: Fine-tuning video models for visuomotor control and planning, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02542","last_updated":"2026-06-24T00:25:44Z","snapshot_observed_at":"2026-08-06T14:11:26.812383Z","submitted_at":"2026-06-24T00:25:44Z","title":"iFLYTEK-Embodied-Omni Technical Report","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-12T12:21:16.963000Z"},"links":{"cited_paper":"/paper/2601.16163","citing_paper":"/paper/2607.02542"},"observation_digest":"sha256:50c9127df8d71e8e2c2d368477969901c63b98fb1e30803953399ae95c1601db","observation_id":"0fced5b0-9e3c-4cf5-85b0-4d950c630d0b","resolution":{"observed_at":"2026-07-12T12:21:16.963000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21998","last_updated":"2026-03-22T15:37:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-29T17:07:43Z","title":"Causal World Modeling for Robot Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.21998","snapshot_observed_at":"2026-07-12T12:21:16.963000Z","title":"Causal world modeling for robot control, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02542","last_updated":"2026-06-24T00:25:44Z","snapshot_observed_at":"2026-08-06T14:11:26.812383Z","submitted_at":"2026-06-24T00:25:44Z","title":"iFLYTEK-Embodied-Omni Technical Report","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-12T12:21:16.963000Z"},"links":{"cited_paper":"/paper/2601.21998","citing_paper":"/paper/2607.02542"},"observation_digest":"sha256:19c4774d08b12919465fc6879577108aa9ca39d0186974064fc7a3f7529a91ce","observation_id":"c2976826-44d4-45ab-96c3-5c17f549d5b9","resolution":{"observed_at":"2026-07-12T12:21:16.963000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.01577","last_updated":"2024-01-03T14:31:13Z","snapshot_observed_at":"2026-07-06T12:43:35.390032Z","submitted_at":"2022-03-03T09:02:52Z","title":"HOI4D: A 4D Egocentric Dataset for Category-Level Human-Object Interaction","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.01577","snapshot_observed_at":"2026-07-12T12:21:16.963000Z","title":"Hoi4d: A 4d egocentric dataset for category-level human-object interaction, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02542","last_updated":"2026-06-24T00:25:44Z","snapshot_observed_at":"2026-08-06T14:11:26.812383Z","submitted_at":"2026-06-24T00:25:44Z","title":"iFLYTEK-Embodied-Omni Technical Report","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-12T12:21:16.963000Z"},"links":{"cited_paper":"/paper/2203.01577","citing_paper":"/paper/2607.02542"},"observation_digest":"sha256:a1fbad029a8762e6c4dbd0d3fa74abf578e952f994958656627b4302edda0e13","observation_id":"391cc95e-bd8b-40d8-8564-bfbe9ebc3f8b","resolution":{"observed_at":"2026-07-12T12:21:16.963000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-08-08T01:53:43.555672Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08864","snapshot_observed_at":"2026-07-12T12:21:16.963000Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02542","last_updated":"2026-06-24T00:25:44Z","snapshot_observed_at":"2026-08-06T14:11:26.812383Z","submitted_at":"2026-06-24T00:25:44Z","title":"iFLYTEK-Embodied-Omni Technical Report","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-12T12:21:16.963000Z"},"links":{"cited_paper":"/paper/2310.08864","citing_paper":"/paper/2607.02542"},"observation_digest":"sha256:6ee0aa59ed3fb8a11bdd3742febd8c26e52236e6b4266986ccfeee5d2b22ab92","observation_id":"821d1652-02c2-4d82-b0bd-3308d2f4f2ce","resolution":{"observed_at":"2026-07-12T12:21:16.963000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15692","last_updated":"2025-12-19T18:30:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T18:47:31Z","title":"mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.15692","snapshot_observed_at":"2026-07-12T12:21:16.963000Z","title":"mimic-video: Video-action models for generalizable robot control beyond vlas, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02542","last_updated":"2026-06-24T00:25:44Z","snapshot_observed_at":"2026-08-06T14:11:26.812383Z","submitted_at":"2026-06-24T00:25:44Z","title":"iFLYTEK-Embodied-Omni Technical Report","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-12T12:21:16.963000Z"},"links":{"cited_paper":"/paper/2512.15692","citing_paper":"/paper/2607.02542"},"observation_digest":"sha256:3ff97c03fdcb8f0ffd8d6fc321a6365d637fd7eae07125c32b96f3aeb5bf06ce","observation_id":"5d5bcbea-2f1a-4453-9174-e093586b9f23","resolution":{"observed_at":"2026-07-12T12:21:16.963000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12952","last_updated":"2024-01-17T22:41:29Z","snapshot_observed_at":"2026-08-02T23:50:48.668259Z","submitted_at":"2023-08-24T17:41:20Z","title":"BridgeData V2: A Dataset for Robot Learning at Scale","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12952","snapshot_observed_at":"2026-07-12T12:21:16.963000Z","title":"Bridgedata v2: A dataset for robot learning at scale, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02542","last_updated":"2026-06-24T00:25:44Z","snapshot_observed_at":"2026-08-06T14:11:26.812383Z","submitted_at":"2026-06-24T00:25:44Z","title":"iFLYTEK-Embodied-Omni Technical Report","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-12T12:21:16.963000Z"},"links":{"cited_paper":"/paper/2308.12952","citing_paper":"/paper/2607.02542"},"observation_digest":"sha256:a643ce08cc7b2ecab657bafe910232e52bdd8008e1cf7e531be0b755ddb1ccbf","observation_id":"7d22417f-46df-4c2e-adbc-d398545009c2","resolution":{"observed_at":"2026-07-12T12:21:16.963000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T12:21:16.963000Z","title":"Holoassist: an egocentric human interaction dataset for interactive ai assistants in the real world,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02542","last_updated":"2026-06-24T00:25:44Z","snapshot_observed_at":"2026-08-06T14:11:26.812383Z","submitted_at":"2026-06-24T00:25:44Z","title":"iFLYTEK-Embodied-Omni Technical Report","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-12T12:21:16.963000Z"},"links":{"citing_paper":"/paper/2607.02542"},"observation_digest":"sha256:fbb7fec054850b8684555c35434d4db80382bd0775d453a69627a1df80413542","observation_id":"b4a35145-a348-4dc1-8802-b35b44b9e3a0","resolution":{"observed_at":"2026-07-12T12:21:16.963000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17024","last_updated":"2023-09-29T07:17:43Z","snapshot_observed_at":"2026-08-06T02:28:16.120028Z","submitted_at":"2023-09-29T07:17:43Z","title":"HoloAssist: an Egocentric Human Interaction Dataset for Interactive AI Assistants in the Real World","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17024","snapshot_observed_at":"2026-07-12T12:21:16.963000Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02542","last_updated":"2026-06-24T00:25:44Z","snapshot_observed_at":"2026-08-06T14:11:26.812383Z","submitted_at":"2026-06-24T00:25:44Z","title":"iFLYTEK-Embodied-Omni Technical Report","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-12T12:21:16.963000Z"},"links":{"cited_paper":"/paper/2309.17024","citing_paper":"/paper/2607.02542"},"observation_digest":"sha256:19ade134de1877d1aa9421fb3b663af1ea72025075bf2296a846488802abf05d","observation_id":"5f31ccf9-690a-42bb-b9c5-3aeb01586ed4","resolution":{"observed_at":"2026-07-12T12:21:16.963000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-07-06T19:49:34.518432Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08380","snapshot_observed_at":"2026-07-12T12:21:16.963000Z","title":"Egovid-5m: A large-scale video-action dataset for egocentric video generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02542","last_updated":"2026-06-24T00:25:44Z","snapshot_observed_at":"2026-08-06T14:11:26.812383Z","submitted_at":"2026-06-24T00:25:44Z","title":"iFLYTEK-Embodied-Omni Technical Report","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-12T12:21:16.963000Z"},"links":{"cited_paper":"/paper/2411.08380","citing_paper":"/paper/2607.02542"},"observation_digest":"sha256:e4664db2686c473be878c96a91276e3e95deb1c919269b9a8c35c9be31a94eb2","observation_id":"58d28c96-4fad-4bb4-b6a7-adabeebe6cf0","resolution":{"observed_at":"2026-07-12T12:21:16.963000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T12:21:16.963000Z","title":"Robomind: Benchmark on multi-embodiment intelligence normative data for robot manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02542","last_updated":"2026-06-24T00:25:44Z","snapshot_observed_at":"2026-08-06T14:11:26.812383Z","submitted_at":"2026-06-24T00:25:44Z","title":"iFLYTEK-Embodied-Omni Technical Report","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-12T12:21:16.963000Z"},"links":{"citing_paper":"/paper/2607.02542"},"observation_digest":"sha256:6027a4120ecb73899a8bdc9bf2555faf50422917604d927e935d2ecaf6b1382b","observation_id":"71f87025-745a-40c4-8dde-d2c83b027f6a","resolution":{"observed_at":"2026-07-12T12:21:16.963000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15922","last_updated":"2026-02-17T15:04:02Z","snapshot_observed_at":"2026-08-09T12:54:21.149243Z","submitted_at":"2026-02-17T15:04:02Z","title":"World Action Models are Zero-shot Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.15922","snapshot_observed_at":"2026-07-12T12:21:16.963000Z","title":"World action models are zero-shot policies, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02542","last_updated":"2026-06-24T00:25:44Z","snapshot_observed_at":"2026-08-06T14:11:26.812383Z","submitted_at":"2026-06-24T00:25:44Z","title":"iFLYTEK-Embodied-Omni Technical Report","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-12T12:21:16.963000Z"},"links":{"cited_paper":"/paper/2602.15922","citing_paper":"/paper/2607.02542"},"observation_digest":"sha256:752398eb7cfbd55c09ec60ed49f9a2b217a1334e9d46d6e8c4da07cac461e1a4","observation_id":"fd842d59-456d-47d9-bb55-481209e1734b","resolution":{"observed_at":"2026-07-12T12:21:16.963000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.10274","last_updated":"2025-10-11T16:20:17Z","snapshot_observed_at":"2026-07-06T22:32:22.953630Z","submitted_at":"2025-10-11T16:20:17Z","title":"X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.10274","snapshot_observed_at":"2026-07-12T12:21:16.963000Z","title":"X-vla: Soft-prompted transformer as scalable cross-embodiment vision-language-action model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02542","last_updated":"2026-06-24T00:25:44Z","snapshot_observed_at":"2026-08-06T14:11:26.812383Z","submitted_at":"2026-06-24T00:25:44Z","title":"iFLYTEK-Embodied-Omni Technical Report","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-12T12:21:16.963000Z"},"links":{"cited_paper":"/paper/2510.10274","citing_paper":"/paper/2607.02542"},"observation_digest":"sha256:87c1b90d2c37ea7a9c0a3266c5d1879f1e6f4f439945c10627c265bda165788a","observation_id":"31913073-28ba-4317-a18e-79d21a51a8e6","resolution":{"observed_at":"2026-07-12T12:21:16.963000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T12:21:16.963000Z","title":"Unified world models: Coupling video and action diffusion for pretraining on large robotic datasets,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02542","last_updated":"2026-06-24T00:25:44Z","snapshot_observed_at":"2026-08-06T14:11:26.812383Z","submitted_at":"2026-06-24T00:25:44Z","title":"iFLYTEK-Embodied-Omni Technical Report","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-12T12:21:16.963000Z"},"links":{"citing_paper":"/paper/2607.02542"},"observation_digest":"sha256:bbd94cf2db28001f4be53ea028e51717300f855fce8837b94bc979c08526fad2","observation_id":"2b293a50-f39c-49c8-877b-25923b6e2216","resolution":{"observed_at":"2026-07-12T12:21:16.963000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02792","last_updated":"2025-05-23T00:47:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-03T17:38:59Z","title":"Unified World Models: Coupling Video and Action Diffusion for Pretraining on Large Robotic Datasets","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02792","snapshot_observed_at":"2026-07-12T12:21:16.963000Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02542","last_updated":"2026-06-24T00:25:44Z","snapshot_observed_at":"2026-08-06T14:11:26.812383Z","submitted_at":"2026-06-24T00:25:44Z","title":"iFLYTEK-Embodied-Omni Technical Report","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-12T12:21:16.963000Z"},"links":{"cited_paper":"/paper/2504.02792","citing_paper":"/paper/2607.02542"},"observation_digest":"sha256:d42d8e67e845ad6b1f83d7f0b08b9a3eba5f0ba60a2d76d855a0115eb7b4522d","observation_id":"e0571635-4ae9-42ea-b8ae-33494ae407e2","resolution":{"observed_at":"2026-07-12T12:21:16.963000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T12:21:16.963000Z","title":"Galaxea open-world dataset and g0 dual-system vla model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02542","last_updated":"2026-06-24T00:25:44Z","snapshot_observed_at":"2026-08-06T14:11:26.812383Z","submitted_at":"2026-06-24T00:25:44Z","title":"iFLYTEK-Embodied-Omni Technical Report","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-12T12:21:16.963000Z"},"links":{"citing_paper":"/paper/2607.02542"},"observation_digest":"sha256:066c509321c821b013dc230643c5fc56ba277ad682e903b23e16d3828531fce7","observation_id":"e4bed66e-fbe4-4d45-be31-037cbe0356ed","resolution":{"observed_at":"2026-07-12T12:21:16.963000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.02542","last_updated":"2026-06-24T00:25:44Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-06T14:11:26.812383Z","submitted_at":"2026-06-24T00:25:44Z","title":"iFLYTEK-Embodied-Omni Technical Report"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 0 inbound Pith citation observations for arXiv:2607.02542."}