{"as_of":"2026-08-21T15:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b1d2a0bb3a0dbc10d6abeba4b8e381afa0935b2a11195dc68fd42c0bf589134d","coverage":[{"denominator":152,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T21:18:34.990563Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.06756/citation-record","integrity":"/paper/2608.06756/integrity","json":"/paper/2608.06756/citation-record.json","paper":"/paper/2608.06756"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:32.427180Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:32.427180Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:f05387db5a31db9c1fcfce4910ae1ab1f5dfb25d31a2fab4a7fbbed963248d9d","observation_id":"86fa4e9e-bea2-4d0e-bafb-9151c55c7ede","resolution":{"observed_at":"2026-08-10T21:18:32.427180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:32.508527Z","title":"Flamingo: a visual language model for few-shot learning.Advances in Neural Information Processing Systems (NeurIPS), 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:32.508527Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:0b9c53fa8d3343e4aba3a97dc6b5d58902c1ad73827c238552425321a43b7dfa","observation_id":"1b686d8d-8975-4482-80e0-a87d317f2e8d","resolution":{"observed_at":"2026-08-10T21:18:32.508527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:32.550014Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:32.550014Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:2c89c1b2dcc26665207bdea7534611cd0ccc075005410fcbc80eb102e1c879b3","observation_id":"9558b71e-665b-4a39-81e4-c7be360f62ec","resolution":{"observed_at":"2026-08-10T21:18:32.550014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:32.555035Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:32.555035Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:393314dc7e0e0ad55b4b0b0f8a43e12696e91ea4fe360e9b4f465151783b84b8","observation_id":"dd610574-b780-475c-8b93-737ddcbab4ae","resolution":{"observed_at":"2026-08-10T21:18:32.555035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:32.560003Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:32.560003Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:38a06f23af12bbe99e205ffcc4ecd7acef76cbd5c48b4bb2055b8bf3789936f3","observation_id":"a1ce5d4f-fff2-4c7f-9659-dbf2835af667","resolution":{"observed_at":"2026-08-10T21:18:32.560003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-10T21:18:32.564957Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:32.564957Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:a72b48f008145401b5d3a4a67e98087024c42945ad1f9a4cc4d26d546495bcff","observation_id":"8c9e1efe-c2f4-413e-8834-fd4ec95c0b55","resolution":{"observed_at":"2026-08-10T21:18:32.564957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-10T21:18:32.571389Z","title":"Qwen2.5-vl technical report.arXiv preprint arXiv:2502.13923, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:32.571389Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:f8cf4eaa568d287e5176508da6efdf398365cff43ce687950e75a36cdc8ddae1","observation_id":"03b4107f-aab0-430a-a07c-e806c9b72ab6","resolution":{"observed_at":"2026-08-10T21:18:32.571389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-08-18T11:44:22.813405Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-10T21:18:32.575729Z","title":"Do as i can, not as i say: Grounding language in robotic affordances.arXiv preprint arXiv:2204.01691, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:32.575729Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:132d78a6a3781dc19813388177c41e7af5a518b6f7f1e1b422aef20742247225","observation_id":"ef7ecffc-478c-4a73-9003-862bf182fa39","resolution":{"observed_at":"2026-08-10T21:18:32.575729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-14T18:47:26.721223Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-10T21:18:32.628607Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:32.628607Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:7e8f6c19bf475c2801e450e0eaac037113270029e2b020072bacb4894af6bf81","observation_id":"6128c3a3-393b-43dd-afa6-abb521a80b06","resolution":{"observed_at":"2026-08-10T21:18:32.628607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07753","last_updated":"2023-05-25T03:50:11Z","snapshot_observed_at":"2026-08-21T12:10:42.882805Z","submitted_at":"2022-09-16T07:17:23Z","title":"Code as Policies: Language Model Programs for Embodied Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.07753","snapshot_observed_at":"2026-08-10T21:18:32.705999Z","title":"Code as policies: Language model programs for embodied control.arXiv preprint arXiv:2209.07753, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:32.705999Z"},"links":{"cited_paper":"/paper/2209.07753","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:692bb44aeef58b6589efddcad27b13fa1b5c773680e9746ded9ff2d6ba5014e6","observation_id":"0aefddd6-7be9-4181-b512-9e4dea5b8264","resolution":{"observed_at":"2026-08-10T21:18:32.705999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05973","last_updated":"2023-11-02T06:53:37Z","snapshot_observed_at":"2026-08-05T01:03:23.456778Z","submitted_at":"2023-07-12T07:40:48Z","title":"VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05973","snapshot_observed_at":"2026-08-10T21:18:32.752781Z","title":"V oxposer: Composable 3d value maps for robotic manipulation with language models.arXiv preprint arXiv:2307.05973, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:32.752781Z"},"links":{"cited_paper":"/paper/2307.05973","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:d4f9e18ab9d54cb3cd5bf84462ff3442e8a91dd6e2660fd83595aa33c8b87931","observation_id":"cc13936a-121e-42ec-afe3-48b8ee51cafa","resolution":{"observed_at":"2026-08-10T21:18:32.752781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20020","last_updated":"2025-03-25T19:02:56Z","snapshot_observed_at":"2026-08-13T04:40:33.458745Z","submitted_at":"2025-03-25T19:02:56Z","title":"Gemini Robotics: Bringing AI into the Physical World","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20020","snapshot_observed_at":"2026-08-10T21:18:32.841005Z","title":"Gemini robotics: Bringing ai into the physical world.arXiv preprint arXiv:2503.20020, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:32.841005Z"},"links":{"cited_paper":"/paper/2503.20020","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:fd0d04cf38a7292ee4c2ad68ec635116d9c9cd880ee7f306c9311e98eda174f3","observation_id":"13aa88af-1dcc-432a-9a86-1f8f00e72e8d","resolution":{"observed_at":"2026-08-10T21:18:32.841005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-08-16T13:42:40.054113Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-10T21:18:32.953272Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics.arXiv preprint arXiv:2406.10721, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:32.953272Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:a8beb891e1d9eff589f1fc9d6abdf0b96b25024efa5ec600deb0044a39a52dce","observation_id":"6bb8a24e-72ac-4260-b6c5-6e26a666a9a2","resolution":{"observed_at":"2026-08-10T21:18:32.953272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21257","last_updated":"2025-03-25T05:46:03Z","snapshot_observed_at":"2026-08-20T16:21:51.679872Z","submitted_at":"2025-02-28T17:30:39Z","title":"RoboBrain: A Unified Brain Model for Robotic Manipulation from Abstract to Concrete","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.21257","snapshot_observed_at":"2026-08-10T21:18:32.957799Z","title":"Robobrain: A unified brain model for robotic manipulation from abstract to concrete.arXiv preprint arXiv:2502.21257, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:32.957799Z"},"links":{"cited_paper":"/paper/2502.21257","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:c3260fbfac64b72dd769260cc5c7fa3abc75f92b12986f066ef680f9fb5f0480","observation_id":"5666ebd1-4296-40d0-b628-97027be56e0f","resolution":{"observed_at":"2026-08-10T21:18:32.957799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:32.962774Z","title":"Robobrain 2.5: Depth in sight, time in mind.arXiv preprint arXiv:2601.14352, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:32.962774Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:793a4bfe146500b6fc5ad7ec12696fbc1e4fffcae9bf8549637dc0f8e01bec79","observation_id":"d8e06185-f056-48cb-acf6-b044c6e7f7cd","resolution":{"observed_at":"2026-08-10T21:18:32.962774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:32.966568Z","title":"Rynnbrain: Open embodied foundation models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:32.966568Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:d7cbee168334c70915800def0c5f336934b0ed1195d4ac6d4c1af62d8cb264f4","observation_id":"6dbc5041-6eaf-442d-9b12-5593da0039ea","resolution":{"observed_at":"2026-08-10T21:18:32.966568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.12894","last_updated":"2026-07-14T15:34:17Z","snapshot_observed_at":"2026-08-17T20:53:30.992043Z","submitted_at":"2026-07-14T15:34:17Z","title":"Hy-Embodied-VLM-1.0: Efficient Physical-World Agents","version":1},"cited_work":{"arxiv_id":"2607.12894","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.12894","snapshot_observed_at":"2026-08-10T21:18:37.603457Z","title":"Hy-Embodied-VLM-1.0: Efficient Physical-World Agents","venue":"cs.CV","work_id":"174fa6d8-b995-4b30-a16c-3b5ecdb3d850","year":2026},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:32.978898Z"},"links":{"cited_paper":"/paper/2607.12894","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:85e94c4d6ec9f8d64bcc8881483e6c06df0a6ab8a2cc71d6fafb667b1529655b","observation_id":"162a4f34-dbd6-4735-a7cb-c240bb768c4b","resolution":{"observed_at":"2026-08-10T21:18:37.637598Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-08-10T21:18:32.991114Z","title":"Cosmos 3: Omnimodal world models for physical ai.arXiv preprint arXiv:2606.02800, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:32.991114Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:1103c0b46060953e758db3e764a7d7c52801f9bf6def35182f0baae8d8eed583","observation_id":"f8b0690c-20b7-4e47-9f58-65448b0824d2","resolution":{"observed_at":"2026-08-10T21:18:32.991114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16518","last_updated":"2026-04-28T11:37:12Z","snapshot_observed_at":"2026-08-13T19:00:10.952463Z","submitted_at":"2025-11-20T16:34:55Z","title":"MiMo-Embodied: X-Embodied Foundation Model Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.16518","snapshot_observed_at":"2026-08-10T21:18:33.096528Z","title":"Mimo-embodied: X-embodied foundation model technical report.arXiv preprint arXiv:2511.16518, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:33.096528Z"},"links":{"cited_paper":"/paper/2511.16518","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:14fab161ee57ae68ce7b8482f29e95267f534060c496381325c7acb85fe5a257","observation_id":"144621a8-978e-4ce9-85a6-2f52b3fead21","resolution":{"observed_at":"2026-08-10T21:18:33.096528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.11324","last_updated":"2026-07-11T14:44:40Z","snapshot_observed_at":"2026-07-16T23:17:53.174457Z","submitted_at":"2026-06-09T18:07:50Z","title":"Embodied-R1.5: Evolving Physical Intelligence via Embodied Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.11324","snapshot_observed_at":"2026-08-10T21:18:33.155569Z","title":"Embodied-r1.5: Evolving physical intelligence via embodied foundation models.arXiv preprint arXiv:2606.11324, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:33.155569Z"},"links":{"cited_paper":"/paper/2606.11324","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:735dab1ee0cd1d0c81bd5f979145b568283e86c98ba25472b61adbca97b3b199","observation_id":"e1a0f103-d737-4b61-a4bb-243c9b4052bf","resolution":{"observed_at":"2026-08-10T21:18:33.155569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.20905","last_updated":"2026-06-18T20:01:32Z","snapshot_observed_at":"2026-08-03T03:13:19.923134Z","submitted_at":"2026-06-18T20:01:32Z","title":"Vesta: A Generalist Embodied Reasoning Model","version":1},"cited_work":{"arxiv_id":"2606.20905","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.20905","snapshot_observed_at":"2026-08-10T21:18:37.535755Z","title":"Vesta: A Generalist Embodied Reasoning Model","venue":"cs.RO","work_id":"debd2259-e710-4e43-8787-dd72fba6b99e","year":2026},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:33.160307Z"},"links":{"cited_paper":"/paper/2606.20905","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:8fc0961449f99479aa7e9a1558f762463df053c44ba4a0259ac5b702af30cb2a","observation_id":"f05fbe3c-af8b-4870-84d2-0542e86cb1fb","resolution":{"observed_at":"2026-08-10T21:18:37.541187Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-19T16:11:35.903833Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"cited_work":{"arxiv_id":"2607.04426","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.04426","snapshot_observed_at":"2026-08-10T21:18:37.447702Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","venue":"cs.RO","work_id":"74fc0c93-7d14-47fa-bcfe-8f9b93234ce8","year":2026},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:33.164594Z"},"links":{"cited_paper":"/paper/2607.04426","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:1e7247155ea8660278efbdd017bfbf7a36b14178eed2c4dfb78d0f22ffb6d0c6","observation_id":"7f6474f4-f9c4-455f-9091-189374bf72e2","resolution":{"observed_at":"2026-08-10T21:18:37.517943Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-08-17T21:22:10.233179Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-10T21:18:33.169445Z","title":"Embodiedbench: Comprehensive benchmarking multi-modal large language models for vision-driven embodied agents.arXiv preprint arXiv:2502.09560, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:33.169445Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:a074cab549a13230b0a289260d576eaa238029fbb97d30facb74efd57d42c98c","observation_id":"92858ee1-ad6a-492e-9752-bfa56571f301","resolution":{"observed_at":"2026-08-10T21:18:33.169445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:33.249748Z","title":"Towards embodied agentic ai: Review and classification of llm-and vlm-driven robot autonomy and interaction.arXiv preprint arXiv:2508.05294, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:33.249748Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:54c142690836b2ba0d26f8c315fe48ca4157c46c84bdbe507ec6a35b11c71749","observation_id":"c68e0c8e-7b94-4b0c-97be-348dbf7ff35e","resolution":{"observed_at":"2026-08-10T21:18:33.249748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:33.279788Z","title":"Behavior-1k: A benchmark for embodied ai with 1,000 everyday activities and realistic simulation.Conference on Robot Learning (CoRL), 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:33.279788Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:bb31b932cda9fabb1cf1181e189cac93b63b6a72bbaf4f6c535fc3007adf7bb7","observation_id":"33640b2c-5173-4717-a65f-a80b96a4e93f","resolution":{"observed_at":"2026-08-10T21:18:33.279788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.30406","last_updated":"2026-06-29T14:51:28Z","snapshot_observed_at":"2026-08-10T09:37:40.339025Z","submitted_at":"2026-06-29T14:51:28Z","title":"MOPD: Multi-Teacher On-Policy Distillation for Capability Integration in LLM Post-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.30406","snapshot_observed_at":"2026-08-10T21:18:33.285071Z","title":"Mopd: Multi-teacher on-policy distillation for capability integration in llm post-training.arXiv preprint arXiv:2606.30406, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:33.285071Z"},"links":{"cited_paper":"/paper/2606.30406","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:00117981987195ddb8a7d826fdcadcd1776d8d62098d485a9ec5853b734fffb9","observation_id":"d089a960-b2e9-4632-bf07-7fa6250fedd9","resolution":{"observed_at":"2026-08-10T21:18:33.285071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:33.332402Z","title":"To mix or to merge: Toward multi-domain reinforcement learning for large language models.arXiv preprint arXiv:2602.12566, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:33.332402Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:0c67c57aeae9ffb2bdd89c0ea08bff7ac838e51d8dbf8c197795b673b811148f","observation_id":"fdf9a712-d270-4e65-9028-fbeea8192e53","resolution":{"observed_at":"2026-08-10T21:18:33.332402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01708","last_updated":"2023-10-27T01:09:31Z","snapshot_observed_at":"2026-08-16T20:27:57.883150Z","submitted_at":"2023-06-02T17:31:32Z","title":"TIES-Merging: Resolving Interference When Merging Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01708","snapshot_observed_at":"2026-08-10T21:18:33.474080Z","title":"Ties-merging: Resolving interference when merging models.arXiv preprint arXiv:2306.01708, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:33.474080Z"},"links":{"cited_paper":"/paper/2306.01708","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:7dc8ebe6f52d971f7d915d125e1f5abe174ef7b14e1a4cde77d367ec1351924c","observation_id":"d008e851-84b8-4f50-9a8f-ce16372ed5d0","resolution":{"observed_at":"2026-08-10T21:18:33.474080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:33.478764Z","title":"Qwen3.6-35B-A3B: Agentic coding power, now open to all, April 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:33.478764Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:a1173a96ff3a6d263778c3efb8e1f0cfbad3899fdca876e9e3622742fcc79eab","observation_id":"91755aff-dbcc-4616-982a-abbdcaf6c7fe","resolution":{"observed_at":"2026-08-10T21:18:33.478764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:33.484070Z","title":"Qwen3.5: Towards native multimodal agents, February 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:33.484070Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:a26fe837a0731804b7f919741f94a979e40ea2786c6a4528444d8440823dc408","observation_id":"c92e48b1-89bd-47a5-9d7d-306aaa57feb6","resolution":{"observed_at":"2026-08-10T21:18:33.484070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.08747","last_updated":"2026-05-14T03:36:04Z","snapshot_observed_at":"2026-08-13T13:13:57.621409Z","submitted_at":"2026-05-09T07:24:07Z","title":"Done, But Not Sure: Disentangling World Completion from Self-Termination in Embodied Agents","version":3},"cited_work":{"arxiv_id":"2605.08747","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.08747","snapshot_observed_at":"2026-08-10T21:18:37.147117Z","title":"Done, But Not Sure: Disentangling World Completion from Self-Termination in Embodied Agents","venue":"cs.AI","work_id":"3b75c89a-117d-4dbf-87e0-93bb2390f9d9","year":2026},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:33.489323Z"},"links":{"cited_paper":"/paper/2605.08747","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:1dc1f3ae70959f5bb17d66056b8d48e81d588b224f35d5d2aba11a7df8af1133","observation_id":"4b70de19-d3b2-4d1b-a254-93af939ef572","resolution":{"observed_at":"2026-08-10T21:18:37.153623Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:33.493556Z","title":"Spatial intelligence in vision-language models: A comprehensive survey","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:33.493556Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:a573c878a85127060c808c9e5b300794af1f3111dfc54a5822ca2d595cce91ce","observation_id":"49450709-1715-47a5-92fb-5aa070fb0f64","resolution":{"observed_at":"2026-08-10T21:18:33.493556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:33.595378Z","title":"Scaling spatial intelligence with multimodal foundation models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:33.595378Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:84e41ca73a6169b419af79d19644782662308494d44690e8f43736329393a19b","observation_id":"ac357ebb-62a5-4f01-a8bc-6f133836dfbb","resolution":{"observed_at":"2026-08-10T21:18:33.595378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:33.681742Z","title":"Gupta, Rilyn Han, Li Fei-Fei, and Saining Xie","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:33.681742Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:05e0eef3fa028b983f34074d79ec33751be392a8a8fe84e431802a91514dd3f8","observation_id":"0e8ac789-c608-44cd-9679-15df91d82e69","resolution":{"observed_at":"2026-08-10T21:18:33.681742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:33.686415Z","title":"Mindcube: Spatial mental modeling from limited views.arXiv preprint arXiv:2506.21458, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:33.686415Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:f8216272307fb61078beaa1357348850151514b76064deb47857a87a785ef235","observation_id":"48f5a9d4-5ba1-46ac-9242-143276a5bb77","resolution":{"observed_at":"2026-08-10T21:18:33.686415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05756","last_updated":"2024-06-09T12:23:14Z","snapshot_observed_at":"2026-08-18T13:29:44.835199Z","submitted_at":"2024-06-09T12:23:14Z","title":"EmbSpatial-Bench: Benchmarking Spatial Understanding for Embodied Tasks with Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05756","snapshot_observed_at":"2026-08-10T21:18:33.691153Z","title":"Embspatial-bench: Benchmarking spatial understanding for embodied tasks with large vision-language models.arXiv preprint arXiv:2406.05756, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:33.691153Z"},"links":{"cited_paper":"/paper/2406.05756","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:9bd9e349d316e2726677a6cd0cd82e5a2bae329f54a9c6937ec6634ca2397615","observation_id":"ed101fe9-12c4-4e51-9dc3-2a8c2c769b54","resolution":{"observed_at":"2026-08-10T21:18:33.691153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01442","last_updated":"2020-03-08T00:09:07Z","snapshot_observed_at":"2026-07-06T08:26:38.349660Z","submitted_at":"2019-10-03T13:16:36Z","title":"CLEVRER: CoLlision Events for Video REpresentation and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01442","snapshot_observed_at":"2026-08-10T21:18:33.697230Z","title":"Clevrer: Collision events for video representation and reasoning.arXiv preprint arXiv:1910.01442, 2019","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:33.697230Z"},"links":{"cited_paper":"/paper/1910.01442","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:d75ad8dc1d860c41446d21e8ae82e5a8136f74641840a1e2fe461f854277a684","observation_id":"15588c70-3e8d-42c5-b43b-e8105dab5da8","resolution":{"observed_at":"2026-08-10T21:18:33.697230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:33.742687Z","title":"Next-qa: Next phase of question- answering to explaining temporal actions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:33.742687Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:6fe5632d203051de9319e87b9aaaafbde7ea9bf71f38cfa3d2a6e42c604590b2","observation_id":"52943f18-0a9c-492e-a782-7b40631aba5b","resolution":{"observed_at":"2026-08-10T21:18:33.742687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:33.806130Z","title":"Perception test: A diagnostic benchmark for multimodal video models.Advances in Neural Information Processing Systems, 36: 42748–42761, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:33.806130Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:ad64d32637dcf74b8d65dcb02068ba42a945ffd3d7bdc362090e0350dd8d0566","observation_id":"7e34d14b-8972-44f2-8160-102057ebd74e","resolution":{"observed_at":"2026-08-10T21:18:33.806130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-16T21:19:34.047707Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-10T21:18:33.811024Z","title":"Star: A benchmark for situated reasoning in real-world videos.arXiv preprint arXiv:2405.09711, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:33.811024Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:9d25e792e50248bbe1bb34b02726fe5fe3e29c24facb6472c600eb8c1f7d7855","observation_id":"21664cc2-0118-4b40-a07f-dec0158dd4de","resolution":{"observed_at":"2026-08-10T21:18:33.811024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-19T14:11:01.412437Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-10T21:18:33.815978Z","title":"Llava-video: Video instruction tuning with synthetic data.arXiv preprint arXiv:2410.02713, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:33.815978Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:f811eb248cce4e6ae74844bf1aec49e8acb724e4b8d7e97ef148334ab86f040a","observation_id":"50b4cbe8-816b-4771-bd03-26e64f07a985","resolution":{"observed_at":"2026-08-10T21:18:33.815978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:33.820656Z","title":"Scaling rl to long videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:33.820656Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:82ad94f68e637c7728428b5b80c1c8f2ded9cb42252cad03fd22e93dfc31fa79","observation_id":"9a915b03-7cc8-4b4c-9167-2d8e39b2fad8","resolution":{"observed_at":"2026-08-10T21:18:33.820656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:33.963434Z","title":"Sigurdsson, Gul Varol, Xiaolong Wang, Ali Farhadi, Ivan Laptev, and Abhinav Gupta","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:33.963434Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:83f72090daab26d120c102224de0a5c2ca1c1593439437ef6b7ae744c100c18b","observation_id":"83b37b98-f0f9-4a27-b8fc-3630fc025293","resolution":{"observed_at":"2026-08-10T21:18:33.963434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:33.967117Z","title":"Localizing moments in video with natural language","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:33.967117Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:5d8a7b69d100d01a669bd93033f2ed39de52e1f1f85a86fc729c79bccb9a19a2","observation_id":"2092ae7e-27ce-46de-8f73-cfb520dd1326","resolution":{"observed_at":"2026-08-10T21:18:33.967117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:34.035589Z","title":"Hierarchical video-moment retrieval and step-captioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.035589Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:6f9339430f60da016cae8e9b9db1ae0f24be38d2a808a7f7c9feb49090f7cbcb","observation_id":"e239d02d-f01f-4552-8eea-1acabe332c49","resolution":{"observed_at":"2026-08-10T21:18:34.035589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:34.097731Z","title":"Queryd: A video dataset with high-quality text and audio narrations","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.097731Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:4ac448672b2a3108ae6531c622f51b68cea8afca4c6122b7efca2276ec6b7a90","observation_id":"eee2537f-48ac-4f0c-a942-aee7a7f2a935","resolution":{"observed_at":"2026-08-10T21:18:34.097731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08282","last_updated":"2025-06-01T17:32:19Z","snapshot_observed_at":"2026-08-18T08:40:40.305799Z","submitted_at":"2025-01-14T17:58:12Z","title":"LLaVA-ST: A Multimodal Large Language Model for Fine-Grained Spatial-Temporal Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08282","snapshot_observed_at":"2026-08-10T21:18:34.103487Z","title":"Llava-st: A multimodal large language model for fine- grained spatial-temporal understanding.arXiv preprint arXiv:2501.08282, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.103487Z"},"links":{"cited_paper":"/paper/2501.08282","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:56844bbc4d0f3327cf9588ec34bca6cc0f71d77af47e9d83d19cf7a82c68ee1b","observation_id":"4a3cba58-04d7-4264-a127-c786019291ed","resolution":{"observed_at":"2026-08-10T21:18:34.103487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-10T21:18:34.108407Z","title":"Sharegpt4video: Improving video understanding and generation with better captions.arXiv preprint arXiv:2406.04325, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.108407Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:fd8a139a897e44fd941cf7c0bce269bbc106a942a2728876a19544b38d487e8f","observation_id":"581d0e6d-922b-493d-957d-1ec240bfe891","resolution":{"observed_at":"2026-08-10T21:18:34.108407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:34.141816Z","title":"Videoespresso: A large-scale chain-of-thought dataset for fine-grained video reasoning via core frame selection","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.141816Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:1175e7010990ccfa8afd72676ca30a28afef2ee7df9b4094376b132c65199693","observation_id":"a9271ed1-8430-4575-b124-4d6abe3a7614","resolution":{"observed_at":"2026-08-10T21:18:34.141816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15558","last_updated":"2025-05-19T17:59:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-18T22:06:58Z","title":"Cosmos-Reason1: From Physical Common Sense To Embodied Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15558","snapshot_observed_at":"2026-08-10T21:18:34.146624Z","title":"Cosmos-reason1: From physical common sense to embodied reasoning.arXiv preprint arXiv:2503.15558, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.146624Z"},"links":{"cited_paper":"/paper/2503.15558","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:c44b7f5fd4384b6bbecfa593f01dc519539eb599dad6440c2953ed8f105df777","observation_id":"5134f1df-a2ad-4d25-a522-232b9379943d","resolution":{"observed_at":"2026-08-10T21:18:34.146624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-10T21:18:34.152165Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art vision-language models.arXiv preprint arXiv:2409.17146, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.152165Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:7730cd76aed111105f3189178188f747332e4401f341111205f4a0b7f4e22ee5","observation_id":"c77499d7-845c-43eb-8b61-5b6eb9cc16a7","resolution":{"observed_at":"2026-08-10T21:18:34.152165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12945","last_updated":"2025-04-22T17:57:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-19T17:48:38Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12945","snapshot_observed_at":"2026-08-10T21:18:34.157336Z","title":"Droid: A large-scale in-the-wild robot manipulation dataset.arXiv preprint arXiv:2403.12945, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.157336Z"},"links":{"cited_paper":"/paper/2403.12945","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:4bfd7d3352728f72cfc78179fc0b1f1d42096140824501e95ed193a3cb19c53d","observation_id":"a475d797-c9c9-496f-be8d-66ef66f0f527","resolution":{"observed_at":"2026-08-10T21:18:34.157336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06669","last_updated":"2025-08-04T04:50:21Z","snapshot_observed_at":"2026-08-16T04:42:52.370966Z","submitted_at":"2025-03-09T15:40:29Z","title":"AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06669","snapshot_observed_at":"2026-08-10T21:18:34.161372Z","title":"Agibot world colosseo: A large-scale ma- nipulation platform for scalable and intelligent embodied systems.arXiv preprint arXiv:2503.06669, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.161372Z"},"links":{"cited_paper":"/paper/2503.06669","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:db87766c6acefec5ed9474fbb502353e471bdc48d8cd2b395449dba9917afda4","observation_id":"d7cec257-041a-42a8-b470-45aa21c02dc3","resolution":{"observed_at":"2026-08-10T21:18:34.161372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:34.165396Z","title":"Robomind 2.0: A multimodal, bimanual mobile manipulation dataset for generalizable embodied intelligence.arXiv preprint arXiv:2512.24653, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.165396Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:7e8aaf6063a7f5a804cf53fc009c11979caf54a1ce6785aac09104bdee8bd052","observation_id":"7685dd33-d366-4b69-aa92-7fa57addc942","resolution":{"observed_at":"2026-08-10T21:18:34.165396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08548","last_updated":"2026-04-05T00:57:47Z","snapshot_observed_at":"2026-07-06T21:23:14.666121Z","submitted_at":"2025-05-13T13:20:46Z","title":"From Seeing to Doing: Bridging Reasoning and Decision for Robotic Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.08548","snapshot_observed_at":"2026-08-10T21:18:34.169970Z","title":"From seeing to doing: Bridging reasoning and decision for robotic manipulation.arXiv preprint arXiv:2505.08548, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.169970Z"},"links":{"cited_paper":"/paper/2505.08548","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:e1a275c8086c5cf85c6c7581b7512ce35a047401e6455749f6f4cbe0eafe2e4e","observation_id":"cfeac7ad-05ee-473a-ba1f-c75afb3ad17e","resolution":{"observed_at":"2026-08-10T21:18:34.169970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00899","last_updated":"2023-11-01T23:40:07Z","snapshot_observed_at":"2026-08-16T14:46:42.725649Z","submitted_at":"2023-11-01T23:40:07Z","title":"RoboVQA: Multimodal Long-Horizon Reasoning for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.00899","snapshot_observed_at":"2026-08-10T21:18:34.174958Z","title":"Robovqa: Multimodal long-horizon reasoning for robotics.arXiv preprint arXiv:2311.00899, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.174958Z"},"links":{"cited_paper":"/paper/2311.00899","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:759c0034114830dc279bf6cac4d77f17c63af4cd444fc4a4cab000884aacfe70","observation_id":"ea4dbfdc-93a9-4a2e-a591-a17284b2caad","resolution":{"observed_at":"2026-08-10T21:18:34.174958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-16T11:58:05.128366Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15517","snapshot_observed_at":"2026-08-10T21:18:34.179159Z","title":"Sanketi, and Ken Goldberg","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.179159Z"},"links":{"cited_paper":"/paper/2505.15517","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:448c97dffb4730c5890b4b417d448cb22df7c2e042a1530c476403594bff9f73","observation_id":"2b0413ca-47bc-4422-a25a-fed4ca82253d","resolution":{"observed_at":"2026-08-10T21:18:34.179159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:34.269327Z","title":"Roboafford++: A generative ai-enhanced dataset for multimodal affordance learning in robotic manipulation and navigation.arXiv preprint arXiv:2511.12436, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.269327Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:2f4ccf83faec572ac7ef300a215eae8aae9eccb327b009bd3a77876a1cb27efb","observation_id":"28ab7762-b38e-4f95-b268-f111e381a36c","resolution":{"observed_at":"2026-08-10T21:18:34.269327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:34.348952Z","title":"From flatland to space: Teaching vision-language models to perceive and reason in 3d.arXiv preprint arXiv:2503.22976, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.348952Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:e04e3e9c23ed63428b5cfbe8a59047c591aca3bded4d75a3db84dd7e21b5f235","observation_id":"ae3bc33e-e223-41ac-bcf5-b6e32a498d83","resolution":{"observed_at":"2026-08-10T21:18:34.348952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.03043","last_updated":"2026-04-28T12:07:36Z","snapshot_observed_at":"2026-08-13T15:37:47.305433Z","submitted_at":"2025-12-02T18:59:52Z","title":"OneThinker: All-in-one Reasoning Model for Image and Video","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.03043","snapshot_observed_at":"2026-08-10T21:18:34.360274Z","title":"Onethinker: All-in-one reasoning model for image and video.arXiv preprint arXiv:2512.03043, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.360274Z"},"links":{"cited_paper":"/paper/2512.03043","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:f7fc236703912f9fff77838a1b1219b4d779893866432fd9539878b965e4ae65","observation_id":"2ac471f3-3385-4990-b3f4-0f97783f9428","resolution":{"observed_at":"2026-08-10T21:18:34.360274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-10T21:18:34.364746Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.364746Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:7f3eae1516721756219b9d9da33c3474db1df367a41cf1aa34e54b5163daa04e","observation_id":"7c7f7a20-bed4-4527-abc6-eecd1df2401c","resolution":{"observed_at":"2026-08-10T21:18:34.364746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-10T21:18:34.371034Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.371034Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:001c93cb6d854ae3d98948e62fa6d952d69f56bf3cd92a141b43f138f55da755","observation_id":"c7902afc-23c1-4703-971f-b8c6c196d616","resolution":{"observed_at":"2026-08-10T21:18:34.371034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:34.375958Z","title":"Thinking with visual primitives.Technical report, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.375958Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:0ee969020e38537113218e8904ded2a90d5cdc1c8b72d73c3a4c851f52caf8d1","observation_id":"da04dddd-e6f9-4246-83c3-73792ffe8c6d","resolution":{"observed_at":"2026-08-10T21:18:34.375958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13998","last_updated":"2026-04-06T03:29:44Z","snapshot_observed_at":"2026-08-15T03:41:08.751572Z","submitted_at":"2025-08-19T16:50:01Z","title":"Embodied-R1: Reinforced Embodied Reasoning for General Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.13998","snapshot_observed_at":"2026-08-10T21:18:34.422610Z","title":"Embodied-r1: Reinforced embodied reasoning for general robotic manipulation.arXiv preprint arXiv:2508.13998, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.422610Z"},"links":{"cited_paper":"/paper/2508.13998","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:1d99b48d70050bd8eb6851596509eb395bfb2a5bb4dee9516c436bc0082ae575","observation_id":"16b43f36-a6d6-4399-b2f8-b37f383835c5","resolution":{"observed_at":"2026-08-10T21:18:34.422610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:34.467999Z","title":"Computing discrete fréchet distance","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.467999Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:79ef2c383b30dc9259ad6829c9cf869af70d76cd242814004867722d048b5ed8","observation_id":"c0505013-0f33-46c6-9863-ed86be8aca6b","resolution":{"observed_at":"2026-08-10T21:18:34.467999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:34.519320Z","title":"Editing models with task arithmetic","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.519320Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:d32a72d4baa95749d0ae341c7015826ca65fcdd50b1b9a77c9fe53089a09d515","observation_id":"66a70d7f-1737-4421-a885-58eda448e264","resolution":{"observed_at":"2026-08-10T21:18:34.519320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13649","last_updated":"2024-01-17T03:23:23Z","snapshot_observed_at":"2026-08-16T15:21:35.471994Z","submitted_at":"2023-06-23T17:56:26Z","title":"On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13649","snapshot_observed_at":"2026-08-10T21:18:34.522970Z","title":"On-policy distillation of language models: Learning from self-generated mistakes.arXiv preprint arXiv:2306.13649, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.522970Z"},"links":{"cited_paper":"/paper/2306.13649","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:871de019fe9719a59cdf2407d0e4863cac814d8631822ecb898475e3dda78ab4","observation_id":"b3e6ddeb-108c-43ba-8aaa-8f31591712ce","resolution":{"observed_at":"2026-08-10T21:18:34.522970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:34.527373Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.527373Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:b97afc7858156001b04b1f9712eca998c9e6103723386bcf5fa3bfad59761da8","observation_id":"9240bcc3-d422-4ac5-b089-cfa9a1000620","resolution":{"observed_at":"2026-08-10T21:18:34.527373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:34.531761Z","title":"Omnispatial: Towards comprehensive spatial reasoning benchmark for vision language models.arXiv preprint arXiv:2506.03135, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.531761Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:78bdd8dad248557e9c696838e0d69b6fb8bbc869916d5cee85cd409c9f05ee63","observation_id":"c2b34af9-5341-4fc5-b015-cbd3944e1baa","resolution":{"observed_at":"2026-08-10T21:18:34.531761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:34.535818Z","title":"Robospatial: Teaching spatial understanding to 2d and 3d vision-language models for robotics.arXiv preprint arXiv:2411.16537, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.535818Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:d25776b393a463d1041fd362c7ea0e5fa1c3181006514e88b369ce3ac67d1867","observation_id":"95287c8b-3854-4d03-bffc-13c3dcd6c0b9","resolution":{"observed_at":"2026-08-10T21:18:34.535818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15280","last_updated":"2025-04-27T00:11:00Z","snapshot_observed_at":"2026-08-17T01:59:32.260988Z","submitted_at":"2025-04-21T17:59:53Z","title":"Seeing from Another Perspective: Evaluating Multi-View Understanding in MLLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15280","snapshot_observed_at":"2026-08-10T21:18:34.554776Z","title":"Seeing from another perspective: Evaluating multi-view understanding in mllms.arXiv preprint arXiv:2504.15280, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.554776Z"},"links":{"cited_paper":"/paper/2504.15280","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:0cc31ccdf431cea7e50a38af7e8c3622087feb8d2eb81c1eae3596914ad11895","observation_id":"919792d0-af6c-420c-908a-63c095ce76b0","resolution":{"observed_at":"2026-08-10T21:18:34.554776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:34.579247Z","title":"Openeqa: Embodied question answering in the era of foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.579247Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:4e08e5c24bec1e9b1926551087a1991bdcea1bce36f2d93129650def28ffbaae","observation_id":"398ecf40-eb65-45f4-905d-5072113e88ba","resolution":{"observed_at":"2026-08-10T21:18:34.579247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:34.626969Z","title":"Omnia de egotempo: Benchmarking temporal understanding of multi-modal llms in egocentric videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.626969Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:9c906aa135e73f2349f4179c2e771315e55942aac1b3ed3bd22f21169141845f","observation_id":"4fd7c8d5-a0d7-4fa5-90c2-3f5c95f42a2b","resolution":{"observed_at":"2026-08-10T21:18:34.626969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:34.631324Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.631324Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:0a98443f24bd4ed7886d62e63ce9980cde8d3dbe05198a3a03cc0e271bf01c30","observation_id":"8322d1ec-0c1b-41f0-9e61-bb31e74c71f9","resolution":{"observed_at":"2026-08-10T21:18:34.631324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17005","last_updated":"2024-05-23T14:49:29Z","snapshot_observed_at":"2026-08-14T11:10:08.135537Z","submitted_at":"2023-11-28T17:59:04Z","title":"MVBench: A Comprehensive Multi-modal Video Understanding Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17005","snapshot_observed_at":"2026-08-10T21:18:34.635521Z","title":"Mvbench: A comprehensive multi-modal video under- standing benchmark.arXiv preprint arXiv:2311.17005, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.635521Z"},"links":{"cited_paper":"/paper/2311.17005","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:308e16759bc3874a337b2b517664ff1cc5a7596bfaf1a2eef4035223619bd6d6","observation_id":"bd18a110-790c-4eee-bddb-ff6638e71253","resolution":{"observed_at":"2026-08-10T21:18:34.635521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15754","last_updated":"2024-07-22T16:00:55Z","snapshot_observed_at":"2026-08-15T01:28:11.776642Z","submitted_at":"2024-07-22T16:00:55Z","title":"LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15754","snapshot_observed_at":"2026-08-10T21:18:34.640153Z","title":"Longvideobench: A benchmark for long-context interleaved video-language understanding.arXiv preprint arXiv:2407.15754, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.640153Z"},"links":{"cited_paper":"/paper/2407.15754","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:83e59df76d8f68c3eb49e63b8557fa279016328ccc200317256d53556ca7cedb","observation_id":"d88f57ac-3e11-4f7a-b937-26d411effd17","resolution":{"observed_at":"2026-08-10T21:18:34.640153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:34.644370Z","title":"Timelens: Rethinking video temporal grounding with multimodal llms.arXiv preprint arXiv:2512.14698, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.644370Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:171614d11617e594ea1c589145ed4d27f27386d3f9ea7c18ba2d2e382707defa","observation_id":"9b8217a6-8b99-4e16-b871-02f201571e3e","resolution":{"observed_at":"2026-08-10T21:18:34.644370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00640","last_updated":"2023-08-01T16:13:35Z","snapshot_observed_at":"2026-08-16T15:11:34.056819Z","submitted_at":"2023-08-01T16:13:35Z","title":"VL-Grasp: a 6-Dof Interactive Grasp Policy for Language-Oriented Objects in Cluttered Indoor Scenes","version":1},"cited_work":{"arxiv_id":"2308.00640","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.00640","snapshot_observed_at":"2026-08-10T21:18:36.222695Z","title":"VL-Grasp: a 6-Dof Interactive Grasp Policy for Language-Oriented Objects in Cluttered Indoor Scenes","venue":"cs.RO","work_id":"ab7fb05f-4e1c-41d7-8ea7-ae334fd0ac96","year":2023},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.648497Z"},"links":{"cited_paper":"/paper/2308.00640","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:0059efafec7a59f3b0f3ff556366791971698af82fb32023dfb070429fd6ed5b","observation_id":"40616467-1d5b-42e1-ad5a-19fd41f99973","resolution":{"observed_at":"2026-08-10T21:18:36.252207Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.03342","last_updated":"2025-11-28T18:57:04Z","snapshot_observed_at":"2026-07-06T22:31:40.462674Z","submitted_at":"2025-10-02T14:32:45Z","title":"Gemini Robotics 1.5: Pushing the Frontier of Generalist Robots with Advanced Embodied Reasoning, Thinking, and Motion Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.03342","snapshot_observed_at":"2026-08-10T21:18:34.676111Z","title":"Gemini robotics 1.5: Pushing the frontier of generalist robots with advanced embodied reasoning, thinking, and motion transfer.arXiv preprint arXiv:2510.03342, 2025","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.676111Z"},"links":{"cited_paper":"/paper/2510.03342","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:7bdf128a2e6223c07fd48adaf5fac16d09c116ccf0b4b23be7c5a507a5c1b68f","observation_id":"4f568cba-cfae-46ec-905e-d54e13e39fab","resolution":{"observed_at":"2026-08-10T21:18:34.676111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:34.719268Z","title":"Point-it-out: Benchmarking embodied reasoning for vision language models in multi-stage visual grounding.arXiv preprint arXiv:2509.25794, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.719268Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:f47bb29f8225f9234f5fcb937ab34403d3b80d7029ff24720663bce636f7d6a8","observation_id":"27cbe886-8340-4e8e-af68-7b37eaf1ebf1","resolution":{"observed_at":"2026-08-10T21:18:34.719268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:34.744188Z","title":"Navitrace: Evaluating embodied navigation of vision- language models.arXiv preprint arXiv:2510.26909, 2025","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.744188Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:03d272ef7549c893c4f4bc839903afb8a50d1b303b1d2071ad937186b14f1a69","observation_id":"71d4f895-b6d9-4a10-bc89-7c27ae3ce6bb","resolution":{"observed_at":"2026-08-10T21:18:34.744188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:34.749228Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.749228Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:6daab9e486f21b39fa9bc9508a373025c5fe08d5a3f3d2070abf301215ff96b6","observation_id":"d7558b24-56da-4a40-869e-fc62c065f7c0","resolution":{"observed_at":"2026-08-10T21:18:34.749228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-21T04:07:07.949331Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-10T21:18:34.753811Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities.arXiv preprint arXiv:2308.02490, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.753811Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:d96474782f10de70b72a727d6aa7873319b14409844c5f70560f49f39c08988c","observation_id":"c5273e05-751c-4c42-bcde-3cca43a00d34","resolution":{"observed_at":"2026-08-10T21:18:34.753811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:34.758326Z","title":"Grok-1.5 vision preview and realworldqa","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.758326Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:a11ceeb3813a8dc4f5ab7152196e3c2cc0d0bfae040f3028b9a3e42deaed1ac3","observation_id":"ca55d428-8b33-4f4a-b722-7ec2ef0e057e","resolution":{"observed_at":"2026-08-10T21:18:34.758326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-08-17T03:48:18.599994Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-10T21:18:34.762841Z","title":"Mmbench: Is your multi-modal model an all-around player?arXiv preprint arXiv:2307.06281, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.762841Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:969ae89213335cf8defb95390dff372d9e20511766fc4644d6f2fe6ea4b422b0","observation_id":"4e99aed2-a855-4603-85e5-e2604a61e274","resolution":{"observed_at":"2026-08-10T21:18:34.762841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-10T21:18:34.767697Z","title":"Instruction-following evaluation for large language models.arXiv preprint arXiv:2311.07911, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.767697Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:561363d32f130f81b1f3273747a426984306f4edc83db3a27cee1b15535d2a85","observation_id":"7f21dbfd-f9ab-4a8e-b851-747d9f020d6c","resolution":{"observed_at":"2026-08-10T21:18:34.767697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:34.773055Z","title":"MMLU-Pro: A more robust and challenging multi-task language understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.773055Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:7eccc2b535737418957ede7df97e3f69b8129becdfe3b4a2012562bed59d6038","observation_id":"0d32e7c7-a8aa-43a4-967e-aa660d459f69","resolution":{"observed_at":"2026-08-10T21:18:34.773055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:34.777235Z","title":"Patil, Huanzhi Mao, Charlie Cheng-Jie Ji, Fanjia Yan, Vishnu Suresh, Ion Stoica, and Joseph E","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.777235Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:ff422765e94cc5b0b680b1635b2896a7abce2686bd4b365ec52435bdb974601e","observation_id":"085afeb7-cc38-4aa6-89b7-a271d3b69cc2","resolution":{"observed_at":"2026-08-10T21:18:34.777235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-08-16T07:05:57.323612Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-10T21:18:34.781389Z","title":"LiveCodeBench: Holistic and contamination-free evaluation of large language models for code.arXiv preprint arXiv:2403.07974, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.781389Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:812c79d098bafe92ce31c7ecbf96cbbcb372647bca5eaecd96cb193a6f251dd4","observation_id":"4fc0a1cc-53b9-41f7-be0a-3015c08d04e7","resolution":{"observed_at":"2026-08-10T21:18:34.781389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.17574","last_updated":"2026-06-16T06:22:09Z","snapshot_observed_at":"2026-08-12T16:11:34.463219Z","submitted_at":"2026-06-16T06:22:09Z","title":"DeepInsight: A Unified Evaluation Infrastructure Across the Physical AI Stack","version":1},"cited_work":{"arxiv_id":"2606.17574","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.17574","snapshot_observed_at":"2026-08-10T21:18:35.953424Z","title":"DeepInsight: A Unified Evaluation Infrastructure Across the Physical AI Stack","venue":"cs.AI","work_id":"71a91e62-fe02-4d4f-8622-46ff6ab1ad80","year":2026},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.803552Z"},"links":{"cited_paper":"/paper/2606.17574","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:5c7ee55541d9b7260aa4c5d1cb21845bfa2f2d3f1aec24316cd8b20e64d58aa1","observation_id":"8f25946d-13b1-45f8-bec8-487fea92ac0d","resolution":{"observed_at":"2026-08-10T21:18:35.961548Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-17T13:26:10.378579Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-10T21:18:34.858442Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.858442Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:264e6faf098a29e620bf45017afeadb9b24f9aae518b88de1b114be5cea2adb8","observation_id":"75ba6374-2fd7-4256-900b-3abf96f374ab","resolution":{"observed_at":"2026-08-10T21:18:34.858442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.05474","last_updated":"2022-08-26T17:12:17Z","snapshot_observed_at":"2026-08-14T05:42:22.751765Z","submitted_at":"2017-12-14T23:17:24Z","title":"AI2-THOR: An Interactive 3D Environment for Visual AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.05474","snapshot_observed_at":"2026-08-10T21:18:34.918689Z","title":"Ai2-thor: An interactive 3d environment for visual ai.arXiv preprint arXiv:1712.05474, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.918689Z"},"links":{"cited_paper":"/paper/1712.05474","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:f241813da75e45dd85d229c24da76aa0503412af1266de065a51a81f9b3ba30b","observation_id":"40d43281-44b5-4d7c-9c6e-d0f7b39db8b8","resolution":{"observed_at":"2026-08-10T21:18:34.918689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:34.954091Z","title":"Procthor: Large-scale embodied ai using procedural generation.Advances in Neural Information Processing Systems (NeurIPS), 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.954091Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:23e99d0f20b425c0f789652d8cd7ac0f435b66fe558177005e51241a34bcdd74","observation_id":"3a4aafdf-5e88-4e14-be9a-8312c51e3e0f","resolution":{"observed_at":"2026-08-10T21:18:34.954091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-10T21:18:34.958615Z","title":"Hybridflow: A flexible and efficient rlhf framework.arXiv preprint arXiv: 2409.19256, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.958615Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:b785ea287781aa4d6ef96c1b0cb1ba6d5adc32b7ab9d29cd464443c47e0f1561","observation_id":"245f033b-dc99-4955-b21a-bbbd6393cd3a","resolution":{"observed_at":"2026-08-10T21:18:34.958615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-10T21:18:34.963819Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.963819Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:1107693694c0f1e015a71aeef773ea7b72c9c2da545ad39f0f5cf12610ed4872","observation_id":"143c72bf-dc07-436f-8035-c98e13d32153","resolution":{"observed_at":"2026-08-10T21:18:34.963819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:34.969726Z","title":"bbox_2d\": [x1, y1, x2, y2],","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.969726Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:bc958d1cc58af7d33c8fed5d2ba4a6e06a18e7ad76867d277fea38eb869b8a82","observation_id":"20da74c3-02f5-482f-a03e-a66a0670e512","resolution":{"observed_at":"2026-08-10T21:18:34.969726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:34.976635Z","title":"The left hand is holding a green lighter","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.976635Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:ca1dabac85cb1420b3a13ce6990d049e05d4d9672558373e1971a1dfb7b1eb72","observation_id":"6d543b52-9bfc-4277-9c69-ab14ab36e936","resolution":{"observed_at":"2026-08-10T21:18:34.976635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:34.981728Z","title":"The top of the lighter is now glowing red/orange, indicating it’s hot or just used, but crucially, there is no flame coming out of it","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.981728Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:0c236225b84025df0847cefd26a0111a24d68431a12c3a5628d992f0aadc3dc2","observation_id":"8531c9ee-2c0b-4f8a-97d7-3d689f2ad37c","resolution":{"observed_at":"2026-08-10T21:18:34.981728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:34.985997Z","title":"Based on observations, is the lighter on or off?","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.985997Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:32ff824ac46ab87c39a6b12fc446549e9e9faf37363fc77b8690d72842394b92","observation_id":"39cffba3-a8fb-4858-ae55-44c03298c32e","resolution":{"observed_at":"2026-08-10T21:18:34.985997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:34.990563Z","title":"* The club sandwich must be inside the packing box","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.990563Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:568681a0892d930ca7de9f1433ce64e80cb65dcf33ae6f8abc4823c41f449542","observation_id":"e5b9aa84-f903-4067-a1e5-8c134fc50d35","resolution":{"observed_at":"2026-08-10T21:18:34.990563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-18T02:50:27.071007Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":94,"verified_exact":6,"verified_fuzzy":0},"total_outbound_references":152},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 100 of 152 outbound references and 0 inbound Pith citation observations for arXiv:2608.06756."}