{"as_of":"2026-08-10T12:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a90186b91f335e6a8c419b46b49850d382c5d1753e6475a433f1140ff41ac705","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:51:05.564651Z","state":"measured"},{"denominator":75,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":75,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T20:08:36.570832Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T03:29:30.514537Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.16211","snapshot_observed_at":"2026-08-06T14:05:28.900178Z","title":"Controlvla: Few-shot object-centric adap- tation for pre-trained vision-language-action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.19817","last_updated":"2025-07-26T06:18:15Z","snapshot_observed_at":"2026-08-09T06:14:13.393441Z","submitted_at":"2025-07-26T06:18:15Z","title":"Ag2x2: Robust Agent-Agnostic Visual Representations for Zero-Shot Bimanual Manipulation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T14:05:28.900178Z"},"links":{"cited_paper":"/paper/2506.16211","citing_paper":"/paper/2507.19817"},"observation_digest":"sha256:2d45999323a2c491bcc4aef9816981de8c213962c07738ff5cb4266b0a007790","observation_id":"d33b1b39-c1fc-4205-be93-e74a269e4339","resolution":{"observed_at":"2026-08-06T14:05:28.900178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.16211","snapshot_observed_at":"2026-08-04T10:43:40.991161Z","title":"Controlvla: Few-shot object-centric adap- tation for pre-trained vision-language-action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09036","last_updated":"2026-06-24T10:18:59Z","snapshot_observed_at":"2026-08-06T06:48:09.190707Z","submitted_at":"2025-10-10T06:15:42Z","title":"RoDyn: Taming Interactive Robot-Dynamic 2.5D World Model for Robotic Manipulation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T10:43:40.991161Z"},"links":{"cited_paper":"/paper/2506.16211","citing_paper":"/paper/2510.09036"},"observation_digest":"sha256:7588feb1d804163caf3ec5a58b19b15beda17cc37049a13c1ab18a275458e586","observation_id":"fff67d24-b737-4cff-8fe2-ff062d4198d9","resolution":{"observed_at":"2026-08-04T10:43:40.991161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.16211","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.16211","snapshot_observed_at":"2026-07-04T03:29:30.514537Z","title":"Controlvla: Few-shot object-centric adap- tation for pre-trained vision-language-action models","venue":null,"work_id":"92b04a32-ea80-430b-a101-29f1986509cf","year":2025},"citing_paper":{"arxiv_id":"2511.06754","last_updated":"2026-05-06T07:00:01Z","snapshot_observed_at":"2026-07-29T01:21:11.279990Z","submitted_at":"2025-11-10T06:33:44Z","title":"SlotVLA: Towards Modeling of Object-Relation Representations in Robotic Manipulation","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-18T00:22:41.611893Z"},"links":{"cited_paper":"/paper/2506.16211","citing_paper":"/paper/2511.06754"},"observation_digest":"sha256:9ce0e87dcbb631d714b0985efeb9648a7950440480c33b37054e94484d81fb72","observation_id":"028fdbbe-87a4-4252-9064-713e605b5d95","resolution":{"observed_at":"2026-05-18T00:25:32.979738Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.16211","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.16211","snapshot_observed_at":"2026-07-04T03:29:30.514537Z","title":"Controlvla: Few-shot object-centric adap- tation for pre-trained vision-language-action models","venue":null,"work_id":"92b04a32-ea80-430b-a101-29f1986509cf","year":2025},"citing_paper":{"arxiv_id":"2604.05484","last_updated":"2026-04-07T06:24:41Z","snapshot_observed_at":"2026-07-06T22:54:12.531121Z","submitted_at":"2026-04-07T06:24:41Z","title":"CoEnv: Driving Embodied Multi-Agent Collaboration via Compositional Environment","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:12.286456Z"},"links":{"cited_paper":"/paper/2506.16211","citing_paper":"/paper/2604.05484"},"observation_digest":"sha256:2ef71e29588bfe110e577d8721c429c6e964d0e49d2133c33e0cda83152da5be","observation_id":"8fc455d9-e6c7-44c4-8e69-2d599f1370b6","resolution":{"observed_at":"2026-05-10T22:55:52.618248Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.16211","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.16211","snapshot_observed_at":"2026-07-04T03:29:30.514537Z","title":"Controlvla: Few-shot object-centric adap- tation for pre-trained vision-language-action models","venue":null,"work_id":"92b04a32-ea80-430b-a101-29f1986509cf","year":2025},"citing_paper":{"arxiv_id":"2604.17876","last_updated":"2026-04-20T06:38:01Z","snapshot_observed_at":"2026-07-06T23:04:50.935335Z","submitted_at":"2026-04-20T06:38:01Z","title":"OFlow: Injecting Object-Aware Temporal Flow Matching for Robust Robotic Manipulation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T04:50:33.134927Z"},"links":{"cited_paper":"/paper/2506.16211","citing_paper":"/paper/2604.17876"},"observation_digest":"sha256:b1e6fe1499224827836d5e6175320aedc9fb2a7a956ce3e10bc08b1b6857134f","observation_id":"b58a1dcb-a01d-4e5f-a51f-6b8a8fc1da92","resolution":{"observed_at":"2026-05-10T11:35:19.021480Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.16211","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.16211","snapshot_observed_at":"2026-07-04T03:29:30.514537Z","title":"Controlvla: Few-shot object-centric adap- tation for pre-trained vision-language-action models","venue":null,"work_id":"92b04a32-ea80-430b-a101-29f1986509cf","year":2025},"citing_paper":{"arxiv_id":"2604.23121","last_updated":"2026-04-25T03:18:07Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T03:18:07Z","title":"Breaking Lock-In: Preserving Steerability under Low-Data VLA Post-Training","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T08:07:47.793895Z"},"links":{"cited_paper":"/paper/2506.16211","citing_paper":"/paper/2604.23121"},"observation_digest":"sha256:1d0e0157e65af133ef2f2f367721cafe56950516a1b1eaadc0468a2fd9f879b1","observation_id":"c4febba7-8387-4ccb-bdd3-5d0ebb6ffe1f","resolution":{"observed_at":"2026-05-11T20:46:11.595737Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.16211","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.16211","snapshot_observed_at":"2026-07-04T03:29:30.514537Z","title":"Controlvla: Few-shot object-centric adap- tation for pre-trained vision-language-action models","venue":null,"work_id":"92b04a32-ea80-430b-a101-29f1986509cf","year":2025},"citing_paper":{"arxiv_id":"2605.12236","last_updated":"2026-05-12T15:07:04Z","snapshot_observed_at":"2026-08-03T01:51:28.024049Z","submitted_at":"2026-05-12T15:07:04Z","title":"TMRL: Diffusion Timestep-Modulated Pretraining Enables Exploration for Efficient Policy Finetuning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-13T04:22:07.953637Z"},"links":{"cited_paper":"/paper/2506.16211","citing_paper":"/paper/2605.12236"},"observation_digest":"sha256:aab3a5e05e8a79f8251ea883fe3adc8b7e83c92ae725ef8b8ff69105b6ba37fe","observation_id":"5813eb5c-32b6-470d-a900-9fd4888a5281","resolution":{"observed_at":"2026-05-13T04:22:14.583427Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.16211","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.16211","snapshot_observed_at":"2026-07-04T03:29:30.514537Z","title":"Controlvla: Few-shot object-centric adap- tation for pre-trained vision-language-action models","venue":null,"work_id":"92b04a32-ea80-430b-a101-29f1986509cf","year":2025},"citing_paper":{"arxiv_id":"2605.30484","last_updated":"2026-05-28T19:03:30Z","snapshot_observed_at":"2026-08-02T15:34:13.108251Z","submitted_at":"2026-05-28T19:03:30Z","title":"ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T06:57:41.245418Z"},"links":{"cited_paper":"/paper/2506.16211","citing_paper":"/paper/2605.30484"},"observation_digest":"sha256:4b12e5fab7d01541666a55caf5f2248646bc6076057a2a6587fc0524b90407af","observation_id":"ed470334-f0ba-422c-922a-939f8f57033f","resolution":{"observed_at":"2026-06-29T07:23:13.455458Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.16211","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.16211","snapshot_observed_at":"2026-07-04T03:29:30.514537Z","title":"Controlvla: Few-shot object-centric adap- tation for pre-trained vision-language-action models","venue":null,"work_id":"92b04a32-ea80-430b-a101-29f1986509cf","year":2025},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"cited_paper":"/paper/2506.16211","citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:805572dc03a4404036f52b6e70e4e7a2fc21388ad250fb43a957fd55b50b56df","observation_id":"27e3a5be-f2fb-4e2c-aae8-907fc7f80c20","resolution":{"observed_at":"2026-07-03T14:48:32.825517Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.16211","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.16211","snapshot_observed_at":"2026-07-04T03:29:30.514537Z","title":"Controlvla: Few-shot object-centric adap- tation for pre-trained vision-language-action models","venue":null,"work_id":"92b04a32-ea80-430b-a101-29f1986509cf","year":2025},"citing_paper":{"arxiv_id":"2606.14752","last_updated":"2026-06-28T06:47:31Z","snapshot_observed_at":"2026-08-05T17:35:14.456940Z","submitted_at":"2026-06-07T09:39:39Z","title":"X-Tokenizer: A Multimodal Action Tokenizer for Vision-Language-Action Pretraining","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T11:23:36.941801Z"},"links":{"cited_paper":"/paper/2506.16211","citing_paper":"/paper/2606.14752"},"observation_digest":"sha256:374d0a478abd2106664d7d78efd88e45161bddfd40c90bfeb31a5f1f3ac724e5","observation_id":"19db67d5-ffa5-443a-90d6-5beb6bb7b0f7","resolution":{"observed_at":"2026-06-30T11:24:37.882421Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.16211","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.16211","snapshot_observed_at":"2026-07-04T03:29:30.514537Z","title":"Controlvla: Few-shot object-centric adap- tation for pre-trained vision-language-action models","venue":null,"work_id":"92b04a32-ea80-430b-a101-29f1986509cf","year":2025},"citing_paper":{"arxiv_id":"2606.20867","last_updated":"2026-06-18T18:54:51Z","snapshot_observed_at":"2026-08-03T13:52:03.831619Z","submitted_at":"2026-06-18T18:54:51Z","title":"FOCA: Future-Oriented Conditioning for Data-Efficient Vision-Language-Action Adaptation","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-06-26T18:01:08.616612Z"},"links":{"cited_paper":"/paper/2506.16211","citing_paper":"/paper/2606.20867"},"observation_digest":"sha256:4d573f5ad69be0ae6553bf02ba043534ca88a9ddcb410f552ec172b35c081d6c","observation_id":"b2fab49c-65e1-4a40-94a3-3accfa9d07fb","resolution":{"observed_at":"2026-07-04T03:29:30.517227Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.16211","snapshot_observed_at":"2026-08-07T20:08:36.570832Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05970","last_updated":"2026-08-06T12:46:13Z","snapshot_observed_at":"2026-08-10T08:49:37.576101Z","submitted_at":"2026-08-06T12:46:13Z","title":"SkillMemo: Expert-guided Skill Memory Framework for Compositional Embodied Manipulation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T20:08:36.570832Z"},"links":{"cited_paper":"/paper/2506.16211","citing_paper":"/paper/2608.05970"},"observation_digest":"sha256:8bbc84e9aeb35d34d2204294bbaebde04ba64df9ec65f23c0b0918212f3ed4db","observation_id":"49371b32-4dc8-43cc-a7d5-2b9dd8e113be","resolution":{"observed_at":"2026-08-07T20:08:36.570832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.16211/citation-record","integrity":"/paper/2506.16211/integrity","json":"/paper/2506.16211/citation-record.json","paper":"/paper/2506.16211"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.02117","last_updated":"2024-01-04T07:55:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-04T07:55:53Z","title":"Mobile ALOHA: Learning Bimanual Mobile Manipulation with Low-Cost Whole-Body Teleoperation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02117","snapshot_observed_at":"2026-08-06T23:51:04.845336Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:04.845336Z"},"links":{"cited_paper":"/paper/2401.02117","citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:1618e23d0b5c44f6d00b045de47ac45278d081b7c81339385bddb5e7edcf702e","observation_id":"53acf680-4cd6-42a3-9738-8f482421420f","resolution":{"observed_at":"2026-08-06T23:51:04.845336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:06.409166Z","title":null,"venue":null,"work_id":"84afb696-45d0-47ce-8f05-aeb766cb96f0","year":2024},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:04.971311Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:0651decfacb7f88caac41be30128b45af8d884255039f77a5ddc88ee9b2d3379","observation_id":"24b6b7d9-3775-4067-854b-24b403a0edea","resolution":{"observed_at":"2026-08-06T23:51:06.413572Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07864","last_updated":"2025-03-01T08:57:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-10T12:33:46Z","title":"RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07864","snapshot_observed_at":"2026-08-06T23:51:05.020892Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.020892Z"},"links":{"cited_paper":"/paper/2410.07864","citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:4c50ffccde88847382487b572bcee828bc13e4f8ed356e1604f34089cd9f593d","observation_id":"3743e857-a31c-4f6b-9dbd-c97790271b1d","resolution":{"observed_at":"2026-08-06T23:51:05.020892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:06.393799Z","title":null,"venue":null,"work_id":"f9f2a6a8-62ae-43d4-b3be-72e5eb86bf53","year":2023},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.148613Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:09aaf79036426b8aa0e2311147e915e95b959d03dd21bd9d1ab3aa3ef393f739","observation_id":"10ec7206-8122-40ec-aca1-ab548f5291da","resolution":{"observed_at":"2026-08-06T23:51:06.398694Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18369","last_updated":"2025-06-22T01:43:26Z","snapshot_observed_at":"2026-07-06T19:58:00.412286Z","submitted_at":"2024-11-27T14:17:43Z","title":"G3Flow: Generative 3D Semantic Flow for Pose-aware and Generalizable Object Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18369","snapshot_observed_at":"2026-08-06T23:51:05.241297Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.241297Z"},"links":{"cited_paper":"/paper/2411.18369","citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:8b5120e92764be11489cc16f8cee009a33319fbb7b0a149903ee40e312151558","observation_id":"6709822b-3d59-42e6-a973-a5af90811532","resolution":{"observed_at":"2026-08-06T23:51:05.241297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:06.379691Z","title":null,"venue":null,"work_id":"2ddbb965-bedf-410e-863a-bc2556e18ebf","year":2024},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.305317Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:038c3116f45d6189c3a13246957c6e7d249b6201496bd0fc0ee867f42ec5e9a0","observation_id":"aa23ab53-82a4-434d-8ab1-a3de0f8373d6","resolution":{"observed_at":"2026-08-06T23:51:06.384171Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00965","last_updated":"2025-05-13T19:03:52Z","snapshot_observed_at":"2026-08-09T12:44:47.925654Z","submitted_at":"2024-11-01T18:32:23Z","title":"SPOT: SE(3) Pose Trajectory Diffusion for Object-Centric Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00965","snapshot_observed_at":"2026-08-06T23:51:05.310332Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.310332Z"},"links":{"cited_paper":"/paper/2411.00965","citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:0c4dbc9f9ddf20896228d2893fbacdde518002de45053baad1eb841729bf3fba","observation_id":"f102da75-3367-41a3-bebf-4a1a35638799","resolution":{"observed_at":"2026-08-06T23:51:05.310332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10329","last_updated":"2024-03-06T00:11:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-15T21:11:50Z","title":"Universal Manipulation Interface: In-The-Wild Robot Teaching Without In-The-Wild Robots","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10329","snapshot_observed_at":"2026-08-06T23:51:05.315137Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.315137Z"},"links":{"cited_paper":"/paper/2402.10329","citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:2298312e7c602421f522fd4a758a0e3b2a8f2104fcbd2f5bcbe95620a316832d","observation_id":"b9edca07-ac70-4075-a75c-2eb00d38d7b1","resolution":{"observed_at":"2026-08-06T23:51:05.315137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:06.365540Z","title":null,"venue":null,"work_id":"db6c7585-97d3-4f18-ae20-4efa7cf53d02","year":2023},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.320125Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:9adee72950db31200a1beb0d2bbb4fbf15fa9846cd79fbf43a2b95fd3ceb4e91","observation_id":"12c2b4c4-c24b-4818-bc06-6557efe69113","resolution":{"observed_at":"2026-08-06T23:51:06.370196Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24185","last_updated":"2025-03-06T05:34:17Z","snapshot_observed_at":"2026-08-03T14:12:29.992356Z","submitted_at":"2024-10-31T17:48:45Z","title":"DexMimicGen: Automated Data Generation for Bimanual Dexterous Manipulation via Imitation Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24185","snapshot_observed_at":"2026-08-06T23:51:05.324527Z","title":"Jiang, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.324527Z"},"links":{"cited_paper":"/paper/2410.24185","citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:2a534e16ce7047b34eeb5744c0ef5288ff2938e89bb9ca4d1ac849db5ecc9759","observation_id":"fb141498-28bc-4ab8-8223-bd5e1e935b2a","resolution":{"observed_at":"2026-08-06T23:51:05.324527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-06T23:51:05.329116Z","title":"Brohan, N","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.329116Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:ad67d8ef0aee99e5a118f2f38cd157921f333441b96db19013c3bfb722840cb9","observation_id":"b67b89f6-dba4-4c1d-859a-a2eb8a8d0e91","resolution":{"observed_at":"2026-08-06T23:51:05.329116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:06.350480Z","title":null,"venue":null,"work_id":"741192f3-dfd5-411a-a615-08d23d47a007","year":2024},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.333582Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:dc202b06f8c8b494433d520d76a3e64972c4d6bc428347f16f078b870f3123c0","observation_id":"5434ca92-d28a-4d43-a5bf-a5ffb9011982","resolution":{"observed_at":"2026-08-06T23:51:06.355296Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:06.335990Z","title":null,"venue":null,"work_id":"8203fa29-f41c-49df-b99b-d0c7213414a9","year":2025},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.337888Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:c3a643e67547b1e6e3203781ef880ef571028cc2e00027d2c97de8b3c97f39aa","observation_id":"2920bfd2-698c-417d-b44f-3398e71fae21","resolution":{"observed_at":"2026-08-06T23:51:06.340945Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:06.321398Z","title":"Huang, S","venue":null,"work_id":"df94eefc-853d-4d35-a620-dab73627e217","year":2024},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.341678Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:461e0f6f2f5c9119c28803907784573e27e831aa8093f93e08a0d15534cb9ea3","observation_id":"0a42fde1-05fa-4965-9ab9-194ad301421d","resolution":{"observed_at":"2026-08-06T23:51:06.326178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:06.307188Z","title":null,"venue":null,"work_id":"70d643e2-ffeb-406a-9733-06334ffdf774","year":2023},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.345758Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:e89201eec30b4ccc75215f4d898558d485b7d888b508a1264a46061b884a0f4e","observation_id":"44ca8117-ffa3-4ba3-8b2f-4f61a5c76260","resolution":{"observed_at":"2026-08-06T23:51:06.311543Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:06.292839Z","title":null,"venue":null,"work_id":"d11eadfe-2f0f-4234-8fae-ca86af62c587","year":2024},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.349416Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:210743271b4579eb9438d2158219ae69d8f9b1fe787a2a223eed1ec0e685f4d8","observation_id":"e36abc5f-663f-4985-9208-3b9a1bc7c1bd","resolution":{"observed_at":"2026-08-06T23:51:06.297310Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03949","last_updated":"2024-11-24T02:02:33Z","snapshot_observed_at":"2026-08-09T09:28:00.163287Z","submitted_at":"2024-03-06T18:55:36Z","title":"Reconciling Reality through Simulation: A Real-to-Sim-to-Real Approach for Robust Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03949","snapshot_observed_at":"2026-08-06T23:51:05.353073Z","title":"Torne, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.353073Z"},"links":{"cited_paper":"/paper/2403.03949","citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:4966bf96f8ef9074f382458d172ba8fc4367db5bafcf38b9821c78bb62b3c012","observation_id":"6a6d9936-f27f-4121-9e17-6715b23cb50f","resolution":{"observed_at":"2026-08-06T23:51:05.353073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17596","last_updated":"2023-10-26T17:17:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-26T17:17:31Z","title":"MimicGen: A Data Generation System for Scalable Robot Learning using Human Demonstrations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17596","snapshot_observed_at":"2026-08-06T23:51:05.357203Z","title":"Mandlekar, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.357203Z"},"links":{"cited_paper":"/paper/2310.17596","citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:b99f0f9e4a25cea04e4a82960cc97a2004a35ff7f813cc86d004673f8e249f72","observation_id":"998ae332-334f-448f-b49c-6788db8aa696","resolution":{"observed_at":"2026-08-06T23:51:05.357203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02920","last_updated":"2025-04-16T17:31:39Z","snapshot_observed_at":"2026-08-10T06:35:10.397741Z","submitted_at":"2024-09-04T17:59:52Z","title":"RoboTwin: Dual-Arm Robot Benchmark with Generative Digital Twins (early version)","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02920","snapshot_observed_at":"2026-08-06T23:51:05.361677Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.361677Z"},"links":{"cited_paper":"/paper/2409.02920","citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:c7ddc828cbb27b4cfee594a7eb3731c8e24b0af94b9a348ab6a4b09b30f4c5b0","observation_id":"ffc1e156-24ae-42ec-920f-4664b4d2668e","resolution":{"observed_at":"2026-08-06T23:51:05.361677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:05.365914Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.365914Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:887e3ac6d5f00d31aedbf145f12b4eb38e90e06c77538d30cb7c06117a7a5e4e","observation_id":"ae9e3d4e-b8a2-4919-a1c5-79bbf547d64a","resolution":{"observed_at":"2026-08-06T23:51:05.365914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:05.370129Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.370129Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:2bfa968ea8f45d55fe881f9e9a24ec22cc1b6fa65dd0c554b589953c64ced208","observation_id":"71d98caf-432d-4063-afd0-bcbc680928d3","resolution":{"observed_at":"2026-08-06T23:51:05.370129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-06T23:51:05.373806Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.373806Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:e8dfdfc7bd5355fc965794ab387ed0a819b9320468b12772509e805bfa71012b","observation_id":"781c4e61-c402-41b0-8f99-a5c44169bc12","resolution":{"observed_at":"2026-08-06T23:51:05.373806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-06T23:51:05.377722Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.377722Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:d84794958f906b34a3ee31a916b79fa81bdc608d65a8afc359eac595092405f2","observation_id":"c6baf59e-1106-4231-aad2-8e8aeb2c6d45","resolution":{"observed_at":"2026-08-06T23:51:05.377722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-06T23:51:05.382153Z","title":"Brohan, N","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.382153Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:8093fbdf22a50d6c5148019f4ff0127e2dd4542ea8d34e7293acc840d000536a","observation_id":"6f9c26fd-89b7-4d39-851d-3702d09d5286","resolution":{"observed_at":"2026-08-06T23:51:05.382153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-08-08T01:53:43.555672Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08864","snapshot_observed_at":"2026-08-06T23:51:05.386011Z","title":"O’Neill, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.386011Z"},"links":{"cited_paper":"/paper/2310.08864","citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:119ac7b9d6dd83d0c338c74c0aa449c32999594397295df1c77d67578522f42a","observation_id":"2089d7f5-93ce-4dec-9f61-c58a2b0a3e7e","resolution":{"observed_at":"2026-08-06T23:51:05.386011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-06T23:51:05.390144Z","title":"Black, N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.390144Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:b806335c5f885bca740194b13c553113eda8bafe9102f78a9533607c2f42cec8","observation_id":"e4106095-b4d8-467f-8a49-324fed201f2e","resolution":{"observed_at":"2026-08-06T23:51:05.390144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:06.261885Z","title":null,"venue":null,"work_id":"7c6b0380-dcbc-4177-8f8e-e71b60a914ec","year":2023},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.394404Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:f1ecad07c9294f747829c9166d00ad9204728e22777c5b93236a8bdb32a702cd","observation_id":"a7eefe94-574b-4443-8831-d84e432eb660","resolution":{"observed_at":"2026-08-06T23:51:06.266276Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:05.398711Z","title":"Zhang, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.398711Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:8abdf67eb0657f7dd656bad438e9c239d9097045045e67a046abd58c796f6d9b","observation_id":"2776f220-336c-4073-b42a-25e4523a694b","resolution":{"observed_at":"2026-08-06T23:51:05.398711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05268","last_updated":"2024-12-06T18:55:09Z","snapshot_observed_at":"2026-07-06T20:02:57.733746Z","submitted_at":"2024-12-06T18:55:09Z","title":"DenseMatcher: Learning 3D Semantic Correspondence for Category-Level Manipulation from a Single Demo","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05268","snapshot_observed_at":"2026-08-06T23:51:05.402554Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.402554Z"},"links":{"cited_paper":"/paper/2412.05268","citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:053143cd8614c3a024d93cb12dd4921e3640d039297fa0feca30f55ee72bc051","observation_id":"31347ab5-89e4-4054-9245-a85a0314e0e4","resolution":{"observed_at":"2026-08-06T23:51:05.402554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.10790","last_updated":"2018-09-27T22:45:53Z","snapshot_observed_at":"2026-08-09T11:03:11.134683Z","submitted_at":"2018-09-27T22:45:53Z","title":"Deep Object Pose Estimation for Semantic Robotic Grasping of Household Objects","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.10790","snapshot_observed_at":"2026-08-06T23:51:05.406504Z","title":"Tremblay, T","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.406504Z"},"links":{"cited_paper":"/paper/1809.10790","citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:321478d5107e8644d7b5adacb7041e8894feb7f4355756fb1f6e9204048a17a8","observation_id":"57f1110b-73d2-4ee7-99aa-ea5662ce3d31","resolution":{"observed_at":"2026-08-06T23:51:05.406504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:06.240422Z","title":"Tyree, J","venue":null,"work_id":"87e9b363-b05a-4214-b9ea-e2382fbde71b","year":2022},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.410625Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:c0ee11971f3f30221d12c49183ed06608ae797927d3dad909148253a3661af2f","observation_id":"ab0881a8-66fa-4b01-8888-c298d62784f4","resolution":{"observed_at":"2026-08-06T23:51:06.244679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:05.414591Z","title":"Migimatsu and J","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.414591Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:1d20d34fbf04392a5827670d50e4440475e89037f62dda00d10ad3e04d2ae5b5","observation_id":"6027aae2-becb-4268-bb2f-2747a4bc7ac8","resolution":{"observed_at":"2026-08-06T23:51:05.414591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:06.217906Z","title":null,"venue":null,"work_id":"d357e99d-a47f-46d5-b6bb-73d09586baf9","year":2019},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.418384Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:a1f562b1ab2f5fab4bdabff5651affaf7a406c84e450cdcc076ddb64cfe017a5","observation_id":"69e1497f-f748-45fe-a3b9-700c6d65cb3c","resolution":{"observed_at":"2026-08-06T23:51:06.222540Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:06.204415Z","title":"Devin, P","venue":null,"work_id":"91c925a1-751e-47b7-a560-1c9948fefb55","year":2018},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.423236Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:62d8907f4e5708bf79132c64f2940b1c5a34c653979b3bb0fb8a751a128bb8a3","observation_id":"37e04de4-db34-4e8a-a077-eb8902a63ecb","resolution":{"observed_at":"2026-08-06T23:51:06.208714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:06.190325Z","title":"Locatello, D","venue":null,"work_id":"e2855232-6187-4552-aaa7-9952dad6ad52","year":2020},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.427977Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:743a07bce28ff86ab030a140eb1d043e5c8b30a4f5940f1b5d705932549573d1","observation_id":"6644594f-06b5-4192-9696-e405ca079be9","resolution":{"observed_at":"2026-08-06T23:51:06.194944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.11390","last_updated":"2019-01-22T18:55:34Z","snapshot_observed_at":"2026-07-06T07:30:18.170401Z","submitted_at":"2019-01-22T18:55:34Z","title":"MONet: Unsupervised Scene Decomposition and Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.11390","snapshot_observed_at":"2026-08-06T23:51:05.432378Z","title":null,"venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.432378Z"},"links":{"cited_paper":"/paper/1901.11390","citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:3de2f99ae7f86b64303f8ede19ad6e80d94c390ae46f973ac18b8ea168da3e53","observation_id":"11d0a78b-0401-4773-bed6-2bbd59e90b06","resolution":{"observed_at":"2026-08-06T23:51:05.432378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:06.176089Z","title":null,"venue":null,"work_id":"02ee5672-2ebf-4e30-914f-6b6a1ba32370","year":2021},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.437120Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:e35434442a30cc0e56cd09c73cf0f6479269468108a942c920ff103bad37c9f6","observation_id":"c012871e-e0af-44e4-895a-ac63d00c216a","resolution":{"observed_at":"2026-08-06T23:51:06.180647Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:06.162725Z","title":"Heravi, A","venue":null,"work_id":"6e2fc80b-4453-416e-b7ea-c3f9349dd9f0","year":null},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.441912Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:f41d5cda8fcabac9553c3c3f238c48702087207506c2cf14c1eb04ab900e90ba","observation_id":"7b2b6983-52c7-419e-bb41-46b3f5252e36","resolution":{"observed_at":"2026-08-06T23:51:06.166949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.09162","last_updated":"2024-08-17T10:37:07Z","snapshot_observed_at":"2026-08-03T11:40:17.551311Z","submitted_at":"2024-08-17T10:37:07Z","title":"Zero-Shot Object-Centric Representation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.09162","snapshot_observed_at":"2026-08-06T23:51:05.446892Z","title":"Didolkar, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.446892Z"},"links":{"cited_paper":"/paper/2408.09162","citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:73a3f418d2a789773c63a9b3a05b2c0446fe2d03881a3c11e3380c6ba80ca1f9","observation_id":"168b2c4f-2d25-4599-86bd-93423394dbd9","resolution":{"observed_at":"2026-08-06T23:51:05.446892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04419","last_updated":"2023-06-12T06:29:22Z","snapshot_observed_at":"2026-08-08T04:47:07.138332Z","submitted_at":"2023-02-09T03:11:21Z","title":"An Investigation into Pre-Training Object-Centric Representations for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.04419","snapshot_observed_at":"2026-08-06T23:51:05.452350Z","title":"Yoon, Y .-F","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.452350Z"},"links":{"cited_paper":"/paper/2302.04419","citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:cc71200a8ab172b0a0657888e121dbdca3c5bfdb9ec5a15c028df2c6f5c7a4ec","observation_id":"45466b54-eaf7-4a98-8d1b-44323e663ace","resolution":{"observed_at":"2026-08-06T23:51:05.452350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:06.146627Z","title":null,"venue":null,"work_id":"8dc40930-b3ac-4c09-9f4f-18d289d5206f","year":2023},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.457334Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:c70d6b13063ec0a3080d3a0c0a150fd67c377e061b81c05b6374bb704201c5c5","observation_id":"5ae50293-7817-4635-aab7-310d03f9b75f","resolution":{"observed_at":"2026-08-06T23:51:06.152241Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:06.131172Z","title":null,"venue":null,"work_id":"18c4408d-61d2-4374-8209-514ed2f0419e","year":2022},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.462541Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:ed8867ce8462e54e110f25be2d9eaec2c37e254b22ac8090a4ec24a4b76cdb26","observation_id":"1c96920f-812b-42e0-bed5-ede0ebce4e50","resolution":{"observed_at":"2026-08-06T23:51:06.135773Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:06.116981Z","title":"Stable diffusion v1.5 model card.https://huggingface.co/runwayml/ stable-diffusion-v1-5, 2022","venue":null,"work_id":"adb6c5cf-f2a1-403c-af30-4ee767073bde","year":2022},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.467010Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:78edb4644ef4a8d2fef57e4b4d925025b3fc613a5fb55df2a12d0b8d45cfda1e","observation_id":"9c1fbef4-b8ec-4ff8-882d-0f8b321c677c","resolution":{"observed_at":"2026-08-06T23:51:06.122138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:06.102411Z","title":null,"venue":null,"work_id":"5a5493fd-d3bc-433a-9709-c1c7b9a70f23","year":2024},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.471119Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:7458dca503116924048633eec817b42e7c531f6bd2a1634775626f6b03b76fc8","observation_id":"9d5454d4-9a24-4458-9b93-c7625e4d3ee2","resolution":{"observed_at":"2026-08-06T23:51:06.107327Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06573","last_updated":"2024-08-12T14:52:49Z","snapshot_observed_at":"2026-07-06T16:59:56.350207Z","submitted_at":"2023-12-11T17:58:06Z","title":"ControlNet-XS: Rethinking the Control of Text-to-Image Diffusion Models as Feedback-Control Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06573","snapshot_observed_at":"2026-08-06T23:51:05.475594Z","title":"Zavadski, J.-F","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.475594Z"},"links":{"cited_paper":"/paper/2312.06573","citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:cb6c3d422fac196c709b1df2c1c9ffaf04f1311e6c47f3a63794152a19b2a5c7","observation_id":"c1a03e2e-f18d-46e2-be08-e8a6d00adf5b","resolution":{"observed_at":"2026-08-06T23:51:05.475594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:06.088034Z","title":null,"venue":null,"work_id":"88e1b531-1533-41eb-aee4-ab20892cb741","year":2024},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.480005Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:04767a89d3488ee98f90bb8e09a955db6805dfe50759e0ea50b92fadc9a35e5b","observation_id":"6802722f-9f79-47f5-bd9f-89530512801f","resolution":{"observed_at":"2026-08-06T23:51:06.092961Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:06.072369Z","title":null,"venue":null,"work_id":"ee414252-3bbf-42b9-a991-0180a1ad73a0","year":2024},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.484539Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:2668d3c329db800eb639f1a51f789a97b0c7f2309b5b72839bb1f804c510f098","observation_id":"08c6105a-ee10-4731-8c6c-afa6600bf20b","resolution":{"observed_at":"2026-08-06T23:51:06.077473Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:05.488962Z","title":"Bar-Tal, H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.488962Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:270f9afe0d53b784254f561d5e3121affc74f3976313f0a9ee0c42cf1aa6ab8d","observation_id":"73232784-6260-411b-a695-60a0ac9a5d2d","resolution":{"observed_at":"2026-08-06T23:51:05.488962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:06.049002Z","title":"Dai, L.-H","venue":null,"work_id":"dc0e723e-a040-4ec1-8675-09cf194dccf5","year":2024},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.493365Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:7de4d28c2f88660d6274f845843f7aba1383e443c7910d986a05eb0c0bf948ff","observation_id":"8814db4c-fa02-4477-bad9-47d83a39da8b","resolution":{"observed_at":"2026-08-06T23:51:06.053967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:06.034072Z","title":null,"venue":null,"work_id":"453280fd-b5a0-4e71-9ff0-6c9127455ec6","year":2024},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.498683Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:83efab60caca6a09c4952697a8a7e3f8dc2842c93f79cfa6d514cedc0b36ad16","observation_id":"1fef668c-b1ef-4f1a-87a7-07fbe2a7171d","resolution":{"observed_at":"2026-08-06T23:51:06.039106Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:05.503078Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.503078Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:4b2e4446c22399a8d60d089981701950bb61ffbfbd94a863eaa9092834d1e16b","observation_id":"094b105c-41c1-4408-b040-87c109eb108f","resolution":{"observed_at":"2026-08-06T23:51:05.503078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:05.508411Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.508411Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:6b59b5ea715eb7620722861cb47971d3569d9a849df2b99e83405b8aabd29709","observation_id":"0eda8c59-061c-45c6-a4ad-bc6afc8f021f","resolution":{"observed_at":"2026-08-06T23:51:05.508411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-06T23:51:05.512735Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.512735Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:812200c0d65917e81ece4b3f5c5183adfb0c47f1924a30d6467b57b84896d460","observation_id":"257b6e7f-9da2-416b-8d1d-dd1e5d1e21de","resolution":{"observed_at":"2026-08-06T23:51:05.512735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:05.516993Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.516993Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:7a0802e7aadca5688dd93fab6f4899c81e3a962854ff8534720ae2732914d058","observation_id":"d5638925-aebe-47b4-9048-97992808df66","resolution":{"observed_at":"2026-08-06T23:51:05.516993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:05.522115Z","title":"Krizhevsky, I","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.522115Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:652b930a2406e31fbe7e7caae5cb77ea7bbffcc47255efc75d4af001f09408bd","observation_id":"cb770695-661f-42d0-b598-c3c1fbeca1ab","resolution":{"observed_at":"2026-08-06T23:51:05.522115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13705","last_updated":"2023-04-23T19:10:53Z","snapshot_observed_at":"2026-08-03T01:22:01.078078Z","submitted_at":"2023-04-23T19:10:53Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13705","snapshot_observed_at":"2026-08-06T23:51:05.527593Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.527593Z"},"links":{"cited_paper":"/paper/2304.13705","citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:5c0e95832fe93dcf0bf0b0f96776d4e15313d3e13abc80a39238c6c154060ccf","observation_id":"9f592a5a-79e5-4b5f-9741-1bc67c350e3d","resolution":{"observed_at":"2026-08-06T23:51:05.527593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:05.985262Z","title":null,"venue":null,"work_id":"d8e8993a-4e4e-4a11-a225-5f32db5356c9","year":2022},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.533167Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:506ccc4d9014eacfa6334e3b0a3beae181c2f09ad329bd0a345413c5d3318a02","observation_id":"a31165a0-14fc-47c0-90b5-3d49cf2f0175","resolution":{"observed_at":"2026-08-06T23:51:05.990154Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:05.538786Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.538786Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:34fbbbaae435b30be629f30672bfca12e5c26ad5c6e3c21af3c277a8930e43f1","observation_id":"cb1f02cd-b236-4b34-b417-427e5d224f48","resolution":{"observed_at":"2026-08-06T23:51:05.538786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:05.543711Z","title":"Khazatsky, K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.543711Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:3644a4a86ae8aa69a9dbb92dd559192e2f7d1ad1ddf11ab1963ae655b1bc8e23","observation_id":"53e4b447-c84d-4971-a6ea-afd045c95f2a","resolution":{"observed_at":"2026-08-06T23:51:05.543711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:05.549380Z","title":"Radford, J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.549380Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:8c3171a7e1dc2b61ca9c29af4dfc57d74e65180c30f0ce43eafb0beb76ea1eee","observation_id":"a145d811-0bbc-4c71-9008-28c2e2228016","resolution":{"observed_at":"2026-08-06T23:51:05.549380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:05.945985Z","title":"Campos, R","venue":null,"work_id":"02196cdc-bea1-4d5d-b125-1d881a9dfa95","year":2021},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.554756Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:57f6064f9b4eab3a868b0d582173db5df2ed50dce6f160db54a83ac4aa0c7e20","observation_id":"02556ad7-f4c2-421b-99d0-8e270d441f1f","resolution":{"observed_at":"2026-08-06T23:51:05.950992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:05.931113Z","title":"Meta Quest: Virtual Reality Headset.https://www.meta.com/ quest/, n.d","venue":null,"work_id":"66b71197-d1e0-4b37-bd9d-eaaa68cf6dce","year":2025},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.559399Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:a7396d388028041dfc6ecb6373e33bd05da3b8f8d86b63284435febaad280711","observation_id":"6177047f-aa54-44f6-aea6-ef3cb1efdf54","resolution":{"observed_at":"2026-08-06T23:51:05.936241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:05.913929Z","title":"Astribot S1: AI Robotic Partner.https://www.astribot.com/ product-en, 2024","venue":null,"work_id":"ba201aa6-ee24-4ddd-bfaa-27f004b1eaa5","year":2024},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.564651Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:546d5abcdcdd256964843ff32ae68da38ef372a294a4595f3efb6ad1daf68ce5","observation_id":"5fdcae0a-3e61-4d20-a971-52375e32b597","resolution":{"observed_at":"2026-08-06T23:51:05.920767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":53,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 12 inbound Pith citation observations for arXiv:2506.16211."}