{"as_of":"2026-08-11T00:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a90f69692307584ab2bb715db1aed0417dd9a410f4f1cc361e8526f9ec668179","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:23:17.808710Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T14:03:48.795572Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T14:04:11.986738Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-10T18:52:26.088653Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2505.19080","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19080","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Re- finevla: Reasoning-aware teacher-guided transfer fine- tuning","venue":null,"work_id":"9f1d6c60-32c9-4450-ac49-40dcef8d4dd9","year":2025},"citing_paper":{"arxiv_id":"2508.13073","last_updated":"2025-09-01T08:10:01Z","snapshot_observed_at":"2026-08-07T15:40:31.068428Z","submitted_at":"2025-08-18T16:45:48Z","title":"Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey","version":2},"reference_index":105,"source":"pdf_text","source_observed_at":"2026-05-17T20:28:15.818016Z"},"links":{"cited_paper":"/paper/2505.19080","citing_paper":"/paper/2508.13073"},"observation_digest":"sha256:dcbce743c05dcd2e4a759e7b05c99998cc52ac3070083ff1362b7b03eb95d733","observation_id":"bb9718ee-8092-4610-a8ed-ff793642f6d6","resolution":{"observed_at":"2026-05-17T20:28:16.100767Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-10T18:52:26.088653Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2505.19080","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19080","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Re- finevla: Reasoning-aware teacher-guided transfer fine- tuning","venue":null,"work_id":"9f1d6c60-32c9-4450-ac49-40dcef8d4dd9","year":2025},"citing_paper":{"arxiv_id":"2602.08167","last_updated":"2026-05-16T05:42:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-09T00:10:17Z","title":"Self-Supervised Bootstrapping of Action-Predictive Embodied Reasoning","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-21T14:03:48.795572Z"},"links":{"cited_paper":"/paper/2505.19080","citing_paper":"/paper/2602.08167"},"observation_digest":"sha256:6628bc3bf1f21ecf483e3b5fe626b9dc5218e7e95c163bff2f4aa40dae3dc015","observation_id":"4ac42071-05db-4460-9fee-aaf2782b3f9e","resolution":{"observed_at":"2026-05-21T14:04:11.988479Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19080/citation-record","integrity":"/paper/2505.19080/integrity","json":"/paper/2505.19080/citation-record.json","paper":"/paper/2505.19080"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-10T14:07:02.234322Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-07T14:23:17.623490Z","title":"Phi-3 technical report: A highly capable language model locally on your phone.arXiv preprint arXiv:2404.14219,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-10T18:52:26.088653Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.623490Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:5ede1187d88bef69a9b19c69d4af46a560487ee8c44d4d92bf5705896567f5ed","observation_id":"6abdc78f-71ff-44c2-8905-f41793a00c8d","resolution":{"observed_at":"2026-08-07T14:23:17.623490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-07T14:23:17.633566Z","title":"Rt-1: Robotics transformer for real-world control at scale.arXiv preprint arXiv:2212.06817,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-10T18:52:26.088653Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.633566Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:8404b67ebe3bb2660f4eccbfbcb28e29a9848dd6090bcfe49f6f9b611e3be2fd","observation_id":"81ff07c7-4efa-4727-b3df-307f7c407460","resolution":{"observed_at":"2026-08-07T14:23:17.633566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07775","last_updated":"2024-07-12T14:37:08Z","snapshot_observed_at":"2026-07-06T18:44:20.262496Z","submitted_at":"2024-07-10T15:49:07Z","title":"Mobility VLA: Multimodal Instruction Navigation with Long-Context VLMs and Topological Graphs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07775","snapshot_observed_at":"2026-08-07T14:23:17.645992Z","title":"Mobility vla: Multimodal instruction navigation with long-context vlms and topological graphs.arXiv preprint arXiv:2407.07775,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-10T18:52:26.088653Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.645992Z"},"links":{"cited_paper":"/paper/2407.07775","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:9bdcb7d76b0a71467cd1feecd4a874437e71adc189fa7634d7f0a2106be723fa","observation_id":"a4ad4753-659c-4dfb-9d7b-f3adf0084e78","resolution":{"observed_at":"2026-08-07T14:23:17.645992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-08T22:04:13.117781Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-07T14:23:17.654955Z","title":"Palm-e: An embodied multimodal language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-10T18:52:26.088653Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.654955Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:4756f883f42452802caab2632f0dc5ce06bf2fc6b03f0b372c0e0134aa867a5b","observation_id":"0e02cd66-b18e-404b-8600-30083f1a3b1d","resolution":{"observed_at":"2026-08-07T14:23:17.654955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.07280","last_updated":"2023-03-13T16:54:11Z","snapshot_observed_at":"2026-08-09T18:23:52.580156Z","submitted_at":"2023-03-13T16:54:11Z","title":"Vision-Language Models as Success Detectors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.07280","snapshot_observed_at":"2026-08-07T14:23:17.659489Z","title":"Vision-language models as success detectors.arXiv preprint arXiv:2303.07280,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-10T18:52:26.088653Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.659489Z"},"links":{"cited_paper":"/paper/2303.07280","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:59953ab7c93a1e3a2b248f4277189a798c7474fd1a74c2e7598137968817cb8a","observation_id":"f798f7a9-6ef4-483a-a5f6-c73656e14c01","resolution":{"observed_at":"2026-08-07T14:23:17.659489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.13396","last_updated":"2021-09-27T23:42:12Z","snapshot_observed_at":"2026-07-06T11:51:58.310046Z","submitted_at":"2021-09-27T23:42:12Z","title":"Bridge Data: Boosting Generalization of Robotic Skills with Cross-Domain Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.13396","snapshot_observed_at":"2026-08-07T14:23:17.663373Z","title":"Bridge data: Boosting generalization of robotic skills with cross-domain datasets.arXiv preprint arXiv:2109.13396,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-10T18:52:26.088653Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.663373Z"},"links":{"cited_paper":"/paper/2109.13396","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:c14ba0424a3a5317983685b06c2a0b5af1799c5e95991890185859b5765c6c77","observation_id":"34381656-f7d4-40ae-8ed9-c7fecfa8b12c","resolution":{"observed_at":"2026-08-07T14:23:17.663373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10421","last_updated":"2022-12-14T14:28:33Z","snapshot_observed_at":"2026-08-09T07:29:14.230207Z","submitted_at":"2022-03-20T00:52:45Z","title":"CoWs on Pasture: Baselines and Benchmarks for Language-Driven Zero-Shot Object Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10421","snapshot_observed_at":"2026-08-07T14:23:17.667521Z","title":"Clip on wheels: Zero-shot object navigation as object localization and exploration.arXiv preprint arXiv:2203.10421, 3(4):7,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-10T18:52:26.088653Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.667521Z"},"links":{"cited_paper":"/paper/2203.10421","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:ce8fae56f9c74dcd2ac6d3547442ffe1dc5b4d44e4943ac1483c60e424c7a411","observation_id":"df46edfa-4461-4a4a-9c8f-5392f7ec3965","resolution":{"observed_at":"2026-08-07T14:23:17.667521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08573","last_updated":"2023-10-12T17:57:32Z","snapshot_observed_at":"2026-08-10T04:13:28.316340Z","submitted_at":"2023-10-12T17:57:32Z","title":"PolyTask: Learning Unified Policies through Behavior Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08573","snapshot_observed_at":"2026-08-07T14:23:17.671649Z","title":"Polytask: Learning unified policies through behavior distillation.arXiv preprint arXiv:2310.08573,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-10T18:52:26.088653Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.671649Z"},"links":{"cited_paper":"/paper/2310.08573","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:6c6dcdcca9fd84cb228622302145bf1c5539a476a789702a7f27f4c8715d0516","observation_id":"464f69e0-2884-4d5f-b06d-0c4a029929cb","resolution":{"observed_at":"2026-08-07T14:23:17.671649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07539","last_updated":"2024-07-16T20:20:07Z","snapshot_observed_at":"2026-08-09T12:35:28.652573Z","submitted_at":"2024-06-11T17:58:54Z","title":"BAKU: An Efficient Transformer for Multi-Task Policy Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07539","snapshot_observed_at":"2026-08-07T14:23:17.675946Z","title":"Baku: An efficient transformer for multi-task policy learning.arXiv preprint arXiv:2406.07539,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-10T18:52:26.088653Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.675946Z"},"links":{"cited_paper":"/paper/2406.07539","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:4c1c265c332b783c20ab4dfeab7db7c45bc02cedcca83d644c3494da38264cfc","observation_id":"732721b3-d6da-4340-8413-a7817eacb5dc","resolution":{"observed_at":"2026-08-07T14:23:17.675946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16187","last_updated":"2023-06-21T01:27:37Z","snapshot_observed_at":"2026-08-10T16:49:51.470084Z","submitted_at":"2023-03-28T17:53:06Z","title":"Visual Chain-of-Thought Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16187","snapshot_observed_at":"2026-08-07T14:23:17.680787Z","title":"Visual chain-of-thought diffusion models.arXiv preprint arXiv:2303.16187,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-10T18:52:26.088653Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.680787Z"},"links":{"cited_paper":"/paper/2303.16187","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:0254ca47f78d0a3c49ace58356bd61bce13d12c7732dcae765f21303bd131154","observation_id":"4f894259-7a00-4310-8e45-b0d1b59a5a00","resolution":{"observed_at":"2026-08-07T14:23:17.680787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-05T09:57:39.370124Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-08-07T14:23:17.684374Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models.arXiv preprint arXiv:2406.09403,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-10T18:52:26.088653Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.684374Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:1da75a4a97e3e3f8f7fbfa4c4b4a123d10d6880c183c5a95e0d6f1ed000b062d","observation_id":"449c37bd-508f-4e8b-aefc-cdf5f7300e83","resolution":{"observed_at":"2026-08-07T14:23:17.684374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.22325","last_updated":"2024-10-30T03:33:08Z","snapshot_observed_at":"2026-08-10T02:46:02.602855Z","submitted_at":"2024-10-29T17:58:13Z","title":"Robots Pre-train Robots: Manipulation-Centric Robotic Representation from Large-Scale Robot Datasets","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.22325","snapshot_observed_at":"2026-08-07T14:23:17.688817Z","title":"Seil Kang, Jinyeong Kim, Junhyeok Kim, and Seong Jae Hwang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-10T18:52:26.088653Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.688817Z"},"links":{"cited_paper":"/paper/2410.22325","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:4c4876b4ad05b3609afe96faf6f258664b1646ba6e00fbf51af9d9bbb9d1ff17","observation_id":"f68abc9f-17c6-40c9-ac6d-91c14bfef0e8","resolution":{"observed_at":"2026-08-07T14:23:17.688817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12945","last_updated":"2025-04-22T17:57:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-19T17:48:38Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12945","snapshot_observed_at":"2026-08-07T14:23:17.697987Z","title":"Droid: A large-scale in-the-wild robot manipulation dataset.arXiv preprint arXiv:2403.12945,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-10T18:52:26.088653Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.697987Z"},"links":{"cited_paper":"/paper/2403.12945","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:6f2c17d12c0bfae468a9d48c7d95c20900836b131f27ab46905b69049f4f0998","observation_id":"2ce3cffe-52ae-46ca-985c-4375be85fe20","resolution":{"observed_at":"2026-08-07T14:23:17.697987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-07T14:23:17.701901Z","title":"Openvla: An open-source vision-language-action model.arXiv preprint arXiv:2406.09246,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-10T18:52:26.088653Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.701901Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:069aea18ceba3f571d5786ea3681329b63a4871f3adaf87bab6edc0f42339420","observation_id":"eb2e8d9f-f844-4ab5-9b98-56a120dc7747","resolution":{"observed_at":"2026-08-07T14:23:17.701901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19650","last_updated":"2024-11-29T12:06:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-29T12:06:03Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19650","snapshot_observed_at":"2026-08-07T14:23:17.706264Z","title":"Cogact: A foundational vision-language-action model for synergizing cognition and action in robotic manipulation.arXiv preprint arXiv:2411.19650, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-10T18:52:26.088653Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.706264Z"},"links":{"cited_paper":"/paper/2411.19650","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:7cf5a4b8ed4304354eb15455bb412e48492c196c7343ab50e6d47e1cdbaf8122","observation_id":"1f8a9f70-5f59-417f-a4ef-291ae7906ac5","resolution":{"observed_at":"2026-08-07T14:23:17.706264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07864","last_updated":"2025-03-01T08:57:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-10T12:33:46Z","title":"RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07864","snapshot_observed_at":"2026-08-07T14:23:17.710194Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-10T18:52:26.088653Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.710194Z"},"links":{"cited_paper":"/paper/2410.07864","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:94716617c0664acd0dbb7bc2510379d3f5777be80493f5efec342e9d95367579","observation_id":"f939fbf7-bea3-4119-93b2-2f97b0c106c6","resolution":{"observed_at":"2026-08-07T14:23:17.710194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:18.348717Z","title":"Faithful chain-of-thought reasoning","venue":null,"work_id":"e50c6829-1261-4aa0-bad2-b46d0719c686","year":2023},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-10T18:52:26.088653Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.714106Z"},"links":{"citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:aeaf8b83fe3a34d42fedf3be86bc216db6695cd682c5841a95019b7932d8b522","observation_id":"e2705686-9c43-44d1-8d38-040becb0cff0","resolution":{"observed_at":"2026-08-07T14:23:18.354072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17727","last_updated":"2024-09-26T10:56:35Z","snapshot_observed_at":"2026-08-04T23:59:19.375654Z","submitted_at":"2024-09-26T10:56:35Z","title":"Robotic-CLIP: Fine-tuning CLIP on Action Data for Robotic Applications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17727","snapshot_observed_at":"2026-08-07T14:23:17.722399Z","title":"Robotic-clip: Fine-tuning clip on action data for robotic applications.arXiv preprint arXiv:2409.17727,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-10T18:52:26.088653Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.722399Z"},"links":{"cited_paper":"/paper/2409.17727","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:0a4ea51a3b2d8c6b3f7c82feb37b2d66fd9e58cee4d62dd8af7d93a5dac4b90c","observation_id":"47b13651-ccda-4a27-a7c2-d9e08182f07d","resolution":{"observed_at":"2026-08-07T14:23:17.722399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-08-10T14:16:30.405696Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08864","snapshot_observed_at":"2026-08-07T14:23:17.726703Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models.arXiv preprint arXiv:2310.08864,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-10T18:52:26.088653Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.726703Z"},"links":{"cited_paper":"/paper/2310.08864","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:1ab68f5cf378dd3e5f5f4b6abfa8a7a975efc3797f7b773fecc987662afd2168","observation_id":"f5540d1b-c5c0-4ab7-a9aa-e0aa30e0bddf","resolution":{"observed_at":"2026-08-07T14:23:17.726703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06342","last_updated":"2016-02-22T19:59:40Z","snapshot_observed_at":"2026-08-02T01:15:11.394264Z","submitted_at":"2015-11-19T20:17:27Z","title":"Actor-Mimic: Deep Multitask and Transfer Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06342","snapshot_observed_at":"2026-08-07T14:23:17.730799Z","title":"Actor-mimic: Deep multitask and transfer reinforcement learning.arXiv preprint arXiv:1511.06342,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-10T18:52:26.088653Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.730799Z"},"links":{"cited_paper":"/paper/1511.06342","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:d851284601e6f46895cec5fb1eb2c13d87290448edf223aafe5aebfb40d9c627","observation_id":"6efc98c3-ab27-43b0-86d3-fda8c37f72b6","resolution":{"observed_at":"2026-08-07T14:23:17.730799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02317","last_updated":"2024-01-23T02:29:35Z","snapshot_observed_at":"2026-07-06T15:22:55.122322Z","submitted_at":"2023-05-03T17:58:29Z","title":"Visual Chain of Thought: Bridging Logical Gaps with Multimodal Infillings","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02317","snapshot_observed_at":"2026-08-07T14:23:17.734824Z","title":"URL https://openreview.net/forum?id=1ikK0kHjvj","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-10T18:52:26.088653Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.734824Z"},"links":{"cited_paper":"/paper/2305.02317","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:1654279c86a52f2adc0d412f252f189121cf36f7e3ca72ba2121d71bfcf33b23","observation_id":"2747b5cd-31f1-4a9a-a7d0-9b27b197983b","resolution":{"observed_at":"2026-08-07T14:23:17.734824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06295","last_updated":"2016-01-07T18:43:03Z","snapshot_observed_at":"2026-07-06T04:37:06.738855Z","submitted_at":"2015-11-19T18:38:47Z","title":"Policy Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06295","snapshot_observed_at":"2026-08-07T14:23:17.738527Z","title":"Policy distillation.arXiv preprint arXiv:1511.06295,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-10T18:52:26.088653Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.738527Z"},"links":{"cited_paper":"/paper/1511.06295","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:ea0bafaf6330bd871f81319e3155fe0cd965e4fe9215f6e771e2aff9b1631edc","observation_id":"5adf02a6-e384-4fb2-964c-fdf93d35de3d","resolution":{"observed_at":"2026-08-07T14:23:17.738527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03555","last_updated":"2024-12-04T18:50:42Z","snapshot_observed_at":"2026-07-06T20:01:45.826971Z","submitted_at":"2024-12-04T18:50:42Z","title":"PaliGemma 2: A Family of Versatile VLMs for Transfer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03555","snapshot_observed_at":"2026-08-07T14:23:17.746209Z","title":"Paligemma 2: A family of versatile vlms for transfer.arXiv preprint arXiv:2412.03555,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-10T18:52:26.088653Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.746209Z"},"links":{"cited_paper":"/paper/2412.03555","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:96ffb57a14c9a9f433f8e86faa5c518d2934ebf0d4ce6e9a72fbe576ee7f90cf","observation_id":"63a3906c-1393-4116-9bfe-f4ec57ec465c","resolution":{"observed_at":"2026-08-07T14:23:17.746209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T14:23:17.750302Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-10T18:52:26.088653Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.750302Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:3165a4ff02e9fd6098bf5d21f39df4c397f0b5a6eafccf0c91b20780aefe208f","observation_id":"74739850-34ab-4ea3-8c45-e07ee46b4627","resolution":{"observed_at":"2026-08-07T14:23:17.750302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-07T14:23:17.753703Z","title":"Octo: An open-source generalist robot policy.arXiv preprint arXiv:2405.12213,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-10T18:52:26.088653Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.753703Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:ca701a22bf16a3278d0c6f71018ad250dc92deae5986d5ee9fc7b16352a833ff","observation_id":"06a43a6d-020e-4438-9363-62748c11a39d","resolution":{"observed_at":"2026-08-07T14:23:17.753703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-07T14:23:17.757431Z","title":"Siglip 2: Multilingual vision-language encoders with improved semantic understanding, localization, and dense features.arXiv preprint arXiv:2502.14786,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-10T18:52:26.088653Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.757431Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:e6f19e24b2c73404ba10c76b89f980cf91901735e88dfb903db14ca95f182a06","observation_id":"1dd2fbca-44e1-47df-b93f-9f3bd3db2c20","resolution":{"observed_at":"2026-08-07T14:23:17.757431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02632","last_updated":"2024-12-04T05:02:45Z","snapshot_observed_at":"2026-08-10T16:55:05.409214Z","submitted_at":"2024-12-03T18:01:45Z","title":"Scaling Image Tokenizers with Grouped Spherical Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02632","snapshot_observed_at":"2026-08-07T14:23:17.761176Z","title":"Scaling image tokenizers with grouped spherical quantization.arXiv preprint arXiv:2412.02632,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-10T18:52:26.088653Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.761176Z"},"links":{"cited_paper":"/paper/2412.02632","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:f5cdd35a7877efe21a57756644f4c50040b26ef538e639da7943be661c66416f","observation_id":"751f49b8-2ddb-48c1-a56f-b8b44856507e","resolution":{"observed_at":"2026-08-07T14:23:17.761176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01652","last_updated":"2022-02-08T20:26:45Z","snapshot_observed_at":"2026-08-10T07:52:08.606999Z","submitted_at":"2021-09-03T17:55:52Z","title":"Finetuned Language Models Are Zero-Shot Learners","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.01652","snapshot_observed_at":"2026-08-07T14:23:17.765456Z","title":"Finetuned language models are zero-shot learners.arXiv preprint arXiv:2109.01652,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-10T18:52:26.088653Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.765456Z"},"links":{"cited_paper":"/paper/2109.01652","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:af010ea9ed2bff2d0e34a8ae4f20932df5f0c6efc118b2cd8033b85d846659f0","observation_id":"a6817d30-8ecb-421c-ac65-cbb44d0871c3","resolution":{"observed_at":"2026-08-07T14:23:17.765456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00025","last_updated":"2024-07-12T12:51:00Z","snapshot_observed_at":"2026-07-06T17:09:59.848387Z","submitted_at":"2023-12-28T23:34:43Z","title":"Any-point Trajectory Modeling for Policy Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00025","snapshot_observed_at":"2026-08-07T14:23:17.769007Z","title":"Any-point trajectory modeling for policy learning.arXiv preprint arXiv:2401.00025,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-10T18:52:26.088653Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.769007Z"},"links":{"cited_paper":"/paper/2401.00025","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:e716a64203e562fd59165ec87487c711131079e984a8d23d11230934479ca5ab","observation_id":"e803ffe3-7a4b-411d-b8f0-17f275d7367a","resolution":{"observed_at":"2026-08-07T14:23:17.769007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12514","last_updated":"2025-05-13T11:02:20Z","snapshot_observed_at":"2026-08-07T15:12:56.367961Z","submitted_at":"2024-09-19T07:10:18Z","title":"TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12514","snapshot_observed_at":"2026-08-07T14:23:17.773216Z","title":"Tinyvla: Towards fast, data-efficient vision-language-action models for robotic manipulation.arXiv preprint arXiv:2409.12514,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-10T18:52:26.088653Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.773216Z"},"links":{"cited_paper":"/paper/2409.12514","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:f4753cc89dbfb0bbfb9d7a6aa38a4786eaf8c1a802f393b4e743c26f2ec0492b","observation_id":"77f08789-8c5e-41c8-ad67-24caa287070c","resolution":{"observed_at":"2026-08-07T14:23:17.773216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04429","last_updated":"2025-03-04T16:31:57Z","snapshot_observed_at":"2026-08-01T23:38:04.510222Z","submitted_at":"2024-09-06T17:49:56Z","title":"VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04429","snapshot_observed_at":"2026-08-07T14:23:17.776758Z","title":"Vila-u: a unified foundation model integrating visual understanding and generation.arXiv preprint arXiv:2409.04429,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-10T18:52:26.088653Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.776758Z"},"links":{"cited_paper":"/paper/2409.04429","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:07e47ccc25dfebe5d4e678e73c5290d92a395fb0590a24c5a943a152043c73b5","observation_id":"c42b772c-8e66-46b0-8eca-d5b3a52207da","resolution":{"observed_at":"2026-08-07T14:23:17.776758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04163","last_updated":"2025-03-06T07:25:36Z","snapshot_observed_at":"2026-08-10T16:21:04.613622Z","submitted_at":"2025-03-06T07:25:36Z","title":"VLA Model-Expert Collaboration for Bi-directional Manipulation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04163","snapshot_observed_at":"2026-08-07T14:23:17.780804Z","title":"Vla model-expert collaboration for bi-directional manipulation learning.arXiv preprint arXiv:2503.04163,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-10T18:52:26.088653Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.780804Z"},"links":{"cited_paper":"/paper/2503.04163","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:89b0ecd8c4170d1251a39f16fe0461a84755bf2a581c6d4b21861e3402097b15","observation_id":"e86922d0-6845-4f13-9ce9-9b1da0ee9540","resolution":{"observed_at":"2026-08-07T14:23:17.780804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16582","last_updated":"2024-03-23T03:06:54Z","snapshot_observed_at":"2026-08-09T18:59:06.635630Z","submitted_at":"2023-05-26T02:15:09Z","title":"Beyond Chain-of-Thought, Effective Graph-of-Thought Reasoning in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16582","snapshot_observed_at":"2026-08-07T14:23:17.784034Z","title":"Beyond chain-of-thought, effective graph-of-thought reasoning in language models.arXiv preprint arXiv:2305.16582,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-10T18:52:26.088653Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.784034Z"},"links":{"cited_paper":"/paper/2305.16582","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:ac5887394cf25f27374d638675818c3e0f474b14dabf89b527c8307af6aa3b54","observation_id":"2e81a8eb-70fc-4362-a9f2-5efee888717f","resolution":{"observed_at":"2026-08-07T14:23:17.784034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08693","last_updated":"2025-03-06T19:29:03Z","snapshot_observed_at":"2026-08-07T02:44:43.738657Z","submitted_at":"2024-07-11T17:31:01Z","title":"Robotic Control via Embodied Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08693","snapshot_observed_at":"2026-08-07T14:23:17.788422Z","title":"Michał Zawalski, William Chen, Karl Pertsch, Oier Mees, Chelsea Finn, and Sergey Levine","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-10T18:52:26.088653Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.788422Z"},"links":{"cited_paper":"/paper/2407.08693","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:f420523fb06b5a3f31512f801f4b48066aa384350dc8cdfb64e25243f1e9a738","observation_id":"9fa874c3-ba79-4697-aacc-2bc1ee726740","resolution":{"observed_at":"2026-08-07T14:23:17.788422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03540","last_updated":"2024-11-05T22:42:41Z","snapshot_observed_at":"2026-08-10T14:08:44.292483Z","submitted_at":"2024-11-05T22:42:41Z","title":"VLA-3D: A Dataset for 3D Semantic Scene Understanding and Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.03540","snapshot_observed_at":"2026-08-07T14:23:17.792745Z","title":"Vla-3d: A dataset for 3d semantic scene understanding and navigation.arXiv preprint arXiv:2411.03540,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-10T18:52:26.088653Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.792745Z"},"links":{"cited_paper":"/paper/2411.03540","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:a3f7dbc6ed77dad628d1ab59623934a91ed95c4c9f2c41fb124601edb40a944d","observation_id":"9dd4cd40-e528-408a-997d-5924fa5503a6","resolution":{"observed_at":"2026-08-07T14:23:17.792745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-08-07T14:23:17.797242Z","title":"Up-vla: A unified understanding and prediction model for embodied agent.arXiv preprint arXiv:2501.18867,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-10T18:52:26.088653Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.797242Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:7cd757e19309b90c6bc0e39ad7ee9772c050e83c174f5adbbdb2d8b7580233b2","observation_id":"19898cd3-2219-4907-9f3d-17d2f2cee578","resolution":{"observed_at":"2026-08-07T14:23:17.797242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.22020","last_updated":"2025-03-27T22:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T22:23:04Z","title":"CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.22020","snapshot_observed_at":"2026-08-07T14:23:17.801227Z","title":"Cot-vla: Visual chain-of-thought reasoning for vision-language-action models.arXiv preprint arXiv:2503.22020,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-10T18:52:26.088653Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.801227Z"},"links":{"cited_paper":"/paper/2503.22020","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:ba95176c0ffc5fafcf6597a2b988b1555a04f64e4b9a7a811c1517eee114abda","observation_id":"82a2a3c5-831d-445c-bc07-8d6a2ec8beab","resolution":{"observed_at":"2026-08-07T14:23:17.801227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-05T20:54:58.855446Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-07T14:23:17.804686Z","title":"3d-vla: A 3d vision-language-action generative world model.arXiv preprint arXiv:2403.09631, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-10T18:52:26.088653Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.804686Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:54bcf59ec0e26e7fb92d6777ba30bf553ebaead9434cd8b1c13afe9050a5d0aa","observation_id":"058a3be1-e52f-4b8d-b071-11be389466cb","resolution":{"observed_at":"2026-08-07T14:23:17.804686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14420","last_updated":"2025-02-21T07:28:36Z","snapshot_observed_at":"2026-08-08T15:02:42.425911Z","submitted_at":"2025-02-20T10:16:18Z","title":"ChatVLA: Unified Multimodal Understanding and Robot Control with Vision-Language-Action Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14420","snapshot_observed_at":"2026-08-07T14:23:17.808710Z","title":"Chatvla: Unified multimodal understanding and robot control with vision-language-action model.arXiv preprint arXiv:2502.14420,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-10T18:52:26.088653Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.808710Z"},"links":{"cited_paper":"/paper/2502.14420","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:1c1ebc87d67b892be6610ca86db5c216acdc39b0bbe67b917bfaced4d58d5e48","observation_id":"9dc6f745-b6fe-4d6f-ac3e-d374ec8ffdc1","resolution":{"observed_at":"2026-08-07T14:23:17.808710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16999","last_updated":"2024-11-04T05:50:56Z","snapshot_observed_at":"2026-07-06T17:50:18.017647Z","submitted_at":"2024-03-25T17:59:23Z","title":"Visual CoT: Advancing Multi-Modal Language Models with a Comprehensive Dataset and Benchmark for Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16999","snapshot_observed_at":"2026-08-07T14:23:17.741887Z","title":"Visual cot: Unleashing chain-of-thought reasoning in multi-modal language models.arXiv preprint arXiv:2403.16999,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-10T18:52:26.088653Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.741887Z"},"links":{"cited_paper":"/paper/2403.16999","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:51524d09c6f9697be86d89d496b94c2b858da3046accc92a2008dc98d529e9ca","observation_id":"04349354-9950-43b9-95f3-155cd4a789c1","resolution":{"observed_at":"2026-08-07T14:23:17.741887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-07T14:23:17.637851Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control.arXiv preprint arXiv:2307.15818,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-10T18:52:26.088653Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.637851Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:6c9d704823afab9b720df650864b2a207776247b7bb7485e64759834ae27e5f9","observation_id":"53c9bd92-c75e-4dad-a0c4-c6cf9dc6c2b7","resolution":{"observed_at":"2026-08-07T14:23:17.637851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09277","last_updated":"2023-11-15T18:54:01Z","snapshot_observed_at":"2026-08-08T17:22:08.547131Z","submitted_at":"2023-11-15T18:54:01Z","title":"Contrastive Chain-of-Thought Prompting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09277","snapshot_observed_at":"2026-08-07T14:23:17.641948Z","title":"Berkeley UR5 demonstration dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-10T18:52:26.088653Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.641948Z"},"links":{"cited_paper":"/paper/2311.09277","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:fc3b8eb5806911f319dfd054401a33bfa6e5fb5d2a011cefcb5391d6ced14f60","observation_id":"157b6815-5214-4c55-bb3c-67d32e33cbfe","resolution":{"observed_at":"2026-08-07T14:23:17.641948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-07T14:23:17.629072Z","title":"A vision-language-action flow model for general robot control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-10T18:52:26.088653Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.629072Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:4728138f10da25e55f7c9a488f70ba7bbffbde0fb7cb368e89c4452951c3e0a1","observation_id":"0ac48349-8dc8-4599-a0cd-9548ee5be645","resolution":{"observed_at":"2026-08-07T14:23:17.629072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12766","last_updated":"2023-02-24T17:29:31Z","snapshot_observed_at":"2026-08-09T00:25:43.898202Z","submitted_at":"2023-02-24T17:29:31Z","title":"Language-Driven Representation Learning for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12766","snapshot_observed_at":"2026-08-07T14:23:17.693241Z","title":"Language-driven representation learning for robotics.arXiv preprint arXiv:2302.12766,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-10T18:52:26.088653Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.693241Z"},"links":{"cited_paper":"/paper/2302.12766","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:6c59310731469eaef86894eaaf6b6f69a30e05a750601e6491745c4483b45de8","observation_id":"ab5cc005-88f5-4826-bba1-c90262fd21d6","resolution":{"observed_at":"2026-08-07T14:23:17.693241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-10T18:52:26.088653Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 2 inbound Pith citation observations for arXiv:2505.19080."}