{"as_of":"2026-08-03T23:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:133d30cd7746595a37fb7e4e7ded6c856ee9abf3269f0d82cbd553fd3dedd17d","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T12:58:30.777235Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-03T06:30:56.289259+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T22:39:15.211339Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T14:09:53.718432Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"cited_work":{"arxiv_id":"2602.18532","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.18532","snapshot_observed_at":"2026-07-04T14:09:53.718432Z","title":"Vlanext: Recipes for building strong vla models.arXiv preprint arXiv:2602.18532","venue":"cs.CV","work_id":"e7a9aa71-5bef-41b3-92de-ba90ad375056","year":2026},"citing_paper":{"arxiv_id":"2605.06175","last_updated":"2026-05-08T06:32:29Z","snapshot_observed_at":"2026-07-31T03:14:45.876383Z","submitted_at":"2026-05-07T12:56:58Z","title":"VLA-GSE: Boosting Parameter-Efficient Fine-Tuning in VLA with Generalized and Specialized Experts","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-08T09:11:21.715023Z"},"links":{"cited_paper":"/paper/2602.18532","citing_paper":"/paper/2605.06175"},"observation_digest":"sha256:0529ac2b6f5a7f361027d1b88ed00d66107fa66604357ba875949d9c48466ff2","observation_id":"c136c42d-0514-483d-8f53-d9fc1928c427","resolution":{"observed_at":"2026-05-21T02:04:11.439936Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"cited_work":{"arxiv_id":"2602.18532","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.18532","snapshot_observed_at":"2026-07-04T14:09:53.718432Z","title":"Vlanext: Recipes for building strong vla models.arXiv preprint arXiv:2602.18532","venue":"cs.CV","work_id":"e7a9aa71-5bef-41b3-92de-ba90ad375056","year":2026},"citing_paper":{"arxiv_id":"2605.06175","last_updated":"2026-05-08T06:32:29Z","snapshot_observed_at":"2026-07-31T03:14:45.876383Z","submitted_at":"2026-05-07T12:56:58Z","title":"VLA-GSE: Boosting Parameter-Efficient Fine-Tuning in VLA with Generalized and Specialized Experts","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-11T01:05:07.509291Z"},"links":{"cited_paper":"/paper/2602.18532","citing_paper":"/paper/2605.06175"},"observation_digest":"sha256:761250ffb8b91662c651d1b3b3f72a9cd4c45657b2aa1dcaa1359b6d0d2693af","observation_id":"54fbf5b6-c48d-4a25-815b-fedfe200d0ce","resolution":{"observed_at":"2026-05-21T02:04:11.439936Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"cited_work":{"arxiv_id":"2602.18532","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.18532","snapshot_observed_at":"2026-07-04T14:09:53.718432Z","title":"Vlanext: Recipes for building strong vla models.arXiv preprint arXiv:2602.18532","venue":"cs.CV","work_id":"e7a9aa71-5bef-41b3-92de-ba90ad375056","year":2026},"citing_paper":{"arxiv_id":"2605.19282","last_updated":"2026-05-19T03:00:26Z","snapshot_observed_at":"2026-07-06T23:30:02.207108Z","submitted_at":"2026-05-19T03:00:26Z","title":"Rethinking Muon Beyond Pretraining: Spectral Failures and High-Pass Remedies for VLA and RLVR","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-20T07:14:31.613251Z"},"links":{"cited_paper":"/paper/2602.18532","citing_paper":"/paper/2605.19282"},"observation_digest":"sha256:7d4b61107036246be498336f9116faf639ed468c4e1b01dbaaf86943f1d632ca","observation_id":"102eb8f3-cd5d-49f3-a700-c087586b9b1f","resolution":{"observed_at":"2026-05-21T02:04:11.439936Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"cited_work":{"arxiv_id":"2602.18532","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.18532","snapshot_observed_at":"2026-07-04T14:09:53.718432Z","title":"Vlanext: Recipes for building strong vla models.arXiv preprint arXiv:2602.18532","venue":"cs.CV","work_id":"e7a9aa71-5bef-41b3-92de-ba90ad375056","year":2026},"citing_paper":{"arxiv_id":"2605.30834","last_updated":"2026-05-29T04:40:12Z","snapshot_observed_at":"2026-08-02T14:58:44.039726Z","submitted_at":"2026-05-29T04:40:12Z","title":"Hide-and-Seek in Trajectories: Discovering Failure Signals for VLA Runtime Monitoring","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T22:39:15.211339Z"},"links":{"cited_paper":"/paper/2602.18532","citing_paper":"/paper/2605.30834"},"observation_digest":"sha256:f497eb7ffb6f57aaf4f760bb603095af5563d8e22027f827a9af38e1f10ee48d","observation_id":"20be91d9-bff0-49eb-a1b7-848a0b41da9a","resolution":{"observed_at":"2026-06-28T22:42:46.568474Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"cited_work":{"arxiv_id":"2602.18532","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.18532","snapshot_observed_at":"2026-07-04T14:09:53.718432Z","title":"Vlanext: Recipes for building strong vla models.arXiv preprint arXiv:2602.18532","venue":"cs.CV","work_id":"e7a9aa71-5bef-41b3-92de-ba90ad375056","year":2026},"citing_paper":{"arxiv_id":"2606.17924","last_updated":"2026-06-16T13:38:03Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:38:03Z","title":"PearlVLA: Progressive Embodied Action-Plan Refinement in Latent Space","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T00:57:58.312567Z"},"links":{"cited_paper":"/paper/2602.18532","citing_paper":"/paper/2606.17924"},"observation_digest":"sha256:0afc69527701bbf801a23607490c455a462f48925b0760ef6f1133b8eb48fb3e","observation_id":"94d4f7ab-fae3-4fa6-b308-181e2d207902","resolution":{"observed_at":"2026-07-03T20:58:58.543012Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"cited_work":{"arxiv_id":"2602.18532","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.18532","snapshot_observed_at":"2026-07-04T14:09:53.718432Z","title":"Vlanext: Recipes for building strong vla models.arXiv preprint arXiv:2602.18532","venue":"cs.CV","work_id":"e7a9aa71-5bef-41b3-92de-ba90ad375056","year":2026},"citing_paper":{"arxiv_id":"2606.27355","last_updated":"2026-06-25T17:56:33Z","snapshot_observed_at":"2026-08-02T02:42:43.577220Z","submitted_at":"2026-06-25T17:56:33Z","title":"RouterVLA: Turning Smoke Tests into Supervision for Heterogeneous VLA Selection","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-26T04:25:18.870217Z"},"links":{"cited_paper":"/paper/2602.18532","citing_paper":"/paper/2606.27355"},"observation_digest":"sha256:26c543f6534c0c7b2fe5093bcd7fef555ceee3befa97f6fabef3971afe6c5d22","observation_id":"5e853214-c132-47ed-87d7-1375423f15f7","resolution":{"observed_at":"2026-07-04T14:09:53.719676Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2602.18532/citation-record","integrity":"/paper/2602.18532/integrity","json":"/paper/2602.18532/citation-record.json","paper":"/paper/2602.18532"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:cfb0b7c86e5f445e51b0849c89e1583f4f120430689399783f73c36d048d3213","observation_id":"b2529d4c-c5b3-4386-af60-45f20360ac71","resolution":{"observed_at":"2026-05-21T13:00:09.843841Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.05800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T21:08:58.820608Z","title":"3d cavla: Leveraging depth and 3d context to generalize vision language action models for unseen tasks","venue":null,"work_id":"10a5d041-6d20-404d-a379-a0782b16f45e","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:068fa6e45043b9f99a43d6912c6ba5b37a9442ce4ecf7320945176ca0ce7a8e1","observation_id":"7a76bb13-8fbc-4c1f-a856-83b19701ba6b","resolution":{"observed_at":"2026-05-21T13:00:09.938258Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13030","last_updated":"2025-12-25T08:16:05Z","snapshot_observed_at":"2026-07-06T22:38:59.725645Z","submitted_at":"2025-12-15T06:58:40Z","title":"Motus: A Unified Latent Action World Model","version":2},"cited_work":{"arxiv_id":"2512.13030","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.13030","snapshot_observed_at":"2026-07-10T04:16:48.690751Z","title":"Motus: A Unified Latent Action World Model","venue":"cs.CV","work_id":"d0b2d257-524d-4d67-9daf-5fb43e5e977a","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2512.13030","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:7e782198c7f0a40090f801e3d9a37393fb75afbaecdfd0ff71ad71827265f31f","observation_id":"ea65ca17-e5fe-4943-9cd2-aad2b1be43dc","resolution":{"observed_at":"2026-05-21T13:00:09.853621Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":"2503.14734","doi":"10.48550/arxiv.2503.14734","metadata_source":"pith","pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-07-10T23:07:47.672265Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","venue":"cs.RO","work_id":"e2db69c7-ee8a-4cb7-a761-7b8de1dfcf97","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:5d7a60f8a715fe830ae5dc82742adb86daee682b3d6bd33e07b75e5aae4743d3","observation_id":"91a89579-96fe-4a66-bd99-578a2e942d9b","resolution":{"observed_at":"2026-05-21T13:00:09.829471Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-07-12T08:49:11.206777+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T08:49:11.206777+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-07-11T00:07:42.817654Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:8b3193a7d55ad3e02d11c09b3223be1a06b6c9c7fa5561a34e874e4a852fb7b8","observation_id":"6a830836-c062-455f-9806-e218bc442433","resolution":{"observed_at":"2026-05-21T13:00:09.800641Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.17502","last_updated":"2026-05-30T03:49:39Z","snapshot_observed_at":"2026-08-03T20:59:48.866420Z","submitted_at":"2025-11-21T18:59:32Z","title":"RynnVLA-002: A Unified Vision-Language-Action and World Model","version":3},"cited_work":{"arxiv_id":"2511.17502","doi":"10.48550/arxiv.2511.17502","metadata_source":"pith","pith_arxiv_id":"2511.17502","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Rynnvla-002: A unified vision-language-action and world model","venue":"cs.RO","work_id":"f28355c2-726f-4492-899f-be74df2c09cd","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2511.17502","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:86f8310db67d8b5dc37f878c6a40be626912352127f0102da6fbbb041d68979e","observation_id":"3403115c-1040-4070-a9d6-984910f7010d","resolution":{"observed_at":"2026-06-02T02:03:36.254972Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.09527","doi":"10.48550/arxiv.2503.09527","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Combatvla: An efficient vision-language-action model for combat tasks in 3d action role-playing games.arXiv preprint arXiv:2503.09527, 2025a","venue":null,"work_id":"2e1a31ec-35dd-4448-aace-64849c632344","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:657263bc8d04c9c2929c21940dbd007bf01cd7bdadc888ad0bcddad9b3baebdf","observation_id":"07a9d8cc-c5b5-4d83-a626-80ea2d0ad0fa","resolution":{"observed_at":"2026-05-21T13:00:09.917410Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-07-31T17:39:49.561332Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:48c13c72920ca17ecd4199b97909ea7e730beafa9ce39fd7d1b1b1c68e3c1dd5","observation_id":"3a721f1f-b528-43cd-9b49-b910113cc8c1","resolution":{"observed_at":"2026-05-21T13:00:09.819893Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14795","last_updated":"2025-02-21T08:09:14Z","snapshot_observed_at":"2026-08-03T14:55:39.031927Z","submitted_at":"2025-02-20T18:17:11Z","title":"Humanoid-VLA: Towards Universal Humanoid Control with Visual Integration","version":2},"cited_work":{"arxiv_id":"2502.14795","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.14795","snapshot_observed_at":"2026-07-03T20:38:55.564194Z","title":"Humanoid-vla: Towards universal humanoid control with visual inte- gration","venue":null,"work_id":"dbd2558e-19f1-460a-aec5-839bc04abeca","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2502.14795","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:5db6c0c7aa83a13d484139e2f0e0296918726f8669ab8ec95571154d164c4dd1","observation_id":"2843b0aa-9727-4034-a106-5d3bff1f88ab","resolution":{"observed_at":"2026-05-21T13:00:09.825098Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.15605","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T12:33:25.093042Z","title":"Srpo: Self-referential policy optimization for vision-language-action models","venue":null,"work_id":"5547ea6d-8228-4614-99ce-323e9ab3355a","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:7fd26b7e97a9e493fc54b0538d016f2f5d988421151b93546aa320312db3b16e","observation_id":"8b3cf350-377f-4801-b242-20b4adf402eb","resolution":{"observed_at":"2026-05-21T13:00:09.943727Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.13054","doi":"10.48550/arxiv.2510.13054","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Vla-0: Building state-of-the-art vlas with zero modification","venue":null,"work_id":"2b9209c3-c0fa-408b-9acf-06ab74e0ef7e","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:9377540c3b9b521f8f1aaa9b6dea84e14ddc5b08e806657b64f773e61e690092","observation_id":"f82c2aad-f36e-4573-be43-5453fa722962","resolution":{"observed_at":"2026-05-21T13:00:09.948808Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:468ab6e64af86466a0498c6b009e8a3f372fdbba6b84e365592a9df942f8cbf7","observation_id":"b207c2ce-82e7-45ea-878d-caf95d688861","resolution":{"observed_at":"2026-05-21T13:00:09.877521Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.22643","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:39:50.893920Z","title":"Vla-reasoner: Empowering vision-language-action models with reasoning via online monte carlo tree search","venue":null,"work_id":"453fdeea-8d60-41c4-99b7-3da24e4135c8","year":2026},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:7075c478b7ea6638cee13cba38d21d486e59ea1efebd2efcef4ec4620b07c72d","observation_id":"eaa56b9f-aad6-4800-98a0-4a53e04b47e6","resolution":{"observed_at":"2026-05-21T13:00:09.902948Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06769","last_updated":"2025-11-03T00:53:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-09T18:55:56Z","title":"Training Large Language Models to Reason in a Continuous Latent Space","version":3},"cited_work":{"arxiv_id":"2412.06769","doi":"10.48550/arxiv.2412.06769","metadata_source":"pith","pith_arxiv_id":"2412.06769","snapshot_observed_at":"2026-07-11T00:37:42.845448Z","title":"Training Large Language Models to Reason in a Continuous Latent Space","venue":"cs.CL","work_id":"3ddd0fd2-c176-408f-9b58-0666c2707f2d","year":2024},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2412.06769","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:0822157ef6d2876298ce2c19d12541819983284520ae789caa11f1b4af48e2dd","observation_id":"f0cc7abe-4ecd-4a84-8899-020d74d74d93","resolution":{"observed_at":"2026-05-21T13:00:09.872549Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:44.826594+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:44.826594+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16815","last_updated":"2025-09-18T16:26:53Z","snapshot_observed_at":"2026-08-03T17:16:24.219569Z","submitted_at":"2025-07-22T17:59:46Z","title":"ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning","version":2},"cited_work":{"arxiv_id":"2507.16815","doi":"10.48550/arxiv.2507.16815","metadata_source":"pith","pith_arxiv_id":"2507.16815","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning","venue":"cs.CV","work_id":"a5c17d1f-5739-41bd-bd90-0faf9424af13","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2507.16815","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:17b54f787a9d084b3405fd255e681a835d8fce95b5bfd64cfede97b3194396fe","observation_id":"14e156da-bc7c-4d62-92c7-27c5c93c74ea","resolution":{"observed_at":"2026-05-21T13:00:09.922795Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19854","last_updated":"2025-04-28T14:47:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-28T14:47:34Z","title":"NORA: A Small Open-Sourced Generalist Vision Language Action Model for Embodied Tasks","version":1},"cited_work":{"arxiv_id":"2504.19854","doi":"10.48550/arxiv.2504.19854","metadata_source":"pith","pith_arxiv_id":"2504.19854","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"NORA: A Small Open-Sourced Generalist Vision Language Action Model for Embodied Tasks","venue":"cs.RO","work_id":"1e89a464-b414-4d5c-a974-b2cb8be33053","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2504.19854","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:bc5235e393d1344599e624b449d4f3466d87fd696aa810bdac18f070b3ccade3","observation_id":"562aa024-58df-464a-823f-066859c496f7","resolution":{"observed_at":"2026-05-21T13:00:09.958097Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.14759","last_updated":"2025-11-19T04:34:49Z","snapshot_observed_at":"2026-07-06T22:36:13.287872Z","submitted_at":"2025-11-18T18:58:55Z","title":"$\\pi^{*}_{0.6}$: a VLA That Learns From Experience","version":2},"cited_work":{"arxiv_id":"2511.14759","doi":"10.15607/rss.2025.xxi.128","metadata_source":"pith","pith_arxiv_id":"2511.14759","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"$\\pi^{*}_{0.6}$: a VLA That Learns From Experience","venue":"cs.LG","work_id":"7c1b3355-694a-44c6-880f-631e897e1713","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2511.14759","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:51006d22e74887100184d13d13b9a77ad78144666ddfd5eece740be6e32aa0c4","observation_id":"fb9fa478-13d0-4ec9-b9ca-ca2f7c7e2e85","resolution":{"observed_at":"2026-05-21T13:00:09.863649Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.22414","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T18:47:31.689903Z","title":"Emergence of human to robot transfer in vision-language-action models.arXiv preprint arXiv:2512.22414","venue":null,"work_id":"88fc3778-faad-4626-887f-92a4c4e91800","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:1030f9ea54b96d529c247fac536d99764d444ae894eadb70d2638bea49f317b3","observation_id":"7feaa7fa-d48d-45e3-9943-bdf0ef59ee9e","resolution":{"observed_at":"2026-05-21T13:00:09.953953Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"cited_work":{"arxiv_id":"2502.19645","doi":"10.48550/arxiv.2502.19645","metadata_source":"pith","pith_arxiv_id":"2502.19645","snapshot_observed_at":"2026-07-10T23:37:42.946293Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","venue":"cs.RO","work_id":"04f46bb3-4346-47e8-bf09-c75d91f96e87","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2502.19645","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:be159ffcbee53fcf3e831c0f55bab2d5e48345da1b38d549be70e48ea98ee7eb","observation_id":"a2995e19-b286-431b-8389-ed660c291555","resolution":{"observed_at":"2026-05-21T13:00:09.983615Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23944","last_updated":"2025-07-01T01:36:05Z","snapshot_observed_at":"2026-07-06T21:49:52.050980Z","submitted_at":"2025-06-30T15:09:14Z","title":"Adapt Your Body: Mitigating Proprioception Shifts in Imitation Learning","version":2},"cited_work":{"arxiv_id":"2506.23944","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23944","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Not only rewards but also constraints: Applications on legged robot locomotion.TRO, 2024b","venue":null,"work_id":"932c94fa-42ff-4c76-90af-3cdf803ab087","year":null},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2506.23944","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:41d98ee139e057aa4908cf167bed7bd01a849dd577dd32d6d70663fb6b6cacf6","observation_id":"553266e8-9b48-40fd-9460-5071d629a452","resolution":{"observed_at":"2026-05-21T13:00:09.927300Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07917","last_updated":"2025-09-18T12:21:57Z","snapshot_observed_at":"2026-07-06T22:11:09.342568Z","submitted_at":"2025-08-11T12:32:45Z","title":"MolmoAct: Action Reasoning Models that can Reason in Space","version":4},"cited_work":{"arxiv_id":"2508.07917","doi":"10.48550/arxiv.2508.07917","metadata_source":"pith","pith_arxiv_id":"2508.07917","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"MolmoAct: Action Reasoning Models that can Reason in Space","venue":"cs.RO","work_id":"b59f318b-3e24-4914-8f24-2de331bbb6c5","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2508.07917","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:7fe3caa5017ab1b8bc0d780cb1b232a94b90863ea8de3a989c35198f6af2f571","observation_id":"8624a883-38a4-4a8c-a3dc-56efec558575","resolution":{"observed_at":"2026-05-21T13:00:09.933214Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.19816","doi":"10.48550/arxiv.2506.19816","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"CronusVLA: Towards Efficient and Robust Manipulation via Multi-Frame Vision-Language-Action Modeling, October 2025","venue":null,"work_id":"98421727-12e6-4220-9a07-01a1e8870d40","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:3aa2be933ed7062debe55f7dc63489912cfc51abce1e70c3a377cd72e9e718e5","observation_id":"340d6e3b-10d0-4dff-936f-89ffa78a0dec","resolution":{"observed_at":"2026-05-21T13:00:09.788929Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.00975","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T17:37:14.373264Z","title":"Mm-act: Learn from multimodal parallel generation to act.arXiv preprint arXiv:2512.00975","venue":null,"work_id":"b37a5d83-6140-4b55-bc71-06ddd97ee274","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:0888fff31540b602f27c28646c2b7d7b8fdba32ae2d6e738a013a62e62c6f75c","observation_id":"a004a340-b210-4fa3-a532-5fd319d6f2b5","resolution":{"observed_at":"2026-05-21T13:00:09.897990Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:45812b3cf2fd1c25120e870dc43e664345f74382d41404b26ed5adf4c57414cf","observation_id":"bb374873-0a04-4ebc-b858-0cd97984f424","resolution":{"observed_at":"2026-05-21T13:00:09.810733Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06951","last_updated":"2025-09-09T09:42:16Z","snapshot_observed_at":"2026-07-06T22:26:03.668339Z","submitted_at":"2025-09-08T17:58:30Z","title":"F1: A Vision-Language-Action Model Bridging Understanding and Generation to Actions","version":2},"cited_work":{"arxiv_id":"2509.06951","doi":"10.48550/arxiv.2509.06951","metadata_source":"pith","pith_arxiv_id":"2509.06951","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"F1: A Vision-Language-Action Model Bridging Understanding and Generation to Actions","venue":"cs.RO","work_id":"0557ae67-ef52-4cba-a579-208458bc2bbc","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2509.06951","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:53aa41d652c37ca408808a40138a66e5099204c4a184f219c4dc5b4ee43dc18a","observation_id":"10ea45f0-60d8-4f14-b5c3-0a5129e41dd5","resolution":{"observed_at":"2026-05-21T13:00:09.839448Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14093","last_updated":"2026-05-01T01:50:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-23T01:43:54Z","title":"A Survey on Vision-Language-Action Models for Embodied AI","version":8},"cited_work":{"arxiv_id":"2405.14093","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.14093","snapshot_observed_at":"2026-07-04T13:49:52.027583Z","title":"A Survey on Vision-Language-Action Models for Embodied AI","venue":"cs.RO","work_id":"9492fb3d-d667-4892-81bb-b2878f12ff0c","year":2024},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2405.14093","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:bf60efaa2c9d0091d75f38f8f44a0880d81f6a81aea2762b93a8a7ece7aa2eb8","observation_id":"81c2b160-50b1-46f6-adb6-5307249002d5","resolution":{"observed_at":"2026-05-21T13:00:09.966662Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06256","last_updated":"2025-04-08T17:58:47Z","snapshot_observed_at":"2026-08-03T00:43:33.310493Z","submitted_at":"2025-04-08T17:58:47Z","title":"Transfer between Modalities with MetaQueries","version":1},"cited_work":{"arxiv_id":"2504.06256","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06256","snapshot_observed_at":"2026-07-04T16:39:58.250680Z","title":"Transfer between Modalities with MetaQueries","venue":"cs.CV","work_id":"a89f31c1-6a3f-451e-9971-692c11219ea3","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2504.06256","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:dac2fa047d09de977b63c2378e0ed08df401a30092fffd966dede7c9052d9254","observation_id":"7f42c612-968c-4900-abd2-b075f39f4f38","resolution":{"observed_at":"2026-05-21T13:00:09.815233Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-07-10T11:47:02.947207Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:f0a4539f749882d970d5e708403b463aa2bda5c7ae549fff5fd835f1f434ea09","observation_id":"c2198c2b-e888-4d1f-b497-b45c68da367f","resolution":{"observed_at":"2026-05-21T13:00:09.805192Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-07-06T20:26:31.558337Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"cited_work":{"arxiv_id":"2501.15830","doi":"10.48550/arxiv.2501.15830","metadata_source":"pith","pith_arxiv_id":"2501.15830","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","venue":"cs.RO","work_id":"592041b3-3ca2-4836-8dd4-f8095d8a692b","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2501.15830","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:41e2841cb7485d077270ea04ea4a71146ff5b531c2ea037e3e64c00c50abdd07","observation_id":"5e275428-fc9b-4194-94da-00872201c09d","resolution":{"observed_at":"2026-05-21T13:00:09.974891Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.04996","last_updated":"2025-09-05T10:43:12Z","snapshot_observed_at":"2026-07-06T22:24:28.435288Z","submitted_at":"2025-09-05T10:43:12Z","title":"FLOWER: Democratizing Generalist Robot Policies with Efficient Vision-Language-Action Flow Policies","version":1},"cited_work":{"arxiv_id":"2509.04996","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.04996","snapshot_observed_at":"2026-07-04T13:09:50.096907Z","title":"E., Otto, F., and Lioutikov, R","venue":null,"work_id":"6e9d4312-6717-4e93-9f60-25ede1afe157","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2509.04996","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:73475d3da8d2da7fe6446be027db7581dd03af19e3a2a9b28f1830254b6ba77b","observation_id":"3e623b8b-dfec-4782-bb0b-0e1bece95321","resolution":{"observed_at":"2026-05-21T13:00:09.834452Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19236","last_updated":"2026-01-30T13:36:22Z","snapshot_observed_at":"2026-07-06T22:19:00.152099Z","submitted_at":"2025-08-26T17:57:16Z","title":"MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":"2508.19236","doi":"10.48550/arxiv.2508.19236","metadata_source":"pith","pith_arxiv_id":"2508.19236","snapshot_observed_at":"2026-07-10T23:37:43.221441Z","title":"MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation","venue":"cs.RO","work_id":"921d4c77-1e8b-489d-987a-1c0c990e5ce8","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2508.19236","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:171b9c491f9f2e04e08a30b92ca64838136a1025fc289aee76aee052283f349a","observation_id":"e4622c13-61b2-431f-a2fb-aa6d7df9ab69","resolution":{"observed_at":"2026-05-21T13:00:09.882340Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01844","last_updated":"2025-06-02T16:30:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-02T16:30:19Z","title":"SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics","version":1},"cited_work":{"arxiv_id":"2506.01844","doi":"10.48550/arxiv.2506.01844","metadata_source":"pith","pith_arxiv_id":"2506.01844","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics","venue":"cs.LG","work_id":"0c5e9314-5fa7-4613-ad12-605a71d561d2","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2506.01844","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:643f74efd729a52b24f4818fb026b6b198641f58281a1383aa47ddeb121718cd","observation_id":"f83a9739-9b9f-4adf-ae36-042adf8aab82","resolution":{"observed_at":"2026-05-21T13:00:09.892667Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20020","last_updated":"2025-03-25T19:02:56Z","snapshot_observed_at":"2026-08-02T07:15:58.798604Z","submitted_at":"2025-03-25T19:02:56Z","title":"Gemini Robotics: Bringing AI into the Physical World","version":1},"cited_work":{"arxiv_id":"2503.20020","doi":"10.48550/arxiv.2503.20020","metadata_source":"pith","pith_arxiv_id":"2503.20020","snapshot_observed_at":"2026-07-10T23:07:47.582320Z","title":"Gemini Robotics: Bringing AI into the Physical World","venue":"cs.RO","work_id":"f7c5ce10-8364-4fbe-964f-2802b81c3a98","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2503.20020","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:b994508d07b25b2aee39d2ec1216ce6863a0732ef481b94a987c633697c8a612","observation_id":"fee226ad-4cf7-4ec4-8e05-8746dc4aae4d","resolution":{"observed_at":"2026-05-21T13:00:09.848903Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":"2502.14786","doi":"10.48550/arxiv.2502.14786","metadata_source":"pith","pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","venue":"cs.CV","work_id":"50eec732-2d41-432f-9dcf-ac7fff235ea5","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:669ad93d86cf408e13c67f1be502bb390ab959861cf64fd569ee6fe4b139ad79","observation_id":"bb42da93-9506-4e30-bc3c-1fa1ea1ba714","resolution":{"observed_at":"2026-05-21T13:00:09.970523Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.16756","last_updated":"2026-04-20T08:04:22Z","snapshot_observed_at":"2026-07-31T21:59:49.485724Z","submitted_at":"2025-10-19T08:45:46Z","title":"End-to-end Listen, Look, Speak and Act","version":2},"cited_work":{"arxiv_id":"2510.16756","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.16756","snapshot_observed_at":"2026-07-03T16:28:39.153832Z","title":"End-to-end Listen, Look, Speak and Act","venue":"cs.AI","work_id":"bd3a5f38-a332-4580-bbaf-fb457fe99b72","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2510.16756","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:e49e098b3bbb3a367cc2e7409992eed7a6713fbad53c5fcc31ba9df87f3a8cd5","observation_id":"2d520977-76dd-4e28-b380-d883e3d437b3","resolution":{"observed_at":"2026-05-21T13:00:09.979464Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.24948","last_updated":"2026-04-27T05:41:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T15:45:19Z","title":"World-Env: Leveraging World Model as a Virtual Environment for VLA Post-Training","version":6},"cited_work":{"arxiv_id":"2509.24948","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.24948","snapshot_observed_at":"2026-07-10T08:36:59.803669Z","title":"World-Env: Leveraging World Model as a Virtual Environment for VLA Post-Training","venue":"cs.RO","work_id":"e43fb37f-61a0-4911-b5e5-880083d7aa30","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2509.24948","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:8cdff27473e5d52ad6fd5982cc70bafda0efd6c2aa08f677f6469deead799ed6","observation_id":"71c88fad-a9b5-4a7f-b2be-7ada6c9808c1","resolution":{"observed_at":"2026-05-21T13:00:09.868211Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.22242","doi":"10.48550/arxiv.2506.22242","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T23:37:43.033483Z","title":"4d-vla: Spatiotemporal vision-language-action pretraining with cross-scene calibration.arXiv preprint arXiv:2506.22242, 2025a","venue":null,"work_id":"3dffac62-c76b-4999-8a72-ea1206089f03","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:aec2d357c835a71457e00a63e62190b09f3471189cf42c9fa349e89fabf549e0","observation_id":"b231477a-b9f9-488e-a402-c4690cd96367","resolution":{"observed_at":"2026-05-21T13:00:09.795112Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.18644","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T20:16:29.409067Z","title":"Dreamvla: a vision-language-action model dreamed with comprehen- sive world knowledge","venue":null,"work_id":"3ca87b34-6674-47ef-8f34-9816d6a67535","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:55e5502b2510811a9c329d274748dac9911beedfefaff2d15a794531834203a3","observation_id":"bf431467-507b-4f2d-8d10-0212c85a8db3","resolution":{"observed_at":"2026-05-21T13:00:09.962649Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.18269","doi":"10.48550/arxiv.2508.18269","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Flowvla: Visual chain of thought-based motion reason- ing for vision-language-action models.arXiv preprint arXiv:2508.18269","venue":null,"work_id":"150f4b95-df48-44ae-b5c1-8fb05782abc4","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:9235e5fb07553ae9edb50fe2eead1a9bcf522f1b5a4156060b6969008318e055","observation_id":"563fcdf1-8af8-4374-a347-18814a6f7153","resolution":{"observed_at":"2026-05-21T13:00:09.858979Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"More Experimental Results A.1","venue":null,"work_id":"3c4b93f5-4a1a-4eb2-b77b-394ac4f5d035","year":2020},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:992840e962dc86be963becb47738fd131aa5a2c8d46012c58fb5d8fa8ebb3601","observation_id":"65c5a765-12b4-45d2-82a8-53d1723e8c90","resolution":{"observed_at":"2026-05-21T13:00:10.452298Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"primordial soup","venue":null,"work_id":"99324404-dda7-44cf-a834-84665a64a4d4","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:ab4c41eeb0417b589a9df6920e6b187fc6cc410d082ee1b125816dde25220260","observation_id":"bc88e369-620b-4fa8-a040-c67ca39c56a0","resolution":{"observed_at":"2026-05-21T13:00:10.455299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":1,"metadata_mismatch":5,"parse_uncertain":0,"unresolved":0,"verified_exact":34,"verified_fuzzy":1},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"thesis":"As of 3 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 6 inbound Pith citation observations for arXiv:2602.18532."}