{"as_of":"2026-08-13T21:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:593a0256ce67c30c3e8c43b1e3204d27927281896d47b905d692c7101e714138","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T04:48:39.069675Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T18:27:58.462125Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.19678","last_updated":"2026-05-19T11:10:20Z","snapshot_observed_at":"2026-08-11T18:07:37.597577Z","submitted_at":"2026-05-19T11:10:20Z","title":"RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2605.19678","doi":"10.48550/arxiv.2605.19678","metadata_source":"pith","pith_arxiv_id":"2605.19678","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models","venue":"cs.RO","work_id":"d381a1de-5669-41a4-8015-ef1676afd92f","year":2026},"citing_paper":{"arxiv_id":"2607.16636","last_updated":"2026-07-18T04:46:53Z","snapshot_observed_at":"2026-08-09T01:27:38.331708Z","submitted_at":"2026-07-18T04:46:53Z","title":"PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-01T20:28:18.919704Z"},"links":{"cited_paper":"/paper/2605.19678","citing_paper":"/paper/2607.16636"},"observation_digest":"sha256:cc85e4a852816562ba6649422500d8f58eef1e23affbcb439d7b7db8a6f7750e","observation_id":"5e01aef6-0534-4d92-b406-61603fcd4d26","resolution":{"observed_at":"2026-08-01T20:33:34.710891Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.19678","last_updated":"2026-05-19T11:10:20Z","snapshot_observed_at":"2026-08-11T18:07:37.597577Z","submitted_at":"2026-05-19T11:10:20Z","title":"RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.19678","snapshot_observed_at":"2026-08-04T06:10:33.302184Z","title":"Rovla: Multi-consistency constraints for robust vision-language-action models, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02497","last_updated":"2026-08-03T17:02:04Z","snapshot_observed_at":"2026-08-10T03:03:42.557157Z","submitted_at":"2026-08-03T17:02:04Z","title":"Grounded Semantic Re-Binding for Robust Instruction Generalization in Vision-Language-Action Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T06:10:33.302184Z"},"links":{"cited_paper":"/paper/2605.19678","citing_paper":"/paper/2608.02497"},"observation_digest":"sha256:304b8c37f74e1c0e5516cd3c0bbf3adafda4f7728413c94a442f436b1a83d94f","observation_id":"70fd44b0-e1af-4694-89c6-37006110f8a1","resolution":{"observed_at":"2026-08-04T06:10:33.302184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.19678","last_updated":"2026-05-19T11:10:20Z","snapshot_observed_at":"2026-08-11T18:07:37.597577Z","submitted_at":"2026-05-19T11:10:20Z","title":"RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.19678","snapshot_observed_at":"2026-08-04T05:07:02.883441Z","title":"2605.19678 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02545","last_updated":"2026-08-03T17:32:08Z","snapshot_observed_at":"2026-08-10T13:17:14.153204Z","submitted_at":"2026-08-03T17:32:08Z","title":"Probabilistic Reachable-Action Verification of Visuomotor Policies via Set-Based Training","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T05:07:02.883441Z"},"links":{"cited_paper":"/paper/2605.19678","citing_paper":"/paper/2608.02545"},"observation_digest":"sha256:29abc969ffbc579ecfbe938f452d286550500622f52160664e8ad22929cfea04","observation_id":"75fb5270-f809-4809-ac2d-dcdb8efcabcd","resolution":{"observed_at":"2026-08-04T05:07:02.883441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.19678","last_updated":"2026-05-19T11:10:20Z","snapshot_observed_at":"2026-08-11T18:07:37.597577Z","submitted_at":"2026-05-19T11:10:20Z","title":"RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.19678","snapshot_observed_at":"2026-08-11T18:27:58.462125Z","title":"InInternational Conference on Learning Representations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09381","last_updated":"2026-08-10T09:57:54Z","snapshot_observed_at":"2026-08-13T21:41:39.141064Z","submitted_at":"2026-08-10T09:57:54Z","title":"JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T18:27:58.462125Z"},"links":{"cited_paper":"/paper/2605.19678","citing_paper":"/paper/2608.09381"},"observation_digest":"sha256:6c2fd40815e517a3091e36010e66c494c2ded559cac65447ad5dcb9ecee5af10","observation_id":"926b2cab-789c-4ed3-8301-018a6cbbb54f","resolution":{"observed_at":"2026-08-11T18:27:58.462125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.19678/citation-record","integrity":"/paper/2605.19678/integrity","json":"/paper/2605.19678/citation-record.json","paper":"/paper/2605.19678"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robot manip- ulation based on embodied visual perception: A survey","venue":null,"work_id":"612c4531-f65b-4461-9cec-f1c9f27a2a0c","year":2025},"citing_paper":{"arxiv_id":"2605.19678","last_updated":"2026-05-19T11:10:20Z","snapshot_observed_at":"2026-08-11T18:07:37.597577Z","submitted_at":"2026-05-19T11:10:20Z","title":"RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-20T04:48:39.069675Z"},"links":{"citing_paper":"/paper/2605.19678"},"observation_digest":"sha256:57c119836819cecf4d5e5f9d246a2322a0d6105ca599dda853c8bb68f035c277","observation_id":"e57640bf-08e9-4183-ad62-debaad09c2fb","resolution":{"observed_at":"2026-05-20T04:53:22.505050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"c9e9268e-e75b-4fef-9c0d-86a9dde2631f","year":2021},"citing_paper":{"arxiv_id":"2605.19678","last_updated":"2026-05-19T11:10:20Z","snapshot_observed_at":"2026-08-11T18:07:37.597577Z","submitted_at":"2026-05-19T11:10:20Z","title":"RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-20T04:48:39.069675Z"},"links":{"citing_paper":"/paper/2605.19678"},"observation_digest":"sha256:4bf631c754a7252dddfd85e27947598a71ede442d98255ab836d7a50797badeb","observation_id":"d1acaf5d-ebe7-49fa-b3e8-ebc8a2b25beb","resolution":{"observed_at":"2026-05-20T04:53:22.469762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pointnet++: Deep hierarchical feature learn- ing on point sets in a metric space","venue":null,"work_id":"0569839d-362c-4ab7-8931-17e0a1486813","year":2017},"citing_paper":{"arxiv_id":"2605.19678","last_updated":"2026-05-19T11:10:20Z","snapshot_observed_at":"2026-08-11T18:07:37.597577Z","submitted_at":"2026-05-19T11:10:20Z","title":"RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-20T04:48:39.069675Z"},"links":{"citing_paper":"/paper/2605.19678"},"observation_digest":"sha256:2e507504c3b0f8ca5185326a1b2a25f9be2ed4cd27ef7379aa2ea9a9adb6f932","observation_id":"18cd10a6-cb70-42fb-b6f3-6442a03c0f72","resolution":{"observed_at":"2026-05-20T04:53:22.500887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dspnet: Dual-vision scene perception for robust 3d question answering","venue":null,"work_id":"07918f90-db87-4017-b3da-9ea46e34c9ab","year":2025},"citing_paper":{"arxiv_id":"2605.19678","last_updated":"2026-05-19T11:10:20Z","snapshot_observed_at":"2026-08-11T18:07:37.597577Z","submitted_at":"2026-05-19T11:10:20Z","title":"RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T04:48:39.069675Z"},"links":{"citing_paper":"/paper/2605.19678"},"observation_digest":"sha256:845a9162a145bdf27b9f40d7082367e57236468d652440906e499ab351ff8ed6","observation_id":"af129ecb-b1ec-4f44-b6d0-53f56b6f953c","resolution":{"observed_at":"2026-05-20T04:53:22.483514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12435","last_updated":"2025-02-18T02:11:03Z","snapshot_observed_at":"2026-08-13T04:59:10.086024Z","submitted_at":"2025-02-18T02:11:03Z","title":"A Survey on Large Language Models for Automated Planning","version":1},"cited_work":{"arxiv_id":"2502.12435","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.12435","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey on large language models for automated planning","venue":null,"work_id":"1e01433e-98da-45fb-8193-f877aa01521c","year":2025},"citing_paper":{"arxiv_id":"2605.19678","last_updated":"2026-05-19T11:10:20Z","snapshot_observed_at":"2026-08-11T18:07:37.597577Z","submitted_at":"2026-05-19T11:10:20Z","title":"RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-20T04:48:39.069675Z"},"links":{"cited_paper":"/paper/2502.12435","citing_paper":"/paper/2605.19678"},"observation_digest":"sha256:88376cc3124e23b850d6583b2c79562c31cdd40f878fffbb133a2076e254d49d","observation_id":"99f3fa20-5457-4054-a13a-3bc8c71d2708","resolution":{"observed_at":"2026-05-20T04:53:05.028904Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2605.19678","last_updated":"2026-05-19T11:10:20Z","snapshot_observed_at":"2026-08-11T18:07:37.597577Z","submitted_at":"2026-05-19T11:10:20Z","title":"RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-20T04:48:39.069675Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2605.19678"},"observation_digest":"sha256:e62870120f09cb7b1ed6ca3141d6d8e116fd6317b5eb5c761c27bebdeaf6844e","observation_id":"b41d9bf2-095e-4f6a-9512-fe5ff9f4ad38","resolution":{"observed_at":"2026-05-20T04:53:05.098240Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-08-13T04:48:56.237545Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":"2508.18265","doi":"10.48550/arxiv.2508.18265","metadata_source":"pith","pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","venue":"cs.CV","work_id":"b8f5e260-fff5-444e-bcf5-2c42cfefd83d","year":2025},"citing_paper":{"arxiv_id":"2605.19678","last_updated":"2026-05-19T11:10:20Z","snapshot_observed_at":"2026-08-11T18:07:37.597577Z","submitted_at":"2026-05-19T11:10:20Z","title":"RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T04:48:39.069675Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2605.19678"},"observation_digest":"sha256:0d628d60ec72b99bf3c17fe27fdc1554c411d9894b8f78002e1c7d36b6b57950","observation_id":"3db5227c-06f3-44f0-942b-b0599a6a8346","resolution":{"observed_at":"2026-05-20T04:53:04.955065Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-10T17:38:12.771444+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T17:38:12.771444+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":"f2b66d20-b8a8-4629-afd0-e8828f8f8bd6","year":2023},"citing_paper":{"arxiv_id":"2605.19678","last_updated":"2026-05-19T11:10:20Z","snapshot_observed_at":"2026-08-11T18:07:37.597577Z","submitted_at":"2026-05-19T11:10:20Z","title":"RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T04:48:39.069675Z"},"links":{"citing_paper":"/paper/2605.19678"},"observation_digest":"sha256:439fbe1781a3f2b69801c7cc00a15446427d860f6792aef02388ba1bee62a619","observation_id":"b4914052-5b62-4881-b68c-41af3e22c01a","resolution":{"observed_at":"2026-05-20T04:53:22.484971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":"2210.02747","doi":"10.1038/s41467-024-47656-z","metadata_source":"pith","pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flow Matching for Generative Modeling","venue":"cs.LG","work_id":"6edb71c4-5d64-40af-a394-9757ea051a36","year":2022},"citing_paper":{"arxiv_id":"2605.19678","last_updated":"2026-05-19T11:10:20Z","snapshot_observed_at":"2026-08-11T18:07:37.597577Z","submitted_at":"2026-05-19T11:10:20Z","title":"RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-20T04:48:39.069675Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2605.19678"},"observation_digest":"sha256:b2e5741f4e5644a4f081561f8e452da4268191afcf5230c741088da1bb7bd2c1","observation_id":"f2708e3c-5574-48c3-94c3-0094d5ab062b","resolution":{"observed_at":"2026-05-20T04:53:04.961336Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":"312e8c90-1d1d-4585-897e-3a7f25133324","year":2025},"citing_paper":{"arxiv_id":"2605.19678","last_updated":"2026-05-19T11:10:20Z","snapshot_observed_at":"2026-08-11T18:07:37.597577Z","submitted_at":"2026-05-19T11:10:20Z","title":"RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-20T04:48:39.069675Z"},"links":{"citing_paper":"/paper/2605.19678"},"observation_digest":"sha256:c4a710a756cf063c5d352cdaa85f4a7bbeeb15c1c177a10fa363e6a206ec8216","observation_id":"f875bbee-ee14-4c57-9460-60ec2d321e7d","resolution":{"observed_at":"2026-05-20T04:53:22.491411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01925","last_updated":"2025-07-02T17:34:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-02T17:34:52Z","title":"A Survey on Vision-Language-Action Models: An Action Tokenization Perspective","version":1},"cited_work":{"arxiv_id":"2507.01925","doi":"10.48550/arxiv.2507.01925","metadata_source":"pith","pith_arxiv_id":"2507.01925","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey on Vision-Language-Action Models: An Action Tokenization Perspective","venue":"cs.RO","work_id":"c1359daa-6e63-4d55-9d22-1575acbd787c","year":2025},"citing_paper":{"arxiv_id":"2605.19678","last_updated":"2026-05-19T11:10:20Z","snapshot_observed_at":"2026-08-11T18:07:37.597577Z","submitted_at":"2026-05-19T11:10:20Z","title":"RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-20T04:48:39.069675Z"},"links":{"cited_paper":"/paper/2507.01925","citing_paper":"/paper/2605.19678"},"observation_digest":"sha256:4ca5e593008b34123b761375de8dafe464cf3a7c6e0d894dfb07f28753e43445","observation_id":"9999ba4d-16d6-4794-83c8-b0537da292a3","resolution":{"observed_at":"2026-05-20T04:53:05.059092Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2605.19678","last_updated":"2026-05-19T11:10:20Z","snapshot_observed_at":"2026-08-11T18:07:37.597577Z","submitted_at":"2026-05-19T11:10:20Z","title":"RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T04:48:39.069675Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2605.19678"},"observation_digest":"sha256:c9567ba5c4af5ed371adb3ac867cb4c96ade1367bd01e33b2592ee0cb2043298","observation_id":"4a2abc5f-5600-481a-8793-8fb32cf11e7c","resolution":{"observed_at":"2026-05-20T04:53:05.034940Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2605.19678","last_updated":"2026-05-19T11:10:20Z","snapshot_observed_at":"2026-08-11T18:07:37.597577Z","submitted_at":"2026-05-19T11:10:20Z","title":"RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T04:48:39.069675Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2605.19678"},"observation_digest":"sha256:e909d4d84a29e23db9ff6ce7aeb28eb9f490df1558b03de6732f22f07cdb89dc","observation_id":"8ae1af9a-4cc1-4cd8-b608-32cbbeb489f5","resolution":{"observed_at":"2026-05-20T04:53:04.980530Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13778","last_updated":"2025-10-15T17:30:05Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:30:05Z","title":"InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy","version":1},"cited_work":{"arxiv_id":"2510.13778","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.13778","snapshot_observed_at":"2026-07-07T14:03:48.568825Z","title":"InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy","venue":"cs.RO","work_id":"8a11d29e-4bf8-4a9c-a97e-d87e7350dd9c","year":2025},"citing_paper":{"arxiv_id":"2605.19678","last_updated":"2026-05-19T11:10:20Z","snapshot_observed_at":"2026-08-11T18:07:37.597577Z","submitted_at":"2026-05-19T11:10:20Z","title":"RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-20T04:48:39.069675Z"},"links":{"cited_paper":"/paper/2510.13778","citing_paper":"/paper/2605.19678"},"observation_digest":"sha256:895b398f3b01adf64161ed4e0168ba25ec857223280978e8c0122c950f762ce5","observation_id":"8d9e74a5-ccef-4af3-9c75-182bc6dd3547","resolution":{"observed_at":"2026-05-20T04:53:04.948828Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":"2503.14734","doi":"10.48550/arxiv.2503.14734","metadata_source":"pith","pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","venue":"cs.RO","work_id":"e2db69c7-ee8a-4cb7-a761-7b8de1dfcf97","year":2025},"citing_paper":{"arxiv_id":"2605.19678","last_updated":"2026-05-19T11:10:20Z","snapshot_observed_at":"2026-08-11T18:07:37.597577Z","submitted_at":"2026-05-19T11:10:20Z","title":"RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-20T04:48:39.069675Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2605.19678"},"observation_digest":"sha256:820578e423e0b7801f8f2b6ca6a785fff1a6cc210acd2c50deef5e1cb7f05b33","observation_id":"3804e7f5-f1ed-46b1-b6a0-4fca197f46a0","resolution":{"observed_at":"2026-05-20T04:53:05.084084Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-07-12T08:49:11.206777+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T08:49:11.206777+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"𝜋0.5: a vision-language-action model with open-world generalization","venue":null,"work_id":"a1bf6008-3c47-4697-9b21-3ec778e6b37a","year":2025},"citing_paper":{"arxiv_id":"2605.19678","last_updated":"2026-05-19T11:10:20Z","snapshot_observed_at":"2026-08-11T18:07:37.597577Z","submitted_at":"2026-05-19T11:10:20Z","title":"RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-20T04:48:39.069675Z"},"links":{"citing_paper":"/paper/2605.19678"},"observation_digest":"sha256:6e759069eb054aaa35c05a73e44ffd13c1e0013df45eaf85579b660423636040","observation_id":"38d43cec-182e-4832-bbab-38dc98379317","resolution":{"observed_at":"2026-05-20T04:53:22.473722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GR00T N1.6: An Improved Open Foundation Model for Generalist Humanoid Robots","venue":null,"work_id":"a1702026-7fd0-4ddd-aba7-8cd49abd65e5","year":2025},"citing_paper":{"arxiv_id":"2605.19678","last_updated":"2026-05-19T11:10:20Z","snapshot_observed_at":"2026-08-11T18:07:37.597577Z","submitted_at":"2026-05-19T11:10:20Z","title":"RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-20T04:48:39.069675Z"},"links":{"citing_paper":"/paper/2605.19678"},"observation_digest":"sha256:ded8d7d7ba54a5208cfc11733bc47a226269cda49681c2c64956b003d8e28361","observation_id":"2ea9bde2-168c-42eb-8016-4e8055baa41d","resolution":{"observed_at":"2026-05-20T04:53:22.486709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":"2212.06817","doi":"10.48550/arxiv.2212.06817","metadata_source":"pith","pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","venue":"cs.RO","work_id":"e11bda85-8531-46bc-a07f-d0ade3643ab1","year":2022},"citing_paper":{"arxiv_id":"2605.19678","last_updated":"2026-05-19T11:10:20Z","snapshot_observed_at":"2026-08-11T18:07:37.597577Z","submitted_at":"2026-05-19T11:10:20Z","title":"RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-20T04:48:39.069675Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2605.19678"},"observation_digest":"sha256:f594784cff2031a673a86cfa56dfff3d8a1bc4fa86e57207932f60a59a388685","observation_id":"7f251330-dae6-420f-8dba-36fecf44ff78","resolution":{"observed_at":"2026-05-20T04:53:05.065003Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":"ca0b5e56-b831-43a1-939b-f7c657e4a40d","year":2023},"citing_paper":{"arxiv_id":"2605.19678","last_updated":"2026-05-19T11:10:20Z","snapshot_observed_at":"2026-08-11T18:07:37.597577Z","submitted_at":"2026-05-19T11:10:20Z","title":"RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-20T04:48:39.069675Z"},"links":{"citing_paper":"/paper/2605.19678"},"observation_digest":"sha256:089688f8ac60da92b92a86c4c1111121f548c90983ad0508bfc38f956563f8d3","observation_id":"a1cfc27f-2e73-4acd-8106-53cf64716e85","resolution":{"observed_at":"2026-05-20T04:53:22.465903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13626","last_updated":"2025-12-26T12:19:56Z","snapshot_observed_at":"2026-08-13T00:59:48.824306Z","submitted_at":"2025-10-15T14:51:36Z","title":"LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models","version":3},"cited_work":{"arxiv_id":"2510.13626","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.13626","snapshot_observed_at":"2026-07-10T12:47:05.553101Z","title":"LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models","venue":"cs.RO","work_id":"e35c8c6d-977d-4af1-963a-766ba98703ce","year":2025},"citing_paper":{"arxiv_id":"2605.19678","last_updated":"2026-05-19T11:10:20Z","snapshot_observed_at":"2026-08-11T18:07:37.597577Z","submitted_at":"2026-05-19T11:10:20Z","title":"RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-20T04:48:39.069675Z"},"links":{"cited_paper":"/paper/2510.13626","citing_paper":"/paper/2605.19678"},"observation_digest":"sha256:f97ce56977cc47921c3718aba15e79478beab643f6be0de6b95c7fbe9fee6c68","observation_id":"c20cca0b-4517-466a-94cb-990df1101f8a","resolution":{"observed_at":"2026-05-20T04:53:05.016329Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18088","last_updated":"2025-08-27T17:52:42Z","snapshot_observed_at":"2026-08-01T01:17:47.017808Z","submitted_at":"2025-06-22T16:26:53Z","title":"RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation","version":2},"cited_work":{"arxiv_id":"2506.18088","doi":"10.48550/arxiv.2506.18088","metadata_source":"pith","pith_arxiv_id":"2506.18088","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation","venue":"cs.RO","work_id":"9b985126-4a2f-4bdf-b014-2a7524ec634e","year":2025},"citing_paper":{"arxiv_id":"2605.19678","last_updated":"2026-05-19T11:10:20Z","snapshot_observed_at":"2026-08-11T18:07:37.597577Z","submitted_at":"2026-05-19T11:10:20Z","title":"RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-20T04:48:39.069675Z"},"links":{"cited_paper":"/paper/2506.18088","citing_paper":"/paper/2605.19678"},"observation_digest":"sha256:1d745f824f634b10096f7184073373a57fe4e58e6e79c601b83389d9c1c1b954","observation_id":"4eb40f09-a60f-4907-b16f-d8f321b61cea","resolution":{"observed_at":"2026-05-20T04:53:04.942661Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploring the adversarial vulnerabilities of vision-language-action models in robotics","venue":null,"work_id":"9c32e59f-56f3-49eb-aaac-7a0d7aabebbd","year":2025},"citing_paper":{"arxiv_id":"2605.19678","last_updated":"2026-05-19T11:10:20Z","snapshot_observed_at":"2026-08-11T18:07:37.597577Z","submitted_at":"2026-05-19T11:10:20Z","title":"RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-20T04:48:39.069675Z"},"links":{"citing_paper":"/paper/2605.19678"},"observation_digest":"sha256:683d173d234d1a0b7253512e165ec100af3740aea1f76a6b2e66d61263898795","observation_id":"d31d1d5e-4cfa-4f65-99fa-ecff09788d4d","resolution":{"observed_at":"2026-05-20T04:53:22.493662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.17520","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T04:16:48.695703Z","title":"Instructvla: Vision-language-action instruction tuning from understanding to manipulation","venue":null,"work_id":"66890618-d3a5-4d24-b379-ac9f40186769","year":2025},"citing_paper":{"arxiv_id":"2605.19678","last_updated":"2026-05-19T11:10:20Z","snapshot_observed_at":"2026-08-11T18:07:37.597577Z","submitted_at":"2026-05-19T11:10:20Z","title":"RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-20T04:48:39.069675Z"},"links":{"citing_paper":"/paper/2605.19678"},"observation_digest":"sha256:8c6a22011c4189c818c396febebfbc597af98164353d4fce883b5ac16698e833","observation_id":"7fac4a71-de89-4aaf-bb46-0c121708859f","resolution":{"observed_at":"2026-05-20T04:53:04.968738Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17016","last_updated":"2025-05-22T17:59:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:59:45Z","title":"Interactive Post-Training for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.17016","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.17016","snapshot_observed_at":"2026-07-04T20:50:12.325218Z","title":"Interactive Post-Training for Vision-Language-Action Models","venue":"cs.LG","work_id":"1ad0b2af-71bb-415b-b955-e3350f1a1ae8","year":2025},"citing_paper":{"arxiv_id":"2605.19678","last_updated":"2026-05-19T11:10:20Z","snapshot_observed_at":"2026-08-11T18:07:37.597577Z","submitted_at":"2026-05-19T11:10:20Z","title":"RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-20T04:48:39.069675Z"},"links":{"cited_paper":"/paper/2505.17016","citing_paper":"/paper/2605.19678"},"observation_digest":"sha256:a22388cc59b19d3353f20b7a88a1eaf1c3f967c37b706bbff5cb4adc32a62d4c","observation_id":"36728258-acf3-42fc-b438-0cc387b4ead3","resolution":{"observed_at":"2026-05-21T14:25:47.344448Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21539","last_updated":"2025-06-26T17:55:40Z","snapshot_observed_at":"2026-08-13T10:05:34.967093Z","submitted_at":"2025-06-26T17:55:40Z","title":"WorldVLA: Towards Autoregressive Action World Model","version":1},"cited_work":{"arxiv_id":"2506.21539","doi":"10.48550/arxiv.2506.21539","metadata_source":"pith","pith_arxiv_id":"2506.21539","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WorldVLA: Towards Autoregressive Action World Model","venue":"cs.RO","work_id":"d8c0c873-b2fc-44a5-a0c8-0d4a698783fb","year":2025},"citing_paper":{"arxiv_id":"2605.19678","last_updated":"2026-05-19T11:10:20Z","snapshot_observed_at":"2026-08-11T18:07:37.597577Z","submitted_at":"2026-05-19T11:10:20Z","title":"RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-20T04:48:39.069675Z"},"links":{"cited_paper":"/paper/2506.21539","citing_paper":"/paper/2605.19678"},"observation_digest":"sha256:7d67fe1abc375b59a9aff2ef27961671c14bfb39ef28bb229fa1ad3e586f7690","observation_id":"bdfc9829-895f-48e9-9865-735dd8eb8ebd","resolution":{"observed_at":"2026-05-20T04:53:04.936624Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-13T03:19:04.129258Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":"2506.19850","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-07-10T04:16:48.663138Z","title":"Unified vision-language-action model.arXiv preprint arXiv:2506.19850","venue":"cs.CV","work_id":"20c50f3e-aa1b-4b17-b04a-9432249085cd","year":2025},"citing_paper":{"arxiv_id":"2605.19678","last_updated":"2026-05-19T11:10:20Z","snapshot_observed_at":"2026-08-11T18:07:37.597577Z","submitted_at":"2026-05-19T11:10:20Z","title":"RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-20T04:48:39.069675Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2605.19678"},"observation_digest":"sha256:10777b5dccb016658328bb41eb2494e48c6618761de6ccf9bddc87f4d2845d99","observation_id":"8d9aed89-8314-4974-815b-6ecdb9d97484","resolution":{"observed_at":"2026-05-20T04:53:04.974302Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Aligning cyber space with physical world: A comprehensive survey on embodied ai","venue":null,"work_id":"efe3f850-c7d2-4e1e-87cc-39422eeede38","year":2025},"citing_paper":{"arxiv_id":"2605.19678","last_updated":"2026-05-19T11:10:20Z","snapshot_observed_at":"2026-08-11T18:07:37.597577Z","submitted_at":"2026-05-19T11:10:20Z","title":"RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-20T04:48:39.069675Z"},"links":{"citing_paper":"/paper/2605.19678"},"observation_digest":"sha256:3f2a6cd059a1a4e2f168703947a3d3cf58cff4c6bee27e95f9b34e8d224f63c5","observation_id":"d9def460-4881-4c81-a809-3ed73587fa4b","resolution":{"observed_at":"2026-05-20T04:53:22.444517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models: Open x-embodiment collaboration 0","venue":null,"work_id":"3f0c5f15-c500-4048-a8eb-b3bcd83f6700","year":2024},"citing_paper":{"arxiv_id":"2605.19678","last_updated":"2026-05-19T11:10:20Z","snapshot_observed_at":"2026-08-11T18:07:37.597577Z","submitted_at":"2026-05-19T11:10:20Z","title":"RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-20T04:48:39.069675Z"},"links":{"citing_paper":"/paper/2605.19678"},"observation_digest":"sha256:caf4f7dd2081c89e371bed0706ef4784a528f1d25501e509fcd06410657f10f7","observation_id":"5adfb2df-49cb-4ed2-8800-96e320924b09","resolution":{"observed_at":"2026-05-20T04:53:22.466587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":"2405.12213","doi":"10.48550/arxiv.2405.12213","metadata_source":"pith","pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Octo: An Open-Source Generalist Robot Policy","venue":"cs.RO","work_id":"f9ca0722-8855-48c3-a27a-0eefb7e19253","year":2024},"citing_paper":{"arxiv_id":"2605.19678","last_updated":"2026-05-19T11:10:20Z","snapshot_observed_at":"2026-08-11T18:07:37.597577Z","submitted_at":"2026-05-19T11:10:20Z","title":"RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-20T04:48:39.069675Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2605.19678"},"observation_digest":"sha256:79ecb287640f5c421d43dc09f227cc13fce83a065f11d65b57c46a28e3df0d0e","observation_id":"100cdfe6-13e6-4f98-a106-dacec8f07232","resolution":{"observed_at":"2026-05-20T04:53:04.921971Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06669","last_updated":"2025-08-04T04:50:21Z","snapshot_observed_at":"2026-08-04T23:08:22.516431Z","submitted_at":"2025-03-09T15:40:29Z","title":"AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems","version":4},"cited_work":{"arxiv_id":"2503.06669","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.06669","snapshot_observed_at":"2026-07-10T23:07:47.895730Z","title":"AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems","venue":"cs.RO","work_id":"f797e9ec-510f-43a7-8a0c-18009ce332e5","year":2025},"citing_paper":{"arxiv_id":"2605.19678","last_updated":"2026-05-19T11:10:20Z","snapshot_observed_at":"2026-08-11T18:07:37.597577Z","submitted_at":"2026-05-19T11:10:20Z","title":"RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-20T04:48:39.069675Z"},"links":{"cited_paper":"/paper/2503.06669","citing_paper":"/paper/2605.19678"},"observation_digest":"sha256:bdfc702008eb7cbbfc164c8a763075e7c7c55530be5f75f71c5675418bb93399","observation_id":"de6ad2ba-2729-45f1-b6b7-23bbae718b82","resolution":{"observed_at":"2026-05-20T04:53:04.994309Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.14759","last_updated":"2025-11-19T04:34:49Z","snapshot_observed_at":"2026-07-06T22:36:13.287872Z","submitted_at":"2025-11-18T18:58:55Z","title":"$\\pi^{*}_{0.6}$: a VLA That Learns From Experience","version":2},"cited_work":{"arxiv_id":"2511.14759","doi":"10.15607/rss.2025.xxi.128","metadata_source":"pith","pith_arxiv_id":"2511.14759","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi^{*}_{0.6}$: a VLA That Learns From Experience","venue":"cs.LG","work_id":"7c1b3355-694a-44c6-880f-631e897e1713","year":2025},"citing_paper":{"arxiv_id":"2605.19678","last_updated":"2026-05-19T11:10:20Z","snapshot_observed_at":"2026-08-11T18:07:37.597577Z","submitted_at":"2026-05-19T11:10:20Z","title":"RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-20T04:48:39.069675Z"},"links":{"cited_paper":"/paper/2511.14759","citing_paper":"/paper/2605.19678"},"observation_digest":"sha256:6025c65de69ea353a9d6d85abd5d2bc2cfd69851ec899f69b5c4a311231ec2e6","observation_id":"1bbed8e8-9328-4cbb-9cdf-cc0c8222db22","resolution":{"observed_at":"2026-05-20T04:53:04.916497Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"cited_work":{"arxiv_id":"2502.19645","doi":"10.48550/arxiv.2502.19645","metadata_source":"pith","pith_arxiv_id":"2502.19645","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","venue":"cs.RO","work_id":"04f46bb3-4346-47e8-bf09-c75d91f96e87","year":2025},"citing_paper":{"arxiv_id":"2605.19678","last_updated":"2026-05-19T11:10:20Z","snapshot_observed_at":"2026-08-11T18:07:37.597577Z","submitted_at":"2026-05-19T11:10:20Z","title":"RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-20T04:48:39.069675Z"},"links":{"cited_paper":"/paper/2502.19645","citing_paper":"/paper/2605.19678"},"observation_digest":"sha256:e00bf222439148a6fcc663a1a4ef78349f463f14167ef549171aabb2a70b9f5f","observation_id":"aaae344f-c28c-4e9c-adf7-157f92a7a0d1","resolution":{"observed_at":"2026-05-20T04:53:04.988204Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2605.19678","last_updated":"2026-05-19T11:10:20Z","snapshot_observed_at":"2026-08-11T18:07:37.597577Z","submitted_at":"2026-05-19T11:10:20Z","title":"RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-20T04:48:39.069675Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2605.19678"},"observation_digest":"sha256:f6d90b38f693cade4c862e2da6f44d19423005cbda7e54e7e38ca850826bb5ca","observation_id":"63d9bbee-b054-4230-8624-9a32f21dd066","resolution":{"observed_at":"2026-05-20T04:53:05.053263Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vlatest: Testing and evaluating vision-language-action models for robotic manipulation","venue":null,"work_id":"9140679c-21f5-48c7-b660-ef8ab93cbbcc","year":2025},"citing_paper":{"arxiv_id":"2605.19678","last_updated":"2026-05-19T11:10:20Z","snapshot_observed_at":"2026-08-11T18:07:37.597577Z","submitted_at":"2026-05-19T11:10:20Z","title":"RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-20T04:48:39.069675Z"},"links":{"citing_paper":"/paper/2605.19678"},"observation_digest":"sha256:427284e53292d9106b0c4c2029f5b69b7a9a1b3df2e868cd01fc486ad3cc7993","observation_id":"2973567a-d2b0-4726-94cb-f1b680de1706","resolution":{"observed_at":"2026-05-20T04:53:22.502640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.17502","last_updated":"2026-05-30T03:49:39Z","snapshot_observed_at":"2026-08-03T20:59:48.866420Z","submitted_at":"2025-11-21T18:59:32Z","title":"RynnVLA-002: A Unified Vision-Language-Action and World Model","version":3},"cited_work":{"arxiv_id":"2511.17502","doi":"10.48550/arxiv.2511.17502","metadata_source":"pith","pith_arxiv_id":"2511.17502","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rynnvla-002: A unified vision-language-action and world model","venue":"cs.RO","work_id":"f28355c2-726f-4492-899f-be74df2c09cd","year":2025},"citing_paper":{"arxiv_id":"2605.19678","last_updated":"2026-05-19T11:10:20Z","snapshot_observed_at":"2026-08-11T18:07:37.597577Z","submitted_at":"2026-05-19T11:10:20Z","title":"RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-20T04:48:39.069675Z"},"links":{"cited_paper":"/paper/2511.17502","citing_paper":"/paper/2605.19678"},"observation_digest":"sha256:1be49645537c27bf8d8e4676b5856c93be952689abfd7366b77f4f8d90995784","observation_id":"430ae5d8-3844-4f86-887b-010754764c0b","resolution":{"observed_at":"2026-06-02T02:03:36.254972Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13030","last_updated":"2025-12-25T08:16:05Z","snapshot_observed_at":"2026-07-06T22:38:59.725645Z","submitted_at":"2025-12-15T06:58:40Z","title":"Motus: A Unified Latent Action World Model","version":2},"cited_work":{"arxiv_id":"2512.13030","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.13030","snapshot_observed_at":"2026-07-10T04:16:48.690751Z","title":"Motus: A Unified Latent Action World Model","venue":"cs.CV","work_id":"d0b2d257-524d-4d67-9daf-5fb43e5e977a","year":2025},"citing_paper":{"arxiv_id":"2605.19678","last_updated":"2026-05-19T11:10:20Z","snapshot_observed_at":"2026-08-11T18:07:37.597577Z","submitted_at":"2026-05-19T11:10:20Z","title":"RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-20T04:48:39.069675Z"},"links":{"cited_paper":"/paper/2512.13030","citing_paper":"/paper/2605.19678"},"observation_digest":"sha256:3d8c1eb090a27efd20f121856dd94f13251367948c19f4f5bdfccd92d0d48e32","observation_id":"e962c671-c9d7-4baa-b19e-ac5311ca4fd9","resolution":{"observed_at":"2026-05-20T04:53:04.909357Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2605.19678","last_updated":"2026-05-19T11:10:20Z","snapshot_observed_at":"2026-08-11T18:07:37.597577Z","submitted_at":"2026-05-19T11:10:20Z","title":"RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-20T04:48:39.069675Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2605.19678"},"observation_digest":"sha256:0c281cc6760dbd6e96155cc8f153e673faad33cb0ff4008ef51543605987e74b","observation_id":"56dc571f-f0fb-4aed-8b64-3999e63c1f19","resolution":{"observed_at":"2026-05-20T04:53:05.074152Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09674","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T17:59:17Z","title":"SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2509.09674","doi":"10.48550/arxiv.2509.09674","metadata_source":"pith","pith_arxiv_id":"2509.09674","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning","venue":"cs.RO","work_id":"56dc8355-0011-4fd6-8f89-a6ef5cb6933f","year":2025},"citing_paper":{"arxiv_id":"2605.19678","last_updated":"2026-05-19T11:10:20Z","snapshot_observed_at":"2026-08-11T18:07:37.597577Z","submitted_at":"2026-05-19T11:10:20Z","title":"RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-20T04:48:39.069675Z"},"links":{"cited_paper":"/paper/2509.09674","citing_paper":"/paper/2605.19678"},"observation_digest":"sha256:1c03fcb6307eb99f41cfed73fdb3b184a1e46d2069f9b8dff199bc92e6042b87","observation_id":"7fd2a87a-9997-4dc3-9544-66ab4c0c7f21","resolution":{"observed_at":"2026-05-20T04:53:05.009602Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.01331","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T20:20:07.048446Z","title":"Robustvla: Robustness- aware reinforcement post-training for vision-language-action models","venue":null,"work_id":"0dc2b282-cb02-4893-8e55-f69f3ebe8a88","year":2025},"citing_paper":{"arxiv_id":"2605.19678","last_updated":"2026-05-19T11:10:20Z","snapshot_observed_at":"2026-08-11T18:07:37.597577Z","submitted_at":"2026-05-19T11:10:20Z","title":"RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-20T04:48:39.069675Z"},"links":{"citing_paper":"/paper/2605.19678"},"observation_digest":"sha256:c9c0afe4276649b839ecb513b3df17dc4a29ae602cf283a8f1ead44a889d0b5f","observation_id":"1b34c62f-a977-4c36-b31c-df5317b9ebfd","resolution":{"observed_at":"2026-05-20T04:53:04.928533Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mean teachers are better role models: Weight- averaged consistency targets improve semi-supervised deep learning results","venue":null,"work_id":"6960cc0f-4fa9-4cf8-a089-282cc65f2dbb","year":2017},"citing_paper":{"arxiv_id":"2605.19678","last_updated":"2026-05-19T11:10:20Z","snapshot_observed_at":"2026-08-11T18:07:37.597577Z","submitted_at":"2026-05-19T11:10:20Z","title":"RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-20T04:48:39.069675Z"},"links":{"citing_paper":"/paper/2605.19678"},"observation_digest":"sha256:81181d9ccff026e0c3585095ea77603b438f180af27aeac97eb090f3247e1d91","observation_id":"967c2efc-9665-496c-bb1a-d3a15c81b749","resolution":{"observed_at":"2026-05-20T04:53:22.490131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Virtual adversarial training: a regularization method for supervised and semi-supervised learning","venue":null,"work_id":"f5f8d155-a55b-41a1-9b4e-a6ebed92106c","year":1979},"citing_paper":{"arxiv_id":"2605.19678","last_updated":"2026-05-19T11:10:20Z","snapshot_observed_at":"2026-08-11T18:07:37.597577Z","submitted_at":"2026-05-19T11:10:20Z","title":"RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-20T04:48:39.069675Z"},"links":{"citing_paper":"/paper/2605.19678"},"observation_digest":"sha256:da5aec7f243d2cd839fa5aac757b8603a6872fd4f42aed42a7a956729d09d4c9","observation_id":"9f6a548f-18fb-4bcb-8ec1-ea1abdd79833","resolution":{"observed_at":"2026-05-20T04:53:22.481359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fixmatch: Simplifying semi-supervised learning with consistency and confidence","venue":null,"work_id":"5d69296a-c46d-42eb-bc9d-826032a474cc","year":2020},"citing_paper":{"arxiv_id":"2605.19678","last_updated":"2026-05-19T11:10:20Z","snapshot_observed_at":"2026-08-11T18:07:37.597577Z","submitted_at":"2026-05-19T11:10:20Z","title":"RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-20T04:48:39.069675Z"},"links":{"citing_paper":"/paper/2605.19678"},"observation_digest":"sha256:a22559caca16622a79a01d410e042b53d2a700c1e80119ad2de4339de825e4f2","observation_id":"044070dc-4a57-4f35-84b8-249db13d47d0","resolution":{"observed_at":"2026-05-20T04:53:22.497406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Image augmentation is all you need: Reg- ularizing deep reinforcement learning from pixels","venue":null,"work_id":"0189dc2e-1015-467f-94b5-bf1f21fca6fc","year":2020},"citing_paper":{"arxiv_id":"2605.19678","last_updated":"2026-05-19T11:10:20Z","snapshot_observed_at":"2026-08-11T18:07:37.597577Z","submitted_at":"2026-05-19T11:10:20Z","title":"RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-20T04:48:39.069675Z"},"links":{"citing_paper":"/paper/2605.19678"},"observation_digest":"sha256:dc0f67a77af8a27f92582dd5652746f6f823cc124c3a29a32d9a7c47cd5e359c","observation_id":"62bfdd38-53b8-4dfe-b9e2-150272b6debf","resolution":{"observed_at":"2026-05-20T04:53:22.488231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.06083","last_updated":"2019-09-04T18:53:10Z","snapshot_observed_at":"2026-08-07T14:27:46.872660Z","submitted_at":"2017-06-19T17:53:11Z","title":"Towards Deep Learning Models Resistant to Adversarial Attacks","version":4},"cited_work":{"arxiv_id":"1706.06083","doi":"10.48550/arxiv.1706.06083","metadata_source":"pith","pith_arxiv_id":"1706.06083","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards Deep Learning Models Resistant to Adversarial Attacks","venue":"stat.ML","work_id":"b20a57fa-4b7d-40ec-8b6a-ce48234630de","year":2017},"citing_paper":{"arxiv_id":"2605.19678","last_updated":"2026-05-19T11:10:20Z","snapshot_observed_at":"2026-08-11T18:07:37.597577Z","submitted_at":"2026-05-19T11:10:20Z","title":"RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-20T04:48:39.069675Z"},"links":{"cited_paper":"/paper/1706.06083","citing_paper":"/paper/2605.19678"},"observation_digest":"sha256:4dffc963a69a48896f37223fcb5f2f98e989d25c99330df0109f5542cdcd722d","observation_id":"6be07c4e-cdab-407c-a83f-ea04d3444c97","resolution":{"observed_at":"2026-05-20T04:53:05.090887Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6572","last_updated":"2015-03-20T20:19:16Z","snapshot_observed_at":"2026-08-12T17:13:46.394331Z","submitted_at":"2014-12-20T01:17:12Z","title":"Explaining and Harnessing Adversarial Examples","version":3},"cited_work":{"arxiv_id":"1412.6572","doi":"10.48550/arxiv.1412.6572","metadata_source":"pith","pith_arxiv_id":"1412.6572","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Explaining and Harnessing Adversarial Examples","venue":"stat.ML","work_id":"2cedf8f6-7539-4c49-8136-f42a20487146","year":2014},"citing_paper":{"arxiv_id":"2605.19678","last_updated":"2026-05-19T11:10:20Z","snapshot_observed_at":"2026-08-11T18:07:37.597577Z","submitted_at":"2026-05-19T11:10:20Z","title":"RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-20T04:48:39.069675Z"},"links":{"cited_paper":"/paper/1412.6572","citing_paper":"/paper/2605.19678"},"observation_digest":"sha256:d5dcfc06e95b7af8e0b39a728a05dd976cb9536c6025aa4f4b518b057977555e","observation_id":"8ea2901a-c186-40e0-bcb5-984fc0e36e62","resolution":{"observed_at":"2026-05-20T04:53:05.040820Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Libero: Benchmarking knowledge transfer for lifelong robot learning","venue":null,"work_id":"2905289b-bb20-4150-9df5-1f167e32ad69","year":2023},"citing_paper":{"arxiv_id":"2605.19678","last_updated":"2026-05-19T11:10:20Z","snapshot_observed_at":"2026-08-11T18:07:37.597577Z","submitted_at":"2026-05-19T11:10:20Z","title":"RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-20T04:48:39.069675Z"},"links":{"citing_paper":"/paper/2605.19678"},"observation_digest":"sha256:ac4811e378c9f4479d8c635a28f1d6f9698467d04b22001d13c932cf99493a5f","observation_id":"5e8f34f8-3642-4613-a558-7c3dacab4437","resolution":{"observed_at":"2026-05-20T04:53:22.498790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":"1711.05101","doi":"10.1137/1.9781611972825.47","metadata_source":"pith","pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Decoupled Weight Decay Regularization","venue":"cs.LG","work_id":"07ef7360-d385-4033-83f7-8384a6325204","year":2017},"citing_paper":{"arxiv_id":"2605.19678","last_updated":"2026-05-19T11:10:20Z","snapshot_observed_at":"2026-08-11T18:07:37.597577Z","submitted_at":"2026-05-19T11:10:20Z","title":"RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-20T04:48:39.069675Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2605.19678"},"observation_digest":"sha256:fbb869585fcb70e46a0458db12854594f81d211bc11879c114333e8e79a0fc82","observation_id":"bc487d13-178a-4d5a-b86a-e50d35ff3eed","resolution":{"observed_at":"2026-05-20T04:53:05.021961Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.19678","last_updated":"2026-05-19T11:10:20Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-11T18:07:37.597577Z","submitted_at":"2026-05-19T11:10:20Z","title":"RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":28,"verified_fuzzy":18},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 4 inbound Pith citation observations for arXiv:2605.19678."}