{"as_of":"2026-08-10T19:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1f670910983ed211155bb9af128330bd75770df1294568200a5144a1112bd876","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":20,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:16:10.945513Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T14:25:47.243057Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.19757","last_updated":"2025-09-06T18:16:04Z","snapshot_observed_at":"2026-08-07T16:38:03.790732Z","submitted_at":"2025-03-25T15:19:56Z","title":"Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy","version":2},"cited_work":{"arxiv_id":"2503.19757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.19757","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dita: Scaling diffusion transformer for generalist vision-language-action policy","venue":null,"work_id":"3b62b17b-cf99-4d53-8589-9eca22c28d28","year":2025},"citing_paper":{"arxiv_id":"2505.17016","last_updated":"2025-05-22T17:59:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:59:45Z","title":"Interactive Post-Training for Vision-Language-Action Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T14:25:47.178714Z"},"links":{"cited_paper":"/paper/2503.19757","citing_paper":"/paper/2505.17016"},"observation_digest":"sha256:a8740b7e863ecd5822d3b8595af6a450fd24b344549276ea10af28086f39dfca","observation_id":"45883420-8b1b-49c5-b289-cdd0952cddb7","resolution":{"observed_at":"2026-05-21T14:25:47.245817Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19757","last_updated":"2025-09-06T18:16:04Z","snapshot_observed_at":"2026-08-07T16:38:03.790732Z","submitted_at":"2025-03-25T15:19:56Z","title":"Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19757","snapshot_observed_at":"2026-08-07T12:16:10.945513Z","title":"Dita: Scaling diffusion transformer for generalist vision-language-action policy.arXiv preprint arXiv:2503.19757, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:10.945513Z"},"links":{"cited_paper":"/paper/2503.19757","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:2433f9eb86928e8ce2a36d78f708881e96faa5c78ec0f28e9a391fbf7338d787","observation_id":"ae01a1b4-d01c-473e-8aa0-0758d5d666d8","resolution":{"observed_at":"2026-08-07T12:16:10.945513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19757","last_updated":"2025-09-06T18:16:04Z","snapshot_observed_at":"2026-08-07T16:38:03.790732Z","submitted_at":"2025-03-25T15:19:56Z","title":"Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy","version":2},"cited_work":{"arxiv_id":"2503.19757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.19757","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dita: Scaling diffusion transformer for generalist vision-language-action policy","venue":null,"work_id":"3b62b17b-cf99-4d53-8589-9eca22c28d28","year":2025},"citing_paper":{"arxiv_id":"2506.13456","last_updated":"2026-05-13T10:49:00Z","snapshot_observed_at":"2026-08-07T16:19:33.135284Z","submitted_at":"2025-06-16T13:14:58Z","title":"Block-wise Adaptive Caching for Accelerating Diffusion Policy","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-19T09:36:09.790248Z"},"links":{"cited_paper":"/paper/2503.19757","citing_paper":"/paper/2506.13456"},"observation_digest":"sha256:68de7095fe43729f0c9e981f31b52ebe3773093c74f07285f45dade0a6639ee1","observation_id":"81c2056a-eaf7-420e-95d3-022c4fd77128","resolution":{"observed_at":"2026-05-19T09:37:13.968090Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19757","last_updated":"2025-09-06T18:16:04Z","snapshot_observed_at":"2026-08-07T16:38:03.790732Z","submitted_at":"2025-03-25T15:19:56Z","title":"Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy","version":2},"cited_work":{"arxiv_id":"2503.19757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.19757","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dita: Scaling diffusion transformer for generalist vision-language-action policy","venue":null,"work_id":"3b62b17b-cf99-4d53-8589-9eca22c28d28","year":2025},"citing_paper":{"arxiv_id":"2507.04447","last_updated":"2025-08-26T08:23:50Z","snapshot_observed_at":"2026-08-05T16:56:52.400110Z","submitted_at":"2025-07-06T16:14:29Z","title":"DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge","version":3},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-16T15:42:41.363422Z"},"links":{"cited_paper":"/paper/2503.19757","citing_paper":"/paper/2507.04447"},"observation_digest":"sha256:154b7cc84e26607da0e41d2bb0c1ee6f823454df6806ae1d28064d5ea3dc0145","observation_id":"529a2236-55b9-43e9-bbd7-244fb6f8dbf0","resolution":{"observed_at":"2026-05-16T15:42:41.584985Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19757","last_updated":"2025-09-06T18:16:04Z","snapshot_observed_at":"2026-08-07T16:38:03.790732Z","submitted_at":"2025-03-25T15:19:56Z","title":"Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19757","snapshot_observed_at":"2026-08-05T21:16:50.629382Z","title":"Dita: Scaling diffusion transformer for generalist vision-language- action policy","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-05T21:16:50.629382Z"},"links":{"cited_paper":"/paper/2503.19757","citing_paper":"/paper/2508.09071"},"observation_digest":"sha256:5538d6bb614ebc6e29ce3afe187ffd641a1c9c631674e8e4880b2d81db1d16a7","observation_id":"8779decc-64d5-427b-a144-f8ce6795cb08","resolution":{"observed_at":"2026-08-05T21:16:50.629382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19757","last_updated":"2025-09-06T18:16:04Z","snapshot_observed_at":"2026-08-07T16:38:03.790732Z","submitted_at":"2025-03-25T15:19:56Z","title":"Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19757","snapshot_observed_at":"2026-08-05T20:35:43.793652Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10257","last_updated":"2025-08-14T00:51:36Z","snapshot_observed_at":"2026-08-09T19:01:56.593721Z","submitted_at":"2025-08-14T00:51:36Z","title":"Source Component Shift Adaptation via Offline Decomposition and Online Mixing Approach","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T20:35:43.793652Z"},"links":{"cited_paper":"/paper/2503.19757","citing_paper":"/paper/2508.10257"},"observation_digest":"sha256:3fdf50ba714c8bf109b83ad0e52a604da46941b3514c310a533fae9ef3519410","observation_id":"cd0ec015-300b-4053-aadc-25259e758238","resolution":{"observed_at":"2026-08-05T20:35:43.793652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19757","last_updated":"2025-09-06T18:16:04Z","snapshot_observed_at":"2026-08-07T16:38:03.790732Z","submitted_at":"2025-03-25T15:19:56Z","title":"Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19757","snapshot_observed_at":"2026-08-05T20:38:40.247428Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10259","last_updated":"2025-08-14T00:57:58Z","snapshot_observed_at":"2026-08-08T01:00:17.824912Z","submitted_at":"2025-08-14T00:57:58Z","title":"Leveraging OS-Level Primitives for Robotic Action Management","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T20:38:40.247428Z"},"links":{"cited_paper":"/paper/2503.19757","citing_paper":"/paper/2508.10259"},"observation_digest":"sha256:99860b5bcb20af4bc95117c06a03aff386f9cbddad97ac47a72697d2db129388","observation_id":"77f6fd8f-3d92-47dc-981a-a7cbc7c3b8b9","resolution":{"observed_at":"2026-08-05T20:38:40.247428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19757","last_updated":"2025-09-06T18:16:04Z","snapshot_observed_at":"2026-08-07T16:38:03.790732Z","submitted_at":"2025-03-25T15:19:56Z","title":"Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19757","snapshot_observed_at":"2026-08-05T14:42:32.628932Z","title":"Dita: Scaling diffusion transformer for generalist vision-language-action policy.arXiv preprint arXiv:2503.19757, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.21046","last_updated":"2026-05-27T08:39:30Z","snapshot_observed_at":"2026-08-05T14:42:31.889948Z","submitted_at":"2025-08-28T17:50:58Z","title":"CogVLA: Cognition-Aligned Vision-Language-Action Model via Instruction-Driven Routing & Sparsification","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:32.628932Z"},"links":{"cited_paper":"/paper/2503.19757","citing_paper":"/paper/2508.21046"},"observation_digest":"sha256:bb0c90568df3a73624cc24824f58cc04db3e1286ef49248709c6e43945dec5ce","observation_id":"9c4cbf47-44f7-46b8-8c6b-00ce61b3bda3","resolution":{"observed_at":"2026-08-05T14:42:32.628932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19757","last_updated":"2025-09-06T18:16:04Z","snapshot_observed_at":"2026-08-07T16:38:03.790732Z","submitted_at":"2025-03-25T15:19:56Z","title":"Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19757","snapshot_observed_at":"2026-08-05T12:02:28.274529Z","title":"Dita: Scaling diffusion transformer for generalist vision-language-action policy.arXiv preprint arXiv:2503.19757,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02055","last_updated":"2025-09-05T06:24:50Z","snapshot_observed_at":"2026-08-09T00:35:41.059622Z","submitted_at":"2025-09-02T07:51:59Z","title":"Align-Then-stEer: Adapting the Vision-Language Action Models through Unified Latent Guidance","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-05T12:02:28.274529Z"},"links":{"cited_paper":"/paper/2503.19757","citing_paper":"/paper/2509.02055"},"observation_digest":"sha256:ef28204a02261748458f7f6a43a067e4b79f647fe2dbbf1f0da3c44f858a57d0","observation_id":"1d7a26cb-bc20-4393-9bc1-12fc57289878","resolution":{"observed_at":"2026-08-05T12:02:28.274529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19757","last_updated":"2025-09-06T18:16:04Z","snapshot_observed_at":"2026-08-07T16:38:03.790732Z","submitted_at":"2025-03-25T15:19:56Z","title":"Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19757","snapshot_observed_at":"2026-08-05T10:30:23.552915Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-10T04:02:44.332056Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.552915Z"},"links":{"cited_paper":"/paper/2503.19757","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:28e9f55d62ac59373ef4d481550a434947b38042224a54aa2287e2ff2851423f","observation_id":"ce01b314-0f73-42dd-81e9-bb2039a2668e","resolution":{"observed_at":"2026-08-05T10:30:23.552915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19757","last_updated":"2025-09-06T18:16:04Z","snapshot_observed_at":"2026-08-07T16:38:03.790732Z","submitted_at":"2025-03-25T15:19:56Z","title":"Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy","version":2},"cited_work":{"arxiv_id":"2503.19757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.19757","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dita: Scaling diffusion transformer for generalist vision-language-action policy","venue":null,"work_id":"3b62b17b-cf99-4d53-8589-9eca22c28d28","year":2025},"citing_paper":{"arxiv_id":"2511.14148","last_updated":"2026-05-07T13:40:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-18T05:21:11Z","title":"AsyncVLA: Asynchronous Flow Matching for Vision-Language-Action Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-17T21:28:18.630934Z"},"links":{"cited_paper":"/paper/2503.19757","citing_paper":"/paper/2511.14148"},"observation_digest":"sha256:084ad5cf87a7fddc15ca066e329014c9b1a86bcb617842da34f3232c900ca299","observation_id":"a3f25050-fd4b-489d-9bea-fcd5afbff5ed","resolution":{"observed_at":"2026-05-17T21:30:18.245994Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19757","last_updated":"2025-09-06T18:16:04Z","snapshot_observed_at":"2026-08-07T16:38:03.790732Z","submitted_at":"2025-03-25T15:19:56Z","title":"Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy","version":2},"cited_work":{"arxiv_id":"2503.19757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.19757","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dita: Scaling diffusion transformer for generalist vision-language-action policy","venue":null,"work_id":"3b62b17b-cf99-4d53-8589-9eca22c28d28","year":2025},"citing_paper":{"arxiv_id":"2601.16163","last_updated":"2026-01-22T18:09:30Z","snapshot_observed_at":"2026-08-06T02:05:52.408905Z","submitted_at":"2026-01-22T18:09:30Z","title":"Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T14:50:12.804707Z"},"links":{"cited_paper":"/paper/2503.19757","citing_paper":"/paper/2601.16163"},"observation_digest":"sha256:609e778f6dfcae3852da3a7d56d3eb467c5a6738afaa9eb5cc242c89a9a75912","observation_id":"867a5f79-f679-49e5-9187-90e85b92fdf8","resolution":{"observed_at":"2026-05-12T14:50:12.928751Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19757","last_updated":"2025-09-06T18:16:04Z","snapshot_observed_at":"2026-08-07T16:38:03.790732Z","submitted_at":"2025-03-25T15:19:56Z","title":"Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19757","snapshot_observed_at":"2026-08-03T03:56:04.338230Z","title":"Dita: Scaling diffusion transformer for generalist vision-language-action policy","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.06575","last_updated":"2026-07-06T12:11:10Z","snapshot_observed_at":"2026-08-03T03:56:00.008362Z","submitted_at":"2026-02-06T10:16:22Z","title":"Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:04.338230Z"},"links":{"cited_paper":"/paper/2503.19757","citing_paper":"/paper/2602.06575"},"observation_digest":"sha256:4ddd4f6e58370ad8bcb4b5aec4c7559e5a0e0a9aad04886f00e04444ef3d8bb5","observation_id":"c4026ade-74dc-4276-8eaf-1bf3f6496f0c","resolution":{"observed_at":"2026-08-03T03:56:04.338230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19757","last_updated":"2025-09-06T18:16:04Z","snapshot_observed_at":"2026-08-07T16:38:03.790732Z","submitted_at":"2025-03-25T15:19:56Z","title":"Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19757","snapshot_observed_at":"2026-08-02T20:18:05.038317Z","title":"Dita: Scaling diffusion transformer for generalist vision-language-action policy","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-08T06:33:40.080560Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:05.038317Z"},"links":{"cited_paper":"/paper/2503.19757","citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:5545e0c0121bbe10cf0441292a69925716f7ee584665e880bc66fa9a3f367564","observation_id":"7f3888f9-e553-430c-aa38-42c8124f6990","resolution":{"observed_at":"2026-08-02T20:18:05.038317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19757","last_updated":"2025-09-06T18:16:04Z","snapshot_observed_at":"2026-08-07T16:38:03.790732Z","submitted_at":"2025-03-25T15:19:56Z","title":"Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy","version":2},"cited_work":{"arxiv_id":"2503.19757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.19757","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dita: Scaling diffusion transformer for generalist vision-language-action policy","venue":null,"work_id":"3b62b17b-cf99-4d53-8589-9eca22c28d28","year":2025},"citing_paper":{"arxiv_id":"2604.21331","last_updated":"2026-05-05T14:40:04Z","snapshot_observed_at":"2026-08-02T17:23:17.670041Z","submitted_at":"2026-04-23T06:37:22Z","title":"FingerViP: Learning Real-World Dexterous Manipulation with Fingertip Visual Perception","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-09T22:00:06.298685Z"},"links":{"cited_paper":"/paper/2503.19757","citing_paper":"/paper/2604.21331"},"observation_digest":"sha256:e990fecb532e6c0d79fdfbc6756af392c8fafec25f04b0bc9591cc4f46bd3dee","observation_id":"f42c87c8-2ccc-48bc-9c1d-ecf8e8e44b1c","resolution":{"observed_at":"2026-05-11T14:21:06.529823Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19757","last_updated":"2025-09-06T18:16:04Z","snapshot_observed_at":"2026-08-07T16:38:03.790732Z","submitted_at":"2025-03-25T15:19:56Z","title":"Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy","version":2},"cited_work":{"arxiv_id":"2503.19757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.19757","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dita: Scaling diffusion transformer for generalist vision-language-action policy","venue":null,"work_id":"3b62b17b-cf99-4d53-8589-9eca22c28d28","year":2025},"citing_paper":{"arxiv_id":"2605.05126","last_updated":"2026-05-06T16:55:44Z","snapshot_observed_at":"2026-07-06T23:17:48.161262Z","submitted_at":"2026-05-06T16:55:44Z","title":"ConsisVLA-4D: Advancing Spatiotemporal Consistency in Efficient 3D-Perception and 4D-Reasoning for Robotic Manipulation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-08T16:40:19.057979Z"},"links":{"cited_paper":"/paper/2503.19757","citing_paper":"/paper/2605.05126"},"observation_digest":"sha256:4d45d279f21e4d05c406ae02c96cc58324bec5f4908cf5ca081df5dada4e78ae","observation_id":"ecf86412-32d0-4d38-a605-6e5ac4a440c0","resolution":{"observed_at":"2026-05-11T18:06:06.263709Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19757","last_updated":"2025-09-06T18:16:04Z","snapshot_observed_at":"2026-08-07T16:38:03.790732Z","submitted_at":"2025-03-25T15:19:56Z","title":"Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy","version":2},"cited_work":{"arxiv_id":"2503.19757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.19757","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dita: Scaling diffusion transformer for generalist vision-language-action policy","venue":null,"work_id":"3b62b17b-cf99-4d53-8589-9eca22c28d28","year":2025},"citing_paper":{"arxiv_id":"2605.07381","last_updated":"2026-05-08T07:35:24Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:35:24Z","title":"Escaping the Diversity Trap in Robotic Manipulation via Anchor-Centric Adaptation","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-11T02:25:23.710842Z"},"links":{"cited_paper":"/paper/2503.19757","citing_paper":"/paper/2605.07381"},"observation_digest":"sha256:0a1f3896465807a1bf116bf8f88db99c525e3b5f7322307da6a400005154a585","observation_id":"a2ccbabb-8d6a-4879-9fec-c936219a8c24","resolution":{"observed_at":"2026-05-11T02:25:53.215480Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19757","last_updated":"2025-09-06T18:16:04Z","snapshot_observed_at":"2026-08-07T16:38:03.790732Z","submitted_at":"2025-03-25T15:19:56Z","title":"Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy","version":2},"cited_work":{"arxiv_id":"2503.19757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.19757","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dita: Scaling diffusion transformer for generalist vision-language-action policy","venue":null,"work_id":"3b62b17b-cf99-4d53-8589-9eca22c28d28","year":2025},"citing_paper":{"arxiv_id":"2605.11665","last_updated":"2026-07-28T11:54:22Z","snapshot_observed_at":"2026-08-02T14:19:47.159631Z","submitted_at":"2026-05-12T07:26:39Z","title":"Nautilus: From One Prompt to Plug-and-Play Robot Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-13T01:05:44.188530Z"},"links":{"cited_paper":"/paper/2503.19757","citing_paper":"/paper/2605.11665"},"observation_digest":"sha256:2703444fa09b822aa05b2d52dc9adaaf9184d3d3c7d9a598f7ed54675818959a","observation_id":"d53dc7d5-3131-4113-b37b-d60799f5d88c","resolution":{"observed_at":"2026-05-13T01:07:00.139142Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19757","last_updated":"2025-09-06T18:16:04Z","snapshot_observed_at":"2026-08-07T16:38:03.790732Z","submitted_at":"2025-03-25T15:19:56Z","title":"Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19757","snapshot_observed_at":"2026-08-02T14:19:51.313611Z","title":"Dita: Scaling diffusion transformer for generalist vision-language-action policy.arXiv preprint arXiv:2503.19757, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.11665","last_updated":"2026-07-28T11:54:22Z","snapshot_observed_at":"2026-08-02T14:19:47.159631Z","submitted_at":"2026-05-12T07:26:39Z","title":"Nautilus: From One Prompt to Plug-and-Play Robot Learning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T14:19:51.313611Z"},"links":{"cited_paper":"/paper/2503.19757","citing_paper":"/paper/2605.11665"},"observation_digest":"sha256:ef0de4928d1f0d690993f0d250d9aec920ae546c725c29b56380be6f10c034cc","observation_id":"9c652f31-f114-43ee-b75b-03749e6410f7","resolution":{"observed_at":"2026-08-02T14:19:51.313611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19757","last_updated":"2025-09-06T18:16:04Z","snapshot_observed_at":"2026-08-07T16:38:03.790732Z","submitted_at":"2025-03-25T15:19:56Z","title":"Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy","version":2},"cited_work":{"arxiv_id":"2503.19757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.19757","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dita: Scaling diffusion transformer for generalist vision-language-action policy","venue":null,"work_id":"3b62b17b-cf99-4d53-8589-9eca22c28d28","year":2025},"citing_paper":{"arxiv_id":"2605.17486","last_updated":"2026-05-17T14:55:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-17T14:55:32Z","title":"DyGRO-VLA: Cross-Task Scaling of Vision-Language-Action Models via Dynamic Grouped Residual Optimization","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-20T12:39:50.004269Z"},"links":{"cited_paper":"/paper/2503.19757","citing_paper":"/paper/2605.17486"},"observation_digest":"sha256:28f3ea44f36aac84aaac8c210c20058b61cb6321b71828f111ab22dd224211f2","observation_id":"87a5084d-c753-4d62-ab24-8d4b5e328164","resolution":{"observed_at":"2026-05-20T12:43:16.973759Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2503.19757/citation-record","integrity":"/paper/2503.19757/integrity","json":"/paper/2503.19757/citation-record.json","paper":"/paper/2503.19757"},"outbound":[],"paper":{"arxiv_id":"2503.19757","last_updated":"2025-09-06T18:16:04Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-07T16:38:03.790732Z","submitted_at":"2025-03-25T15:19:56Z","title":"Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 20 inbound Pith citation observations for arXiv:2503.19757."}