{"as_of":"2026-08-19T09:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:18ccf3186bd8d459cad3d3362dc62c4bea91f725593fff7f393a947c8665c213","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T17:20:58.997506Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T17:35:40.081807Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-17T21:20:17.200356Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"cited_work":{"arxiv_id":"2508.13103","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.13103","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grounding actions in camera space: Observation-centric vision-language-action policy","venue":null,"work_id":"799a65a0-2738-4979-910f-2cc9c6af150e","year":2025},"citing_paper":{"arxiv_id":"2511.17001","last_updated":"2026-05-13T17:20:33Z","snapshot_observed_at":"2026-08-15T02:24:47.525419Z","submitted_at":"2025-11-21T07:10:31Z","title":"Unify Robot Actions in Camera Frame","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-17T21:16:51.909363Z"},"links":{"cited_paper":"/paper/2508.13103","citing_paper":"/paper/2511.17001"},"observation_digest":"sha256:f82b88e0f9e9f5433964baf4bb611ead7deb0f6ecc9bf7426d523c8ffc74e327","observation_id":"cb4fe4bc-0492-4874-81b6-d0d012b26025","resolution":{"observed_at":"2026-05-17T21:20:17.204124Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"cited_work":{"arxiv_id":"2508.13103","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.13103","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grounding actions in camera space: Observation-centric vision-language-action policy","venue":null,"work_id":"799a65a0-2738-4979-910f-2cc9c6af150e","year":2025},"citing_paper":{"arxiv_id":"2604.21241","last_updated":"2026-07-05T14:51:02Z","snapshot_observed_at":"2026-07-12T18:39:48.745028Z","submitted_at":"2026-04-23T03:17:50Z","title":"CorridorVLA: Explicit Spatial Constraints for Generative Action Heads via Sparse Anchors","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-09T22:07:24.208555Z"},"links":{"cited_paper":"/paper/2508.13103","citing_paper":"/paper/2604.21241"},"observation_digest":"sha256:531bcf4e229d8523f466252f43686b29649f560b53e791bb843d46a3e515297f","observation_id":"10dc769e-4614-447e-be7e-30a273905e7a","resolution":{"observed_at":"2026-05-11T14:16:25.882356Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.13103","snapshot_observed_at":"2026-07-12T18:39:49.173828Z","title":"Grounding actions in camera space: Observation-centric vision-language-action policy,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.21241","last_updated":"2026-07-05T14:51:02Z","snapshot_observed_at":"2026-07-12T18:39:48.745028Z","submitted_at":"2026-04-23T03:17:50Z","title":"CorridorVLA: Explicit Spatial Constraints for Generative Action Heads via Sparse Anchors","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-12T18:39:49.173828Z"},"links":{"cited_paper":"/paper/2508.13103","citing_paper":"/paper/2604.21241"},"observation_digest":"sha256:98a0c6f1a1ce5b7f330337b07deb43bbf1eed8f4990c040467eaa3e9c06cedb4","observation_id":"700ee7b0-2398-431f-ac70-b38bf1fa5d0c","resolution":{"observed_at":"2026-07-12T18:39:49.173828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.13103","snapshot_observed_at":"2026-08-10T17:35:40.081807Z","title":"Zhang, H","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06965","last_updated":"2026-08-07T08:41:31Z","snapshot_observed_at":"2026-08-14T14:11:02.151355Z","submitted_at":"2026-08-07T08:41:31Z","title":"Cross-View Action Consistency for Camera-Robust Vision-Language-Action Policies","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T17:35:40.081807Z"},"links":{"cited_paper":"/paper/2508.13103","citing_paper":"/paper/2608.06965"},"observation_digest":"sha256:15dcf05292c2fb09d3d96d0f796750364626426587880440738a39b27b6a71e9","observation_id":"3c5b2d5d-7484-41fd-b0d1-f98a5ad20c98","resolution":{"observed_at":"2026-08-10T17:35:40.081807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.13103/citation-record","integrity":"/paper/2508.13103/integrity","json":"/paper/2508.13103/citation-record.json","paper":"/paper/2508.13103"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:20:59.782570Z","title":"4\" FUNCTION default.is.dash.repeated.names #1 FUNCTION default.name.format.string","venue":null,"work_id":"620f1664-8b35-4b3e-964e-5cb9bb1195e5","year":2003},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.738794Z"},"links":{"citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:b8ec05fd315bfdf085e4704ec72651f0ddb345ce89083d787b02bfdeef60d227","observation_id":"d85a76ce-9693-48c6-bfb0-b800b98b7e45","resolution":{"observed_at":"2026-08-15T17:20:59.786970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:20:58.744008Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.744008Z"},"links":{"citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:e177593951fffadaae12bbf90ed7133e6407119f97d89e77e2cb7d4e6431f26d","observation_id":"9f2509d9-f7a6-49bb-aa1c-665aac7f6649","resolution":{"observed_at":"2026-08-15T17:20:58.744008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-15T17:20:58.748350Z","title":"Brohan, N","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.748350Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:7bba0b81b045f19c3c4c54a02a000f213d3d81685ac0b53d6fffa497f9ee501f","observation_id":"48b5803c-ac39-4333-918c-d40671f9e2ac","resolution":{"observed_at":"2026-08-15T17:20:58.748350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-08-16T21:53:14.144225Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-15T17:20:58.752671Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.752671Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:ee8ac0618d8f634bd36955f99fe409948b1b0e469a661ececfd3884afa0deba4","observation_id":"734b01f0-f168-4917-8cba-58bf6431d86f","resolution":{"observed_at":"2026-08-15T17:20:58.752671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-08-14T08:22:11.295012Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-15T17:20:58.756736Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.756736Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:d5c685222537568eaf89138737d4fe8ae76a7a8ede12f37f2c58ababa88bc08a","observation_id":"23354231-5499-4c66-8595-2e6a3e19a374","resolution":{"observed_at":"2026-08-15T17:20:58.756736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01823","last_updated":"2024-06-01T01:54:54Z","snapshot_observed_at":"2026-08-15T10:07:25.118684Z","submitted_at":"2024-03-04T08:16:11Z","title":"RT-H: Action Hierarchies Using Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01823","snapshot_observed_at":"2026-08-15T17:20:58.760786Z","title":"Belkhale, T","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.760786Z"},"links":{"cited_paper":"/paper/2403.01823","citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:726c560dda28af619df4e8c8a64b3cec75bb1033b290b1467df27cb54202a08f","observation_id":"dddb3e91-544a-4ed8-9d89-f076557ec2e4","resolution":{"observed_at":"2026-08-15T17:20:58.760786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-08-16T17:53:54.636855Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-15T17:20:58.764768Z","title":"Black, N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.764768Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:e9f4aadf2c2401be7bbb39085787e986d70f47c1b9e6e8ae73841032d927b02d","observation_id":"fa9071f4-453a-4c30-88f2-a3b46583fa9c","resolution":{"observed_at":"2026-08-15T17:20:58.764768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19757","last_updated":"2025-09-06T18:16:04Z","snapshot_observed_at":"2026-08-16T12:46:56.834354Z","submitted_at":"2025-03-25T15:19:56Z","title":"Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19757","snapshot_observed_at":"2026-08-15T17:20:58.769098Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.769098Z"},"links":{"cited_paper":"/paper/2503.19757","citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:4cf0219357c41a6e7dff73a417b4711498de19762bff1bb04f28b0f7db1029f6","observation_id":"3834d317-7c77-4a80-85f6-af2a9466ee0e","resolution":{"observed_at":"2026-08-15T17:20:58.769098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:20:59.764843Z","title":"O’Neill, A","venue":null,"work_id":"ab1914de-d681-4be0-9e48-6fc5cbe82149","year":2024},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.772747Z"},"links":{"citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:6f6cc78aad6aab35601643d9526c2531a89cb556d9d2c08573464fccba254603","observation_id":"9acb5f3b-5285-4121-8b04-d1df902c316f","resolution":{"observed_at":"2026-08-15T17:20:59.768740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:20:59.754892Z","title":null,"venue":null,"work_id":"c38ebe6a-4c35-49f5-a444-92f9cd499082","year":2023},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.776588Z"},"links":{"citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:606ba95f99afc565123a71550d96ea89b69f05ffe5f5cec198480e2a0988a09d","observation_id":"3ca030ed-ce2f-45fc-82dd-4373e3ece7bb","resolution":{"observed_at":"2026-08-15T17:20:59.758405Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12945","last_updated":"2025-04-22T17:57:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-19T17:48:38Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12945","snapshot_observed_at":"2026-08-15T17:20:58.780368Z","title":"Khazatsky, K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.780368Z"},"links":{"cited_paper":"/paper/2403.12945","citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:a29972ff1648c0662938e7456559ef21e6a7546a624c635ea1021cf663836d77","observation_id":"9a8114fe-0a7b-4afc-af96-7d5ed672a3c5","resolution":{"observed_at":"2026-08-15T17:20:58.780368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-15T17:20:58.784060Z","title":"Brohan, N","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.784060Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:e301764540a44e60001420087e386c680189440f332d933a018336e9ea7a2790","observation_id":"7ef80c0a-27a0-42cd-88e4-c054994dd4c5","resolution":{"observed_at":"2026-08-15T17:20:58.784060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:20:59.743946Z","title":"Kroemer, S","venue":null,"work_id":"b8d43b28-e369-4c62-b7c9-716d041d6391","year":2021},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.787946Z"},"links":{"citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:5e0d8b79278ff411c95b8a120ac4ba4a76320a1f623a45b93c449e347ea6074b","observation_id":"cfd8da52-0ebb-4a16-b9ba-d1fb25567db9","resolution":{"observed_at":"2026-08-15T17:20:59.747977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01534","last_updated":"2024-05-02T17:59:31Z","snapshot_observed_at":"2026-08-18T12:59:13.253536Z","submitted_at":"2024-05-02T17:59:31Z","title":"Plan-Seq-Learn: Language Model Guided RL for Solving Long Horizon Robotics Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01534","snapshot_observed_at":"2026-08-15T17:20:58.791408Z","title":"Dalal, T","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.791408Z"},"links":{"cited_paper":"/paper/2405.01534","citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:59666bb8bf2487285d72160b70bf927531209363eb0666b577f63a65d343e972","observation_id":"10549dd3-a620-47d7-a082-e86f3f2ab065","resolution":{"observed_at":"2026-08-15T17:20:58.791408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:20:59.732470Z","title":"Yamada, Y","venue":null,"work_id":"a9d297c3-e194-41db-a432-4d220e1d4c6c","year":2021},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.795123Z"},"links":{"citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:26b95961e9bac23a389c70217dd33e189edfd6af15f35c5648624311ae64d74f","observation_id":"20019985-bdd6-48c0-878a-9bfa32ad0a36","resolution":{"observed_at":"2026-08-15T17:20:59.736360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2008.07792","last_updated":"2021-03-26T04:44:22Z","snapshot_observed_at":"2026-08-13T21:49:56.525925Z","submitted_at":"2020-08-18T08:05:15Z","title":"ReLMoGen: Leveraging Motion Generation in Reinforcement Learning for Mobile Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.07792","snapshot_observed_at":"2026-08-15T17:20:58.798696Z","title":null,"venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.798696Z"},"links":{"cited_paper":"/paper/2008.07792","citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:bad1f2a2c2afb761fe2606244dde37392afe19248ca14f7e6df4d41e0a80c115","observation_id":"8d954c0f-f57f-4d8a-99e4-f84ed3273d49","resolution":{"observed_at":"2026-08-15T17:20:58.798696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:20:59.721807Z","title":"Shridhar, L","venue":null,"work_id":"0ed41a6e-707a-4b6c-81ec-2033fe34ed26","year":2022},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.802552Z"},"links":{"citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:28bb8c7e1844599df62b6db1dbc955f3eb0548612a39629155d727f8143dc7a9","observation_id":"30061129-5f04-4f11-b1f4-6df388d5f1c6","resolution":{"observed_at":"2026-08-15T17:20:59.725438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:20:59.710593Z","title":"1em plus 0.5em minus 0.4em PMLR, 2023, pp","venue":null,"work_id":"0ae475e4-392e-420b-9a4f-4ca12aabaae4","year":2023},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.806237Z"},"links":{"citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:c0440f899aea52646f2ec9fd4c0b26643fe0d0d141d5420c8555b738a16595e9","observation_id":"67326880-6e9d-4d4a-aab0-9819958d8cb5","resolution":{"observed_at":"2026-08-15T17:20:59.714489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:20:59.698241Z","title":null,"venue":null,"work_id":"df748f04-9de2-4fe6-b155-6381b7d30b34","year":2024},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.810306Z"},"links":{"citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:375b7def9013ab1a5633e941a0415d797129e48f29caf2d73304e83b9791c081","observation_id":"ee1037bd-3e72-422f-8a97-ed3b136b9992","resolution":{"observed_at":"2026-08-15T17:20:59.701937Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:20:59.686845Z","title":null,"venue":null,"work_id":"b4a77b99-1ead-4732-a3f4-c5db82639ee4","year":2024},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.813744Z"},"links":{"citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:ea08838d4aa60d8791e0cdf75e4673415ea4558e462bbc77312b577e7457583b","observation_id":"00f2c73a-a693-49c1-a132-dbdac4a44cb0","resolution":{"observed_at":"2026-08-15T17:20:59.690616Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:20:59.675057Z","title":"Singh, V","venue":null,"work_id":"d657acc2-ed9c-47c0-a5bc-fdbb4bd61fb8","year":2023},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.817071Z"},"links":{"citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:1fc52785a21f1577eea0585ec986917c3c47548d7074b2f955df27f0785400e1","observation_id":"d40f5942-a82f-4e1a-8bac-3f7af25819b2","resolution":{"observed_at":"2026-08-15T17:20:59.679196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-08-13T00:43:50.403870Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-15T17:20:58.820651Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.820651Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:545cead2acf2a96cb5c73b3341c3caee91d9915fb2f5ab6a813eb49a9fcb49a9","observation_id":"e2c743aa-aa58-461a-ac72-d5b9b86cea18","resolution":{"observed_at":"2026-08-15T17:20:58.820651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-13T15:09:51.205767Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-15T17:20:58.824487Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.824487Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:d74576421574b5a73a794904ab05ceb73190c068ca78571ca73912321a27aed7","observation_id":"8bc92a44-f2b0-4e57-97a0-8e62412361e2","resolution":{"observed_at":"2026-08-15T17:20:58.824487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-08-17T12:53:34.218587Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15830","snapshot_observed_at":"2026-08-15T17:20:58.828433Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.828433Z"},"links":{"cited_paper":"/paper/2501.15830","citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:d11e66f3c61d79dc779b8b6c8fe6acb27af55ee2016f2008720e5436f03e16e0","observation_id":"2887d720-1e8e-40c6-958b-4226c0c30297","resolution":{"observed_at":"2026-08-15T17:20:58.828433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-12T23:18:51.506083Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-15T17:20:58.832177Z","title":"Cheang, G","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.832177Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:3cdba0442cb34c6713d0fbe7a0be2b428c154d334462a99e47429f3e8b2ca4eb","observation_id":"7c897f87-319f-476d-b7e9-9ef03a48c61d","resolution":{"observed_at":"2026-08-15T17:20:58.832177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:20:59.663245Z","title":null,"venue":null,"work_id":"0fc4db11-89a2-439c-abfe-575e27060884","year":2023},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.837248Z"},"links":{"citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:efb0b53d0a54f7f578c8311fb79d80bf12115b1827f5226d96c0c5a576a28849","observation_id":"f72dd4de-f631-4155-93ad-cffd7ff8bcbe","resolution":{"observed_at":"2026-08-15T17:20:59.667004Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-14T18:47:26.721223Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-15T17:20:58.844841Z","title":"Driess, F","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.844841Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:d83513aa13f836bbfabf891211fd2f6c1d5b11ef376eac82bd3139b6bce7d8e4","observation_id":"4593b79c-12ac-4420-89e8-c588ddb08110","resolution":{"observed_at":"2026-08-15T17:20:58.844841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13139","last_updated":"2023-12-21T05:34:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-20T16:00:43Z","title":"Unleashing Large-Scale Video Generative Pre-training for Visual Robot Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13139","snapshot_observed_at":"2026-08-15T17:20:58.849618Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.849618Z"},"links":{"cited_paper":"/paper/2312.13139","citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:09c052e35bb9f77bbcc09da67be7bfd66b9040d796b957ce007f293f34874f19","observation_id":"db764539-b10d-45bb-9ed1-8fe0d46e2c6c","resolution":{"observed_at":"2026-08-15T17:20:58.849618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:20:59.651866Z","title":null,"venue":null,"work_id":"0ea7225f-7f7a-447b-9ee4-2297a0438c90","year":2025},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.853573Z"},"links":{"citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:dd62d8ad73073a3611cd499d8c1c9115154e13388ca4235ebd28744ff27553fb","observation_id":"56226417-d62c-4142-9a24-1b0e1cce870c","resolution":{"observed_at":"2026-08-15T17:20:59.655677Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:20:58.857277Z","title":"Huang, L","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.857277Z"},"links":{"citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:bf899edefe7b231b80d9f3e47a6511a505ffbd75ce95e395fb441de8e1687adf","observation_id":"6354200b-4ebb-4e15-9720-81670b801a45","resolution":{"observed_at":"2026-08-15T17:20:58.857277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.07648","last_updated":"2021-07-07T23:43:24Z","snapshot_observed_at":"2026-08-17T17:21:25.156248Z","submitted_at":"2020-05-15T17:08:50Z","title":"Language Conditioned Imitation Learning over Unstructured Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.07648","snapshot_observed_at":"2026-08-15T17:20:58.861001Z","title":"Lynch and P","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.861001Z"},"links":{"cited_paper":"/paper/2005.07648","citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:a28d3ad1f1f24a83ddf9a17eefd9781060cd10fc492a59a53ae3c55697a6e36f","observation_id":"f5f69a06-e112-4a58-9cbc-3f0bc725937e","resolution":{"observed_at":"2026-08-15T17:20:58.861001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02532","last_updated":"2023-06-01T15:18:21Z","snapshot_observed_at":"2026-08-16T15:42:31.062273Z","submitted_at":"2023-04-05T15:52:34Z","title":"Goal-Conditioned Imitation Learning using Score-based Diffusion Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02532","snapshot_observed_at":"2026-08-15T17:20:58.864808Z","title":"Reuss, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.864808Z"},"links":{"cited_paper":"/paper/2304.02532","citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:4611d7621af2a7686ec81ed586d04df0f7709e89fc0e2a3f49a335039409e61f","observation_id":"d5b97641-f8b7-4a65-9c33-9f18b39b064e","resolution":{"observed_at":"2026-08-15T17:20:58.864808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:20:59.640745Z","title":null,"venue":null,"work_id":"e2cadd3a-1da1-4e41-b5e4-d84857c1e205","year":2023},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.868761Z"},"links":{"citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:0ecb63cc3b36d3a8ee895c5f41be5a76c74e7b82d845a5fde08eb8b4100efeb9","observation_id":"e6538e44-2fc5-428f-aa93-9eddacf40e08","resolution":{"observed_at":"2026-08-15T17:20:59.644458Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:20:59.629975Z","title":"Myers, A","venue":null,"work_id":"77220614-b98a-4b28-bd32-6cac972544e1","year":2023},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.872556Z"},"links":{"citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:e4e0babe12245ea7ca6588258a91d9ff9f33d42ab68a260e0b242f82137a144a","observation_id":"45d9f000-910d-42f2-95f5-6a09a6cc90f4","resolution":{"observed_at":"2026-08-15T17:20:59.633513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.15629","last_updated":"2024-12-09T02:49:04Z","snapshot_observed_at":"2026-08-16T16:20:34.321698Z","submitted_at":"2022-10-27T17:20:50Z","title":"Language Control Diffusion: Efficiently Scaling through Space, Time, and Tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.15629","snapshot_observed_at":"2026-08-15T17:20:58.876860Z","title":"Zhang, Y","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.876860Z"},"links":{"cited_paper":"/paper/2210.15629","citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:aba3435135ca87f21ec751d3f106c310c9c7a3d958c8fcef5da3441beded53bf","observation_id":"05ed046d-9846-4fde-bff5-8672c7a80afe","resolution":{"observed_at":"2026-08-15T17:20:58.876860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:20:59.619489Z","title":null,"venue":null,"work_id":"603a3544-e037-4010-937b-45869fa26581","year":2023},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.880951Z"},"links":{"citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:039329d5387a71736d61ac44be077f95481ea26afcaf1244e65d04c42d455eec","observation_id":"81f3e618-f8ef-4199-81bd-e9cac7c679f8","resolution":{"observed_at":"2026-08-15T17:20:59.622997Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15109","last_updated":"2024-12-19T17:52:50Z","snapshot_observed_at":"2026-08-18T07:25:34.849820Z","submitted_at":"2024-12-19T17:52:50Z","title":"Predictive Inverse Dynamics Models are Scalable Learners for Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15109","snapshot_observed_at":"2026-08-15T17:20:58.884621Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.884621Z"},"links":{"cited_paper":"/paper/2412.15109","citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:37b0888c904e3b827d49aa66a33371a6f620344987e357d24dfe9b2395ad144f","observation_id":"87bcbfa7-3e06-4941-90f1-ad98c0e0b519","resolution":{"observed_at":"2026-08-15T17:20:58.884621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:20:58.888405Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.888405Z"},"links":{"citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:341013ac692051dbff0dbde69261065cb83c79477f03ccae3ebd9bc78df2819c","observation_id":"b6fb59da-9b13-45f1-952a-264a854db01c","resolution":{"observed_at":"2026-08-15T17:20:58.888405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:20:58.892684Z","title":"Rombach, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.892684Z"},"links":{"citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:60b989d606db6cc7ca17db04f33f9d8e28bd2da226d78f08e42a255203f8e681","observation_id":"cc01c332-dc6a-4477-ace3-3d6b8e71f465","resolution":{"observed_at":"2026-08-15T17:20:58.892684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:20:59.594062Z","title":"Dhariwal and A","venue":null,"work_id":"2a5e6b3b-64c0-4870-bc58-086dddf6944c","year":2021},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.896306Z"},"links":{"citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:83a9724c3a9cade6b2da4c0dbdd0c3dc54e5f851797fd1342a4f9d4389ea21c6","observation_id":"f60f9ea7-1ebc-4279-9f4b-480e2ef007e3","resolution":{"observed_at":"2026-08-15T17:20:59.597879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:20:59.582977Z","title":"Peebles and S","venue":null,"work_id":"f12f815c-569c-46f5-a599-5963069812a0","year":2023},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.900017Z"},"links":{"citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:97010291615864c6501622ae2902f7f3ccbd39c0cdfeb22e7aa83b951ab10cce","observation_id":"24c92f8a-4c56-4013-9ffa-682c3a042552","resolution":{"observed_at":"2026-08-15T17:20:59.586622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:20:59.571757Z","title":"Brooks, B","venue":null,"work_id":"a6cc81b0-b1e0-43fc-abcf-010bce6a6570","year":2024},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.903808Z"},"links":{"citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:eeeb6f8a5ac0242d0915dc62abac1310122c557372c1a24e21eee34d8130a7ef","observation_id":"66209e9b-2b3e-4dda-86ca-3cf3b0f87c7b","resolution":{"observed_at":"2026-08-15T17:20:59.575609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:20:59.560302Z","title":"Liang, Y","venue":null,"work_id":"af34c327-f9ad-4e77-b2e9-f2206ab6aa2b","year":2024},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.907413Z"},"links":{"citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:6049ab54951e2f6785725252ababeeb679d55a23897e2a2914faa69960690087","observation_id":"bb9ce109-b65c-42f6-be5a-cc8f382df2ee","resolution":{"observed_at":"2026-08-15T17:20:59.563925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21257","last_updated":"2024-10-28T17:54:31Z","snapshot_observed_at":"2026-08-16T13:05:17.315008Z","submitted_at":"2024-10-28T17:54:31Z","title":"One-Step Diffusion Policy: Fast Visuomotor Policies via Diffusion Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21257","snapshot_observed_at":"2026-08-15T17:20:58.911181Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.911181Z"},"links":{"cited_paper":"/paper/2410.21257","citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:c94eb9161b279fc8a86df749bad6502f7885751e9eb209f0cd36c2397313b678","observation_id":"888903d9-95b4-46ba-b323-8d42d91a1ecc","resolution":{"observed_at":"2026-08-15T17:20:58.911181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.07163","last_updated":"2026-08-03T06:14:33Z","snapshot_observed_at":"2026-08-16T13:19:29.850220Z","submitted_at":"2024-09-11T10:21:21Z","title":"Mamba Policy: Towards Efficient 3D Diffusion Policy with Hybrid Selective State Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.07163","snapshot_observed_at":"2026-08-15T17:20:58.915138Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.915138Z"},"links":{"cited_paper":"/paper/2409.07163","citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:cfa9932b3fa01110de68497ab0d535180023974075a4b2a07f506722e72b2841","observation_id":"a0ef240d-295e-49be-9294-3e23d8b39bc2","resolution":{"observed_at":"2026-08-15T17:20:58.915138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01531","last_updated":"2024-10-24T22:01:44Z","snapshot_observed_at":"2026-08-16T13:38:01.195763Z","submitted_at":"2024-07-01T17:59:56Z","title":"Sparse Diffusion Policy: A Sparse, Reusable, and Flexible Policy for Robot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01531","snapshot_observed_at":"2026-08-15T17:20:58.919019Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.919019Z"},"links":{"cited_paper":"/paper/2407.01531","citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:ae1bc5b8b931a61ee8deb09e81df13c0c6c01dfa53a325643437f64fef417cb2","observation_id":"9e73b499-37f0-4d09-a4a7-09fca6792b35","resolution":{"observed_at":"2026-08-15T17:20:58.919019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01392","last_updated":"2024-12-10T01:32:23Z","snapshot_observed_at":"2026-08-16T13:38:04.174848Z","submitted_at":"2024-07-01T15:43:25Z","title":"Diffusion Forcing: Next-token Prediction Meets Full-Sequence Diffusion","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01392","snapshot_observed_at":"2026-08-15T17:20:58.923194Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.923194Z"},"links":{"cited_paper":"/paper/2407.01392","citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:29d39f330ab89f8bd69ef5cdbed28ce68ad45d10da6c5617eb5bd2889f055546","observation_id":"ba85b343-affd-450c-9826-d7b59b566817","resolution":{"observed_at":"2026-08-15T17:20:58.923194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04137","last_updated":"2024-03-14T04:36:31Z","snapshot_observed_at":"2026-08-08T17:26:38.829859Z","submitted_at":"2023-03-07T18:50:03Z","title":"Diffusion Policy: Visuomotor Policy Learning via Action Diffusion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04137","snapshot_observed_at":"2026-08-15T17:20:58.927160Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.927160Z"},"links":{"cited_paper":"/paper/2303.04137","citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:421ae497604c4e14e09608e5dc0c7a1f38d5394899933629620a1ad1cb22e0b6","observation_id":"ca6eb620-3589-4a0f-a1ff-0c258c238e53","resolution":{"observed_at":"2026-08-15T17:20:58.927160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:20:59.550040Z","title":null,"venue":null,"work_id":"a4d41ef8-c161-479e-bfb3-41dcf2ae52e0","year":2024},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.930890Z"},"links":{"citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:c33716df1e245f55403c75e5ca005c4d4d39cce8499e780c640f0bedc439d212","observation_id":"e8baf7c1-f9ca-40c1-a7a8-d2d287d826a0","resolution":{"observed_at":"2026-08-15T17:20:59.553395Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10885","last_updated":"2024-07-25T14:30:22Z","snapshot_observed_at":"2026-07-06T17:31:17.058043Z","submitted_at":"2024-02-16T18:43:02Z","title":"3D Diffuser Actor: Policy Diffusion with 3D Scene Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10885","snapshot_observed_at":"2026-08-15T17:20:58.934359Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.934359Z"},"links":{"cited_paper":"/paper/2402.10885","citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:bcb79de2c5edd11f1959a5f7b57fea1c076687dcdee30c30126e200de312f706","observation_id":"acde0b73-d592-4848-9326-e332913009ad","resolution":{"observed_at":"2026-08-15T17:20:58.934359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:20:59.539641Z","title":"Reuss, \\\"O","venue":null,"work_id":"cedce725-b986-4b2b-9f17-63b61696099a","year":2024},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.938694Z"},"links":{"citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:6e7e67b64fbdb2af5e508052fc2ff36bbe310ef67a06cb704d9cb23dd742cd0e","observation_id":"1186a65c-d6f8-494a-85e2-81a28c269ab8","resolution":{"observed_at":"2026-08-15T17:20:59.543357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07864","last_updated":"2025-03-01T08:57:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-10T12:33:46Z","title":"RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07864","snapshot_observed_at":"2026-08-15T17:20:58.943602Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.943602Z"},"links":{"cited_paper":"/paper/2410.07864","citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:fcf9a1f9de6453711af12f273975fc3545c0a00f899476e9aac35eb1e2b2d0b0","observation_id":"42f61a0d-d56f-4aee-b9b8-f7f21055eb35","resolution":{"observed_at":"2026-08-15T17:20:58.943602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05855","last_updated":"2025-08-09T10:58:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-09T11:25:56Z","title":"DexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot Control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05855","snapshot_observed_at":"2026-08-15T17:20:58.947794Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.947794Z"},"links":{"cited_paper":"/paper/2502.05855","citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:0d06ac86a3834516a2d639b623a1ae9c20dccb3ed3f42e989974e70ab20dcaac","observation_id":"82910864-0c88-4399-8365-67430e518d7a","resolution":{"observed_at":"2026-08-15T17:20:58.947794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-08-15T17:20:58.951601Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.951601Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:cf6774dd46c07f735f85aa5a631a3be015409f5d17ff70e65cebd8cccd91264f","observation_id":"57d86c72-065c-4732-9470-a42dcad4b8be","resolution":{"observed_at":"2026-08-15T17:20:58.951601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:20:59.528273Z","title":"Vaswani, N","venue":null,"work_id":"ac33511e-5b51-4cb7-b877-efdaf21707d2","year":2017},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.955632Z"},"links":{"citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:495f87b22ec37fcb48c59404405bb3697ac55e94a16ab40362d1c84babbae285","observation_id":"2e1dd8f3-45b6-41fb-8d37-bb1178ed4d31","resolution":{"observed_at":"2026-08-15T17:20:59.532414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10088","last_updated":"2024-10-14T02:02:54Z","snapshot_observed_at":"2026-08-18T19:46:57.991314Z","submitted_at":"2024-10-14T02:02:54Z","title":"The Ingredients for Robotic Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10088","snapshot_observed_at":"2026-08-15T17:20:58.959249Z","title":"Dasari, O","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.959249Z"},"links":{"cited_paper":"/paper/2410.10088","citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:1aa6e4c2c53e335bb7bc4b50eda8fb60d19265b6f12ea094feb3350368e7087a","observation_id":"895ac6f9-c772-4c00-aa44-191b40606214","resolution":{"observed_at":"2026-08-15T17:20:58.959249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:20:59.517127Z","title":"Radford, J","venue":null,"work_id":"9477cbd4-ae53-4c2e-a2a9-d2d2c5a5b8a8","year":2021},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.963630Z"},"links":{"citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:43eb8e38d4a73c18830b5df685da543179ef5af3007c6a827be21c3db9d9268b","observation_id":"ebddbd0a-01ce-4ee5-994e-f9d86936d032","resolution":{"observed_at":"2026-08-15T17:20:59.520716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-17T13:03:40.359628Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-15T17:20:58.967132Z","title":"Oquab, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.967132Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:1e8d5540f27ede2c06b21d1f7518d4fd7cf901e9aec4ccd7c7d8c4a2bc37425b","observation_id":"9dfd9416-ada3-408e-bb7e-f4dbae5d7cdf","resolution":{"observed_at":"2026-08-15T17:20:58.967132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:20:59.506398Z","title":null,"venue":null,"work_id":"2550e415-aa7c-4764-a8db-76a487062b34","year":2023},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.971114Z"},"links":{"citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:3873c031e8fabd23b62fb45aa1392f7fc6b557ec96639fac38f3beb78690e61e","observation_id":"2768103f-b7fb-4ad0-8c7c-54a971dc66cf","resolution":{"observed_at":"2026-08-15T17:20:59.510218Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:20:59.495325Z","title":"Perez, F","venue":null,"work_id":"6ab4a1de-0c7d-4dfc-b7cd-e7dc70fff4cc","year":2018},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.975523Z"},"links":{"citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:fa3d64377f527e560beac21251ccaabe60f709e5878a89b4dda67088b99df260","observation_id":"e29ae840-db82-411f-b256-fe27388aaa09","resolution":{"observed_at":"2026-08-15T17:20:59.498900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:20:59.484471Z","title":null,"venue":null,"work_id":"46c32f31-b3dd-49fb-8ef4-a3f9d068e87d","year":2020},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.979238Z"},"links":{"citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:62cfaf102c63c5e91cd93dd67c24ff3d09a8bd08ba52f4db61a682207e81ff2c","observation_id":"59dc8ea7-0ee5-4382-a913-a1d709ccea14","resolution":{"observed_at":"2026-08-15T17:20:59.488043Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:20:59.471062Z","title":null,"venue":null,"work_id":"6ac98232-5a64-499b-999a-132b2cb45c55","year":2021},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.982651Z"},"links":{"citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:b85f49a49631c394acba74a85ad2911b872b53b96a7f5a4489135947bd6d2c10","observation_id":"eeaf38b9-a8a8-43d8-9311-8193bf6c3abd","resolution":{"observed_at":"2026-08-15T17:20:59.475700Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:20:58.986164Z","title":"Loshchilov and F","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.986164Z"},"links":{"citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:4746d0ca2e65f898891782d5d0c858e1ff3b033faa853cafd7416950473ce041","observation_id":"53eab859-fe6c-480c-988b-cdfe15eb9514","resolution":{"observed_at":"2026-08-15T17:20:58.986164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04659","last_updated":"2023-02-09T14:24:01Z","snapshot_observed_at":"2026-08-18T12:59:35.154897Z","submitted_at":"2023-02-09T14:24:01Z","title":"ManiSkill2: A Unified Benchmark for Generalizable Manipulation Skills","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.04659","snapshot_observed_at":"2026-08-15T17:20:58.989671Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.989671Z"},"links":{"cited_paper":"/paper/2302.04659","citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:b6f74e718f1f32c79935da8311ce293370f7edb4585adf7db9547e4c1842efe7","observation_id":"b8767a5f-23d6-49b2-a52f-27926a768585","resolution":{"observed_at":"2026-08-15T17:20:58.989671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.14483","last_updated":"2021-11-04T12:11:21Z","snapshot_observed_at":"2026-08-16T18:06:24.201768Z","submitted_at":"2021-07-30T08:20:22Z","title":"ManiSkill: Generalizable Manipulation Skill Benchmark with Large-Scale Demonstrations","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.14483","snapshot_observed_at":"2026-08-15T17:20:58.993573Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.993573Z"},"links":{"cited_paper":"/paper/2107.14483","citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:c351c475ab100bdaf7325589ab84eb37186e045e4bd788b4890b00e7f6634a0b","observation_id":"81ac2842-ba41-4f9a-96bd-2cfbca5b1466","resolution":{"observed_at":"2026-08-15T17:20:58.993573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-15T17:20:58.997506Z","title":"Touvron, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.997506Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:6970001f00ee55fad9cc24af685e526fb6433377b5ca59e89eb1dfa071fdd139","observation_id":"94a6902e-67c1-4359-b61c-1b3d483f2407","resolution":{"observed_at":"2026-08-15T17:20:58.997506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":50,"verified_exact":0,"verified_fuzzy":16},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 4 inbound Pith citation observations for arXiv:2508.13103."}