{"as_of":"2026-08-10T09:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0f46ef51b4012183024a7146ff026a6aa61114521516751fb869e873ce0ffb41","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T01:01:44.151987Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.03052/citation-record","integrity":"/paper/2608.03052/integrity","json":"/paper/2608.03052/citation-record.json","paper":"/paper/2608.03052"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.07993","last_updated":"2026-05-19T11:30:49Z","snapshot_observed_at":"2026-08-02T02:27:22.352995Z","submitted_at":"2026-04-09T09:01:43Z","title":"HEX: Humanoid-Aligned Experts for Cross-Embodiment Whole-Body Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.07993","snapshot_observed_at":"2026-08-08T01:01:44.071866Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03052","last_updated":"2026-08-04T03:05:47Z","snapshot_observed_at":"2026-08-10T08:44:55.469435Z","submitted_at":"2026-08-04T03:05:47Z","title":"How Should Vision-Language-Action Models Use Proprioceptive State?","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T01:01:44.071866Z"},"links":{"cited_paper":"/paper/2604.07993","citing_paper":"/paper/2608.03052"},"observation_digest":"sha256:f5b579c45c229aef9af3f9fb1e059ed27ff6df045c29f5bcaf003312354aa5fb","observation_id":"afc253b5-1f6b-43c1-bb74-6511dc44c14d","resolution":{"observed_at":"2026-08-08T01:01:44.071866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.04639","last_updated":"2026-05-26T02:02:04Z","snapshot_observed_at":"2026-07-15T15:08:20.077091Z","submitted_at":"2026-03-04T21:59:32Z","title":"RoboMME: Benchmarking and Understanding Memory for Robotic Generalist Policies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.04639","snapshot_observed_at":"2026-08-08T01:01:44.084075Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03052","last_updated":"2026-08-04T03:05:47Z","snapshot_observed_at":"2026-08-10T08:44:55.469435Z","submitted_at":"2026-08-04T03:05:47Z","title":"How Should Vision-Language-Action Models Use Proprioceptive State?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T01:01:44.084075Z"},"links":{"cited_paper":"/paper/2603.04639","citing_paper":"/paper/2608.03052"},"observation_digest":"sha256:a8e5504883e5a8bd055cec39cdb99b094dfeb79eda5dae6125359388fac4d59e","observation_id":"8a3b5760-2bc7-46e0-a334-855dcc767c0e","resolution":{"observed_at":"2026-08-08T01:01:44.084075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.11865","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:01:44.984583Z","title":"Davies, Y","venue":null,"work_id":"f815bf94-772d-4c73-ab26-534fa399753f","year":null},"citing_paper":{"arxiv_id":"2608.03052","last_updated":"2026-08-04T03:05:47Z","snapshot_observed_at":"2026-08-10T08:44:55.469435Z","submitted_at":"2026-08-04T03:05:47Z","title":"How Should Vision-Language-Action Models Use Proprioceptive State?","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T01:01:44.087910Z"},"links":{"citing_paper":"/paper/2608.03052"},"observation_digest":"sha256:4ea22f90bc9be1f37d60e73cc68c396cd9b2ae8d225bc91d26e597ca15686a4a","observation_id":"cc10f7a7-1860-46b7-8577-790329b85c56","resolution":{"observed_at":"2026-08-08T01:01:44.989531Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-08T01:01:44.094721Z","title":"Intelligence, K","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03052","last_updated":"2026-08-04T03:05:47Z","snapshot_observed_at":"2026-08-10T08:44:55.469435Z","submitted_at":"2026-08-04T03:05:47Z","title":"How Should Vision-Language-Action Models Use Proprioceptive State?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T01:01:44.094721Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2608.03052"},"observation_digest":"sha256:83b162c6dc77d93967ab514c29f230e8a0ac2cd08d50fe21f82a8f5e5c910789","observation_id":"af6f9f4e-56ad-43f8-817a-cb06c02ca0cd","resolution":{"observed_at":"2026-08-08T01:01:44.094721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-08T01:01:44.098166Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03052","last_updated":"2026-08-04T03:05:47Z","snapshot_observed_at":"2026-08-10T08:44:55.469435Z","submitted_at":"2026-08-04T03:05:47Z","title":"How Should Vision-Language-Action Models Use Proprioceptive State?","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T01:01:44.098166Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2608.03052"},"observation_digest":"sha256:88551a0be8c60c1fe2f48a1e99efa5b8f962f70b1517799561783cb866e5a873","observation_id":"203c76f1-4b45-4a9f-ac77-aeb8ac7954d1","resolution":{"observed_at":"2026-08-08T01:01:44.098166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2602.12032","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"2602.12032","venue":"Open MIND","work_id":"b2521210-5ff9-4812-ad7d-8dfb99ed79b2","year":null},"citing_paper":{"arxiv_id":"2608.03052","last_updated":"2026-08-04T03:05:47Z","snapshot_observed_at":"2026-08-10T08:44:55.469435Z","submitted_at":"2026-08-04T03:05:47Z","title":"How Should Vision-Language-Action Models Use Proprioceptive State?","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T01:01:44.107978Z"},"links":{"citing_paper":"/paper/2608.03052"},"observation_digest":"sha256:cc8083836b35d53f224bd97cbb78b4fe936884413e9fe9a8aedc9731dd618eeb","observation_id":"c83c44b3-fcb4-4aba-8afe-dc0c84019d49","resolution":{"observed_at":"2026-08-08T01:01:44.528761Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:01:45.032670Z","title":null,"venue":null,"work_id":"fbb41e98-4a39-46ce-98b5-d8cc3e428cb5","year":2026},"citing_paper":{"arxiv_id":"2608.03052","last_updated":"2026-08-04T03:05:47Z","snapshot_observed_at":"2026-08-10T08:44:55.469435Z","submitted_at":"2026-08-04T03:05:47Z","title":"How Should Vision-Language-Action Models Use Proprioceptive State?","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T01:01:44.111421Z"},"links":{"citing_paper":"/paper/2608.03052"},"observation_digest":"sha256:922a4644665d5ff10ddfd8d157ef13da9630e46079562d7fbfed2699a9119990","observation_id":"0d5b8cb8-3eeb-498b-9b0a-d553c6637214","resolution":{"observed_at":"2026-08-08T01:01:45.035967Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19236","last_updated":"2026-01-30T13:36:22Z","snapshot_observed_at":"2026-07-06T22:19:00.152099Z","submitted_at":"2025-08-26T17:57:16Z","title":"MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19236","snapshot_observed_at":"2026-08-08T01:01:44.115129Z","title":"URL https://doi.org/10.1609/aaai.v40i29.39677","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03052","last_updated":"2026-08-04T03:05:47Z","snapshot_observed_at":"2026-08-10T08:44:55.469435Z","submitted_at":"2026-08-04T03:05:47Z","title":"How Should Vision-Language-Action Models Use Proprioceptive State?","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T01:01:44.115129Z"},"links":{"cited_paper":"/paper/2508.19236","citing_paper":"/paper/2608.03052"},"observation_digest":"sha256:9869dc3b99ac195029c7fc61f64ea59c071fadcc0a11df9f564b6f5f31897494","observation_id":"d9ce61a8-bbd2-4c14-8313-63116db4ecd5","resolution":{"observed_at":"2026-08-08T01:01:44.115129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.06575","last_updated":"2026-07-06T12:11:10Z","snapshot_observed_at":"2026-08-03T03:56:00.008362Z","submitted_at":"2026-02-06T10:16:22Z","title":"Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.06575","snapshot_observed_at":"2026-08-08T01:01:44.118690Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03052","last_updated":"2026-08-04T03:05:47Z","snapshot_observed_at":"2026-08-10T08:44:55.469435Z","submitted_at":"2026-08-04T03:05:47Z","title":"How Should Vision-Language-Action Models Use Proprioceptive State?","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T01:01:44.118690Z"},"links":{"cited_paper":"/paper/2602.06575","citing_paper":"/paper/2608.03052"},"observation_digest":"sha256:e925958a9db8d5924c4d1d85dfd054da0318ae293649ee2d506e6f58f671da27","observation_id":"e54940ea-f858-4887-9295-6bd8d2cf92cc","resolution":{"observed_at":"2026-08-08T01:01:44.118690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.06575","last_updated":"2026-07-06T12:11:10Z","snapshot_observed_at":"2026-08-03T03:56:00.008362Z","submitted_at":"2026-02-06T10:16:22Z","title":"Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.06575","snapshot_observed_at":"2026-08-08T01:01:44.122151Z","title":"URL https: //doi.org/10.48550/arXiv.2602.06575","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03052","last_updated":"2026-08-04T03:05:47Z","snapshot_observed_at":"2026-08-10T08:44:55.469435Z","submitted_at":"2026-08-04T03:05:47Z","title":"How Should Vision-Language-Action Models Use Proprioceptive State?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T01:01:44.122151Z"},"links":{"cited_paper":"/paper/2602.06575","citing_paper":"/paper/2608.03052"},"observation_digest":"sha256:00002c28cd9596393095d42142bc97a56998630155054e594f0d99c4b5083424","observation_id":"8c5ad290-f9e0-4386-bc10-c1d1fc7b6ee2","resolution":{"observed_at":"2026-08-08T01:01:44.122151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2512.20166","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":"arXiv (Cornell University)","work_id":"e4bef21d-8465-413f-b15a-59babffb9e88","year":null},"citing_paper":{"arxiv_id":"2608.03052","last_updated":"2026-08-04T03:05:47Z","snapshot_observed_at":"2026-08-10T08:44:55.469435Z","submitted_at":"2026-08-04T03:05:47Z","title":"How Should Vision-Language-Action Models Use Proprioceptive State?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T01:01:44.125411Z"},"links":{"citing_paper":"/paper/2608.03052"},"observation_digest":"sha256:4bf3d4a926f532a56e69538656f0b0d6c8d35f80cc167dfdcf8f392e06484ed0","observation_id":"c3e3f441-ea11-4b9d-870b-847031eba6c7","resolution":{"observed_at":"2026-08-08T01:01:44.433068Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.24642","last_updated":"2026-05-23T16:18:41Z","snapshot_observed_at":"2026-07-30T07:41:42.487489Z","submitted_at":"2026-05-23T16:18:41Z","title":"Understanding the Impact of Geometric Foundation Models on Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2605.24642","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.24642","snapshot_observed_at":"2026-08-08T01:01:44.716122Z","title":"Understanding the Impact of Geometric Foundation Models on Vision-Language-Action Models","venue":"cs.CV","work_id":"cabd1743-5236-41db-a6c7-dd773b7f2300","year":2026},"citing_paper":{"arxiv_id":"2608.03052","last_updated":"2026-08-04T03:05:47Z","snapshot_observed_at":"2026-08-10T08:44:55.469435Z","submitted_at":"2026-08-04T03:05:47Z","title":"How Should Vision-Language-Action Models Use Proprioceptive State?","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T01:01:44.132304Z"},"links":{"cited_paper":"/paper/2605.24642","citing_paper":"/paper/2608.03052"},"observation_digest":"sha256:7d74c2274723f3edad2e2a8343423f07df6b292bd0ae63bb15e1eb08629f8565","observation_id":"35f2b077-8ae6-4598-8b4e-67b33e60a9da","resolution":{"observed_at":"2026-08-08T01:01:44.721229Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:01:44.135594Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03052","last_updated":"2026-08-04T03:05:47Z","snapshot_observed_at":"2026-08-10T08:44:55.469435Z","submitted_at":"2026-08-04T03:05:47Z","title":"How Should Vision-Language-Action Models Use Proprioceptive State?","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T01:01:44.135594Z"},"links":{"citing_paper":"/paper/2608.03052"},"observation_digest":"sha256:cdf366a83f15f0fe4718a57b7bbad48051e0fee541439f4fb96bb7b31fd2542b","observation_id":"30f870f2-dca5-419c-9ab7-5c38ad0279b5","resolution":{"observed_at":"2026-08-08T01:01:44.135594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2601.14133","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"2601.14133","venue":"Open MIND","work_id":"09df3340-7195-4cc0-bca3-2245d384b7e7","year":null},"citing_paper":{"arxiv_id":"2608.03052","last_updated":"2026-08-04T03:05:47Z","snapshot_observed_at":"2026-08-10T08:44:55.469435Z","submitted_at":"2026-08-04T03:05:47Z","title":"How Should Vision-Language-Action Models Use Proprioceptive State?","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T01:01:44.138844Z"},"links":{"citing_paper":"/paper/2608.03052"},"observation_digest":"sha256:be3029752f3ce89a286cf10c93f47c63d234e6b9d492e3610b03fb9e76a81439","observation_id":"463d4e7e-96de-4c03-b6ea-a74878bc71d5","resolution":{"observed_at":"2026-08-08T01:01:44.358840Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:01:44.142251Z","title":"Zhang, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03052","last_updated":"2026-08-04T03:05:47Z","snapshot_observed_at":"2026-08-10T08:44:55.469435Z","submitted_at":"2026-08-04T03:05:47Z","title":"How Should Vision-Language-Action Models Use Proprioceptive State?","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T01:01:44.142251Z"},"links":{"citing_paper":"/paper/2608.03052"},"observation_digest":"sha256:c597d256eb4dfeb67eba128475a9649df606a6835e33c278877ec92f34ea7eb6","observation_id":"66820ca3-7f3c-4dce-9585-fba23ab4730d","resolution":{"observed_at":"2026-08-08T01:01:44.142251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2601.04061","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"URL https://doi.org/10","venue":"arXiv (Cornell University)","work_id":"0d6f9e39-0a50-4368-b6bd-884e31789ee4","year":null},"citing_paper":{"arxiv_id":"2608.03052","last_updated":"2026-08-04T03:05:47Z","snapshot_observed_at":"2026-08-10T08:44:55.469435Z","submitted_at":"2026-08-04T03:05:47Z","title":"How Should Vision-Language-Action Models Use Proprioceptive State?","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T01:01:44.145383Z"},"links":{"citing_paper":"/paper/2608.03052"},"observation_digest":"sha256:6ed4dbd6399f0cfab2b2fe746f6ad0bb4ec7a930ec6a84253849b7b670f14656","observation_id":"6d897209-cf3b-4e60-a0cb-24de3d6d59ec","resolution":{"observed_at":"2026-08-08T01:01:44.284230Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:01:44.148650Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03052","last_updated":"2026-08-04T03:05:47Z","snapshot_observed_at":"2026-08-10T08:44:55.469435Z","submitted_at":"2026-08-04T03:05:47Z","title":"How Should Vision-Language-Action Models Use Proprioceptive State?","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T01:01:44.148650Z"},"links":{"citing_paper":"/paper/2608.03052"},"observation_digest":"sha256:e47764c009e85b9d4fb79f45c86586806586d90c031cef584bd063c1f4405e5a","observation_id":"5d2a6ede-04cb-4506-b734-b0bf1f0fd6a4","resolution":{"observed_at":"2026-08-08T01:01:44.148650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:01:44.091348Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03052","last_updated":"2026-08-04T03:05:47Z","snapshot_observed_at":"2026-08-10T08:44:55.469435Z","submitted_at":"2026-08-04T03:05:47Z","title":"How Should Vision-Language-Action Models Use Proprioceptive State?","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-08T01:01:44.091348Z"},"links":{"citing_paper":"/paper/2608.03052"},"observation_digest":"sha256:905842d56b411b6e5f7128b7ae58b0a750d6175e28cf3c367038e8537204ba31","observation_id":"85208fef-0207-490f-8633-3851c3c81abe","resolution":{"observed_at":"2026-08-08T01:01:44.091348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13679","last_updated":"2025-06-16T16:34:20Z","snapshot_observed_at":"2026-08-10T08:31:14.780196Z","submitted_at":"2025-06-16T16:34:20Z","title":"ROSA: Harnessing Robot States for Vision-Language and Action Alignment","version":1},"cited_work":{"arxiv_id":"2506.13679","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.13679","snapshot_observed_at":"2026-08-08T01:01:44.731686Z","title":"ROSA: Harnessing Robot States for Vision-Language and Action Alignment","venue":"cs.RO","work_id":"21caf7c2-7bc2-40f2-ae6d-3b8ce6cff6cf","year":2025},"citing_paper":{"arxiv_id":"2608.03052","last_updated":"2026-08-04T03:05:47Z","snapshot_observed_at":"2026-08-10T08:44:55.469435Z","submitted_at":"2026-08-04T03:05:47Z","title":"How Should Vision-Language-Action Models Use Proprioceptive State?","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-08T01:01:44.128884Z"},"links":{"cited_paper":"/paper/2506.13679","citing_paper":"/paper/2608.03052"},"observation_digest":"sha256:53a5798a470bc9d4daa51decc8473eefd825a6a12f31558a3df39c60fd385243","observation_id":"87fdd124-616f-4096-9bdc-3ba1d7801856","resolution":{"observed_at":"2026-08-08T01:01:44.735748Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:01:44.104786Z","title":"Whenwouldvision- proprioception policies fail in robotic manipulation? CoRR, abs/2602.12032,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03052","last_updated":"2026-08-04T03:05:47Z","snapshot_observed_at":"2026-08-10T08:44:55.469435Z","submitted_at":"2026-08-04T03:05:47Z","title":"How Should Vision-Language-Action Models Use Proprioceptive State?","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-08T01:01:44.104786Z"},"links":{"citing_paper":"/paper/2608.03052"},"observation_digest":"sha256:3a5f8a0998a83b6f085680374ef67c87634f34032e41f1fbf7228f29347a5d57","observation_id":"b93173d7-4de2-45eb-9873-d8c5239c2712","resolution":{"observed_at":"2026-08-08T01:01:44.104786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19645","snapshot_observed_at":"2026-08-08T01:01:44.101602Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03052","last_updated":"2026-08-04T03:05:47Z","snapshot_observed_at":"2026-08-10T08:44:55.469435Z","submitted_at":"2026-08-04T03:05:47Z","title":"How Should Vision-Language-Action Models Use Proprioceptive State?","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T01:01:44.101602Z"},"links":{"cited_paper":"/paper/2502.19645","citing_paper":"/paper/2608.03052"},"observation_digest":"sha256:021d31d0522d00bf0829d97f29d03437a9ca9338d9aa6e2d9a61cfd3b4ef632f","observation_id":"c42ebbaa-e9d2-4ae7-919b-8806c2da7a10","resolution":{"observed_at":"2026-08-08T01:01:44.101602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-08T01:01:44.080292Z","title":"Fusai, L","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03052","last_updated":"2026-08-04T03:05:47Z","snapshot_observed_at":"2026-08-10T08:44:55.469435Z","submitted_at":"2026-08-04T03:05:47Z","title":"How Should Vision-Language-Action Models Use Proprioceptive State?","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-08T01:01:44.080292Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2608.03052"},"observation_digest":"sha256:a370fd182e84eb19646706f0bc152ef69d2e2ec264d36201bc78e8f442a5f29e","observation_id":"854015ee-14eb-4e0b-8f34-60d21ed41dfd","resolution":{"observed_at":"2026-08-08T01:01:44.080292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.07993","last_updated":"2026-05-19T11:30:49Z","snapshot_observed_at":"2026-08-02T02:27:22.352995Z","submitted_at":"2026-04-09T09:01:43Z","title":"HEX: Humanoid-Aligned Experts for Cross-Embodiment Whole-Body Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.07993","snapshot_observed_at":"2026-08-08T01:01:44.076699Z","title":"2604.07993","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03052","last_updated":"2026-08-04T03:05:47Z","snapshot_observed_at":"2026-08-10T08:44:55.469435Z","submitted_at":"2026-08-04T03:05:47Z","title":"How Should Vision-Language-Action Models Use Proprioceptive State?","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-08T01:01:44.076699Z"},"links":{"cited_paper":"/paper/2604.07993","citing_paper":"/paper/2608.03052"},"observation_digest":"sha256:5196d7e9c3560bbe2bfc2c65132fc8d3d8b42b79b4ab6c91aea5c415b6ff1ee5","observation_id":"e72c9459-5697-4a3c-a778-220795f9843f","resolution":{"observed_at":"2026-08-08T01:01:44.076699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:01:45.022754Z","title":null,"venue":null,"work_id":"45782ee4-93e3-4200-b71f-264259c1ffc7","year":null},"citing_paper":{"arxiv_id":"2608.03052","last_updated":"2026-08-04T03:05:47Z","snapshot_observed_at":"2026-08-10T08:44:55.469435Z","submitted_at":"2026-08-04T03:05:47Z","title":"How Should Vision-Language-Action Models Use Proprioceptive State?","version":1},"reference_index":4096,"source":"pdf_text","source_observed_at":"2026-08-08T01:01:44.151987Z"},"links":{"citing_paper":"/paper/2608.03052"},"observation_digest":"sha256:8a28d8b248e792730bf70c16e202409631f6955d3514a9e15f232fc42fb3b1cb","observation_id":"808705d3-d049-4661-9671-42e1387f8e10","resolution":{"observed_at":"2026-08-08T01:01:45.026043Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.03052","last_updated":"2026-08-04T03:05:47Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-10T08:44:55.469435Z","submitted_at":"2026-08-04T03:05:47Z","title":"How Should Vision-Language-Action Models Use Proprioceptive State?"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":7,"verified_fuzzy":0},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 0 inbound Pith citation observations for arXiv:2608.03052."}