{"as_of":"2026-08-20T00:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:422c83b5eae0a7d8ad8d9113a2618e20d418362940d8a1fda22d4b03bad99872","coverage":[{"denominator":14,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T11:52:55.674025Z","state":"measured"},{"denominator":14,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":14,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.09730/citation-record","integrity":"/paper/2608.09730/integrity","json":"/paper/2608.09730/citation-record.json","paper":"/paper/2608.09730"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-17T13:26:10.378579Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-11T11:52:55.636885Z","title":"Qwen3-VL technical report.arXiv preprint arXiv:2511.21631,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09730","last_updated":"2026-08-10T15:30:38Z","snapshot_observed_at":"2026-08-18T12:56:24.346350Z","submitted_at":"2026-08-10T15:30:38Z","title":"World Tokens: Enhancing Embodied Policies with Training-Time World Modeling","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:55.636885Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2608.09730"},"observation_digest":"sha256:c426a2c6cc6ae3a5f34aa39d09eec6166b882e3e3438b6e8556f8b43314d0df7","observation_id":"f6db37f8-df69-4a5b-a9bc-1bec9f8e7372","resolution":{"observed_at":"2026-08-11T11:52:55.636885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:52:55.642353Z","title":"VLA-JEPA: Enhancing vision-language-action model with latent world model.arXiv preprint arXiv:2602.10098,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09730","last_updated":"2026-08-10T15:30:38Z","snapshot_observed_at":"2026-08-18T12:56:24.346350Z","submitted_at":"2026-08-10T15:30:38Z","title":"World Tokens: Enhancing Embodied Policies with Training-Time World Modeling","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:55.642353Z"},"links":{"citing_paper":"/paper/2608.09730"},"observation_digest":"sha256:e667f50dbce47abd129bf4293dbb0e4e018455a800c3cac058d54f5dc86468b5","observation_id":"0dc1c50f-f5d6-4f63-afd5-926905ff0386","resolution":{"observed_at":"2026-08-11T11:52:55.642353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.07931","last_updated":"2026-05-13T19:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-08T16:04:43Z","title":"One Token Per Frame: Reconsidering Visual Bandwidth in World Models for VLA Policy","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.07931","snapshot_observed_at":"2026-08-11T11:52:55.646630Z","title":"One token per frame: Reconsidering visual bandwidth in world models for VLA policy","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09730","last_updated":"2026-08-10T15:30:38Z","snapshot_observed_at":"2026-08-18T12:56:24.346350Z","submitted_at":"2026-08-10T15:30:38Z","title":"World Tokens: Enhancing Embodied Policies with Training-Time World Modeling","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:55.646630Z"},"links":{"cited_paper":"/paper/2605.07931","citing_paper":"/paper/2608.09730"},"observation_digest":"sha256:ca893a08ea9130f98c03bc16f171577716cd5cfd7aaada22321b463d32cbe59e","observation_id":"a21cfbb2-8175-4df4-9e22-40192f6ccc35","resolution":{"observed_at":"2026-08-11T11:52:55.646630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.10422","last_updated":"2026-05-29T05:31:44Z","snapshot_observed_at":"2026-08-19T11:04:14.295766Z","submitted_at":"2026-03-11T05:11:44Z","title":"World2Act: Latent Action Post-Training from World Model Dynamics","version":2},"cited_work":{"arxiv_id":"2603.10422","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.10422","snapshot_observed_at":"2026-08-11T11:52:55.829055Z","title":"World2Act: Latent Action Post-Training from World Model Dynamics","venue":"cs.CV","work_id":"82ea247d-800e-4b7a-8b48-b4349dc26a24","year":2026},"citing_paper":{"arxiv_id":"2608.09730","last_updated":"2026-08-10T15:30:38Z","snapshot_observed_at":"2026-08-18T12:56:24.346350Z","submitted_at":"2026-08-10T15:30:38Z","title":"World Tokens: Enhancing Embodied Policies with Training-Time World Modeling","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:55.651035Z"},"links":{"cited_paper":"/paper/2603.10422","citing_paper":"/paper/2608.09730"},"observation_digest":"sha256:9cc20321ddf6382577cdcc22765a6e5c6cd458f97aa0fcf57b71224292d88f56","observation_id":"b75afe70-f9f2-464d-80c5-046d6dc53446","resolution":{"observed_at":"2026-08-11T11:52:55.836408Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12952","last_updated":"2024-01-17T22:41:29Z","snapshot_observed_at":"2026-08-18T12:56:00.263505Z","submitted_at":"2023-08-24T17:41:20Z","title":"BridgeData V2: A Dataset for Robot Learning at Scale","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12952","snapshot_observed_at":"2026-08-11T11:52:55.655345Z","title":"BridgeData V2: A dataset for robot learning at scale.arXiv preprint arXiv:2308.12952,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09730","last_updated":"2026-08-10T15:30:38Z","snapshot_observed_at":"2026-08-18T12:56:24.346350Z","submitted_at":"2026-08-10T15:30:38Z","title":"World Tokens: Enhancing Embodied Policies with Training-Time World Modeling","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:55.655345Z"},"links":{"cited_paper":"/paper/2308.12952","citing_paper":"/paper/2608.09730"},"observation_digest":"sha256:05cf688870f48687b3db3577013006ecc7e699f2a2dd92fb0bba2c21bbc51df2","observation_id":"f6c4bcfb-0b1a-4d54-9a97-a942ecadba9a","resolution":{"observed_at":"2026-08-11T11:52:55.655345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.11757","last_updated":"2026-04-13T17:30:01Z","snapshot_observed_at":"2026-07-06T23:00:03.762376Z","submitted_at":"2026-04-13T17:30:01Z","title":"StarVLA-$\\alpha$: Reducing Complexity in Vision-Language-Action Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.11757","snapshot_observed_at":"2026-08-11T11:52:55.659762Z","title":"StarVLA-𝛼: Reducing complexity in vision-language-action systems.arXiv preprint arXiv:2604.11757, 2026a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09730","last_updated":"2026-08-10T15:30:38Z","snapshot_observed_at":"2026-08-18T12:56:24.346350Z","submitted_at":"2026-08-10T15:30:38Z","title":"World Tokens: Enhancing Embodied Policies with Training-Time World Modeling","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:55.659762Z"},"links":{"cited_paper":"/paper/2604.11757","citing_paper":"/paper/2608.09730"},"observation_digest":"sha256:061e48cabac9d3c5904c88dbb9f2b35d103d37b77aa0c3fa41e73c62b92ad64f","observation_id":"95c30bd7-31d3-4bf8-b858-34080c05bac9","resolution":{"observed_at":"2026-08-11T11:52:55.659762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:52:55.664989Z","title":"𝛿VLA:Prior-guidedvision-language-actionmodelsviaworldknowledgevariation.arXiv preprint arXiv:2603.08361,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09730","last_updated":"2026-08-10T15:30:38Z","snapshot_observed_at":"2026-08-18T12:56:24.346350Z","submitted_at":"2026-08-10T15:30:38Z","title":"World Tokens: Enhancing Embodied Policies with Training-Time World Modeling","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:55.664989Z"},"links":{"citing_paper":"/paper/2608.09730"},"observation_digest":"sha256:e111957bea53cc6dfaaa360a5f161770c352f9386e42bbfcf959ecb275aa394a","observation_id":"75e865f1-f1c4-4b87-837a-817bd924df4e","resolution":{"observed_at":"2026-08-11T11:52:55.664989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:52:56.153013Z","title":"We use AdamW with𝛽= (0.9,0.95) ,𝜖=10 −8, and weight decay10−8, under a cosine schedule with linear warmup","venue":null,"work_id":"6d6c02e6-1238-4d6f-87a5-0652f6c85472","year":null},"citing_paper":{"arxiv_id":"2608.09730","last_updated":"2026-08-10T15:30:38Z","snapshot_observed_at":"2026-08-18T12:56:24.346350Z","submitted_at":"2026-08-10T15:30:38Z","title":"World Tokens: Enhancing Embodied Policies with Training-Time World Modeling","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:55.669408Z"},"links":{"citing_paper":"/paper/2608.09730"},"observation_digest":"sha256:1b078d27b036922a54733e9a5561fe51b8fbc38da95800d048bcd86c678e9dad","observation_id":"dabfba20-dc68-409a-b791-160f285c5780","resolution":{"observed_at":"2026-08-11T11:52:56.158365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:52:56.137743Z","title":null,"venue":null,"work_id":"dc5448a6-2893-47e4-8a74-802f7f75e065","year":2026},"citing_paper":{"arxiv_id":"2608.09730","last_updated":"2026-08-10T15:30:38Z","snapshot_observed_at":"2026-08-18T12:56:24.346350Z","submitted_at":"2026-08-10T15:30:38Z","title":"World Tokens: Enhancing Embodied Policies with Training-Time World Modeling","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:55.674025Z"},"links":{"citing_paper":"/paper/2608.09730"},"observation_digest":"sha256:4d14d673fa249105516c96e278f7b715477093c325c2d717da0dd8b2bfcb7c6f","observation_id":"101c7be5-a322-4587-99dc-11055849eb3c","resolution":{"observed_at":"2026-08-11T11:52:56.142199Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21539","last_updated":"2025-06-26T17:55:40Z","snapshot_observed_at":"2026-08-13T10:05:34.967093Z","submitted_at":"2025-06-26T17:55:40Z","title":"WorldVLA: Towards Autoregressive Action World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21539","snapshot_observed_at":"2026-08-11T11:52:55.613388Z","title":"WorldVLA: Towards autoregressive action world model.arXiv preprint arXiv:2506.21539,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09730","last_updated":"2026-08-10T15:30:38Z","snapshot_observed_at":"2026-08-18T12:56:24.346350Z","submitted_at":"2026-08-10T15:30:38Z","title":"World Tokens: Enhancing Embodied Policies with Training-Time World Modeling","version":1},"reference_index":1986,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:55.613388Z"},"links":{"cited_paper":"/paper/2506.21539","citing_paper":"/paper/2608.09730"},"observation_digest":"sha256:0b2a96d222928f1bbc4f4fade6c57c7860ed27e4e297ee60ac6fe1b6b47988ee","observation_id":"e2b5cf19-cc19-471b-90f2-8f11b8fcc6a7","resolution":{"observed_at":"2026-08-11T11:52:55.613388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:52:55.618677Z","title":"Robotic VLA benefits from joint learning with motion image diffusion.arXiv preprint arXiv:2512.18007,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09730","last_updated":"2026-08-10T15:30:38Z","snapshot_observed_at":"2026-08-18T12:56:24.346350Z","submitted_at":"2026-08-10T15:30:38Z","title":"World Tokens: Enhancing Embodied Policies with Training-Time World Modeling","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:55.618677Z"},"links":{"citing_paper":"/paper/2608.09730"},"observation_digest":"sha256:01eaa60e45ddbcc94356cb7f96fe976ba623f822a1bfa4f929c0c7fbebead57b","observation_id":"99eccc8d-ad0a-41e6-8d94-65296ad4ed31","resolution":{"observed_at":"2026-08-11T11:52:55.618677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21998","last_updated":"2026-03-22T15:37:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-29T17:07:43Z","title":"Causal World Modeling for Robot Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.21998","snapshot_observed_at":"2026-08-11T11:52:55.623005Z","title":"Causal world modeling for robot control.arXiv preprint arXiv:2601.21998,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09730","last_updated":"2026-08-10T15:30:38Z","snapshot_observed_at":"2026-08-18T12:56:24.346350Z","submitted_at":"2026-08-10T15:30:38Z","title":"World Tokens: Enhancing Embodied Policies with Training-Time World Modeling","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:55.623005Z"},"links":{"cited_paper":"/paper/2601.21998","citing_paper":"/paper/2608.09730"},"observation_digest":"sha256:7347e594363da13d27ef476edce715dc49f50acf65c1fda162ae2fc6ec4b0ad8","observation_id":"3cfe59c5-a037-4b0e-95d7-ee56f79def5b","resolution":{"observed_at":"2026-08-11T11:52:55.623005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:52:55.628035Z","title":"DiT4DiT: Jointly modeling video dynamics and actions for generalizable robot control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09730","last_updated":"2026-08-10T15:30:38Z","snapshot_observed_at":"2026-08-18T12:56:24.346350Z","submitted_at":"2026-08-10T15:30:38Z","title":"World Tokens: Enhancing Embodied Policies with Training-Time World Modeling","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:55.628035Z"},"links":{"citing_paper":"/paper/2608.09730"},"observation_digest":"sha256:e4017c9903281bc743c82d2950709b6f5a3f85d28f89452a6dd13e50a0ece3ac","observation_id":"70551851-8387-412a-b9da-29d0052a4284","resolution":{"observed_at":"2026-08-11T11:52:55.628035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-11T11:52:55.632302Z","title":"GR00T N1: An open foundation model for generalist humanoid robots.arXiv preprint arXiv:2503.14734, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09730","last_updated":"2026-08-10T15:30:38Z","snapshot_observed_at":"2026-08-18T12:56:24.346350Z","submitted_at":"2026-08-10T15:30:38Z","title":"World Tokens: Enhancing Embodied Policies with Training-Time World Modeling","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:55.632302Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2608.09730"},"observation_digest":"sha256:723a96c1e96bfd31cee2dc668dc5adaabed7e75761ce58297f78c97956348670","observation_id":"bd1375fc-bb65-4083-8e81-a160f95fffbd","resolution":{"observed_at":"2026-08-11T11:52:55.632302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.09730","last_updated":"2026-08-10T15:30:38Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T12:56:24.346350Z","submitted_at":"2026-08-10T15:30:38Z","title":"World Tokens: Enhancing Embodied Policies with Training-Time World Modeling"},"reference_resolution":{"displayed":14,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":1,"verified_fuzzy":1},"total_outbound_references":14},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 14 of 14 outbound references and 0 inbound Pith citation observations for arXiv:2608.09730."}