{"as_of":"2026-08-22T03:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:74c87afd4dc3f2c11847b78ebc9020709e7169f21225b15af62a482c2add8fce","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:27:01.485780Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.08839/citation-record","integrity":"/paper/2608.08839/integrity","json":"/paper/2608.08839/citation-record.json","paper":"/paper/2608.08839"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2512.13030","last_updated":"2025-12-25T08:16:05Z","snapshot_observed_at":"2026-08-16T22:05:17.066613Z","submitted_at":"2025-12-15T06:58:40Z","title":"Motus: A Unified Latent Action World Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.13030","snapshot_observed_at":"2026-08-14T04:27:01.187503Z","title":"Motus: A unified latent action world model.arXiv preprint arXiv:2512.13030,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-17T06:26:07.147538Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.187503Z"},"links":{"cited_paper":"/paper/2512.13030","citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:6a88c65fed870f8738d00d5b3cf9d416f8888d3e9ff56e0bb61fb1143203caed","observation_id":"9c4cdf7b-882d-406c-b4ef-208ea7513bda","resolution":{"observed_at":"2026-08-14T04:27:01.187503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.15607/rss.2025.xxi.01","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:27:01.528465Z","title":"π0.5: a vision-language-action model with open-world generalization","venue":null,"work_id":"f4422bf4-4dc4-4730-8c37-da048903f40e","year":null},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-17T06:26:07.147538Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.213845Z"},"links":{"citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:1a08c690ccffd4e0fe5b4be688df784d036b025da07c5fa8a4dbbef4f3257d6e","observation_id":"45bff85b-e0d3-4f0d-a057-d9580aacb76a","resolution":{"observed_at":"2026-08-14T04:27:01.535013Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21539","last_updated":"2025-06-26T17:55:40Z","snapshot_observed_at":"2026-08-13T10:05:34.967093Z","submitted_at":"2025-06-26T17:55:40Z","title":"WorldVLA: Towards Autoregressive Action World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21539","snapshot_observed_at":"2026-08-14T04:27:01.246456Z","title":"Worldvla: Towards autoregressive action world model.arXiv preprint arXiv:2506.21539,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-17T06:26:07.147538Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.246456Z"},"links":{"cited_paper":"/paper/2506.21539","citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:ac0f172925208d58092a387e72e6bbccc09521848c7e940bbbde636fdac66b5e","observation_id":"94a0bf8e-e965-4e35-bea9-f4996e576e80","resolution":{"observed_at":"2026-08-14T04:27:01.246456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-20T17:00:56.524771Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-14T04:27:01.271186Z","title":"Gr-2: A generative video-language-action model with web-scale knowledge for robot manipulation.arXiv preprint arXiv:2410.06158,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-17T06:26:07.147538Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.271186Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:4ac6ac6383bcd7db60e328463558fd503bdf4257d2305bd0808576c6e5004409","observation_id":"45301073-61e7-4430-a514-1d0e169dd403","resolution":{"observed_at":"2026-08-14T04:27:01.271186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00103","last_updated":"2024-12-30T19:00:25Z","snapshot_observed_at":"2026-07-06T20:14:54.297131Z","submitted_at":"2024-12-30T19:00:25Z","title":"LTX-Video: Realtime Video Latent Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00103","snapshot_observed_at":"2026-08-14T04:27:01.307886Z","title":"Ltx-video: Realtime video latent diffusion.arXiv preprint arXiv:2501.00103,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-17T06:26:07.147538Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.307886Z"},"links":{"cited_paper":"/paper/2501.00103","citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:37abe9b7594dc608540e9463b7d2a0a3917067c17a682df11b65ac46758b5a4d","observation_id":"41ef3d8a-b30a-4df4-a51e-6c1d3f278632","resolution":{"observed_at":"2026-08-14T04:27:01.307886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19854","last_updated":"2025-04-28T14:47:34Z","snapshot_observed_at":"2026-08-14T03:25:49.528763Z","submitted_at":"2025-04-28T14:47:34Z","title":"NORA: A Small Open-Sourced Generalist Vision Language Action Model for Embodied Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.19854","snapshot_observed_at":"2026-08-14T04:27:01.313720Z","title":"Nora: A small open-sourced generalist vision language action model for embodied tasks.arXiv preprint arXiv:2504.19854,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-17T06:26:07.147538Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.313720Z"},"links":{"cited_paper":"/paper/2504.19854","citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:ff1ef3005db55f7474b79964457c52bf2b6ee5d78f769e937181ad6bad5c5318","observation_id":"65d62c5e-809e-4f91-b6a6-4f2e9e8bfd07","resolution":{"observed_at":"2026-08-14T04:27:01.313720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:27:01.318910Z","title":"Rynnvla-001: Using human demonstrations to improve robot manipulation.arXiv preprint arXiv:2509.15212,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-17T06:26:07.147538Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.318910Z"},"links":{"citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:c6f2266b0eca866ba7e3d4fc31158f3756ca34df163ad7a804d2cdcd9877ec7a","observation_id":"6c097634-f4f9-47eb-a59c-167333b337e8","resolution":{"observed_at":"2026-08-14T04:27:01.318910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.16163","last_updated":"2026-01-22T18:09:30Z","snapshot_observed_at":"2026-08-20T07:20:19.015572Z","submitted_at":"2026-01-22T18:09:30Z","title":"Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.16163","snapshot_observed_at":"2026-08-14T04:27:01.322000Z","title":"2025.XXI.017","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-17T06:26:07.147538Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.322000Z"},"links":{"cited_paper":"/paper/2601.16163","citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:fb8f25f9565c7cc7137913abea6dc3a514ca41b85f2893a29c8b107bcec3eb22","observation_id":"5647a053-0c1a-4c39-bb99-f593781aed6e","resolution":{"observed_at":"2026-08-14T04:27:01.322000Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00200","last_updated":"2025-04-24T20:02:43Z","snapshot_observed_at":"2026-08-14T06:14:38.487820Z","submitted_at":"2025-02-28T21:38:17Z","title":"Unified Video Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.00200","snapshot_observed_at":"2026-08-14T04:27:01.332559Z","title":"Unified video action model.arXiv preprint arXiv:2503.00200,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-17T06:26:07.147538Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.332559Z"},"links":{"cited_paper":"/paper/2503.00200","citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:28993b9d6b9b5fb1ba3bbdfca484fcdb510e20887087a50e10dcadff647a3264","observation_id":"6f83a792-6cb8-4ded-8659-693c7593dfbd","resolution":{"observed_at":"2026-08-14T04:27:01.332559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05635","last_updated":"2025-11-04T12:01:01Z","snapshot_observed_at":"2026-08-14T13:55:25.823113Z","submitted_at":"2025-08-07T17:59:44Z","title":"Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05635","snapshot_observed_at":"2026-08-14T04:27:01.336990Z","title":"Genie envisioner: A unified world foundation platform for robotic manipulation.arXiv preprint arXiv:2508.05635,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-17T06:26:07.147538Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.336990Z"},"links":{"cited_paper":"/paper/2508.05635","citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:cc29c5376b55983906864615ba5d0d6a60a2ac1a28a86baf9e6525e17abbd74c","observation_id":"f5fa2be7-2580-4e88-9baa-cdbd2005f8e1","resolution":{"observed_at":"2026-08-14T04:27:01.336990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.10647","last_updated":"2025-11-13T18:59:53Z","snapshot_observed_at":"2026-08-15T23:16:19.228206Z","submitted_at":"2025-11-13T18:59:53Z","title":"Depth Anything 3: Recovering the Visual Space from Any Views","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.10647","snapshot_observed_at":"2026-08-14T04:27:01.346136Z","title":"Depth anything 3: Recovering the visual space from any views.arXiv preprint arXiv:2511.10647,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-17T06:26:07.147538Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.346136Z"},"links":{"cited_paper":"/paper/2511.10647","citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:063751b25717738f4419ad057d2300a24b1a34e9d58037f5e9707f173ddf06a1","observation_id":"d0d199e1-abd0-4e4c-80c8-412f57e1ed56","resolution":{"observed_at":"2026-08-14T04:27:01.346136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.06481","last_updated":"2026-05-07T16:06:08Z","snapshot_observed_at":"2026-08-11T07:38:44.239882Z","submitted_at":"2026-05-07T16:06:08Z","title":"OA-WAM: Object-Addressable World Action Model for Robust Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.06481","snapshot_observed_at":"2026-08-14T04:27:01.356892Z","title":"Oa-wam: Object-addressable world action model for robust robot manipulation.arXiv preprint arXiv:2605.06481,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-17T06:26:07.147538Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.356892Z"},"links":{"cited_paper":"/paper/2605.06481","citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:8c38470032073cdae578e4ecce650d1bfbfdab66b5eed0eea88fdbec1c5c4764","observation_id":"73a90e82-f850-41f5-a373-264846f5716c","resolution":{"observed_at":"2026-08-14T04:27:01.356892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.19683","last_updated":"2026-04-22T17:44:56Z","snapshot_observed_at":"2026-08-15T06:57:44.935343Z","submitted_at":"2026-04-21T17:05:37Z","title":"Mask World Model: Predicting What Matters for Robust Robot Policy Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.19683","snapshot_observed_at":"2026-08-14T04:27:01.365387Z","title":"Mask world model: Predicting what matters for robust robot policy learning.arXiv preprint arXiv:2604.19683,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-17T06:26:07.147538Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.365387Z"},"links":{"cited_paper":"/paper/2604.19683","citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:4f5da9ae7f5256bd6beac2f51c3c4b407e241c59d0abea0b1f33c1d7bfb04484","observation_id":"416ca311-f861-4115-88b2-4b45c2ff0c0c","resolution":{"observed_at":"2026-08-14T04:27:01.365387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:27:01.378434Z","title":"Dit4dit: Jointly modeling video dynamics and actions for generalizable robot control.arXiv preprint arXiv:2603.10448,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-17T06:26:07.147538Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.378434Z"},"links":{"citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:0fe0b11cd5770899a710c56982209d4d500e17525fd80f989bc99567d4b97bd9","observation_id":"4f851e50-8e62-45e1-a400-2bce99d00a32","resolution":{"observed_at":"2026-08-14T04:27:01.378434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-08-21T05:15:36.931588Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-14T04:27:01.382735Z","title":"Fast: Efficient action tokenization for vision-language-action models.arXiv preprint arXiv:2501.09747,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-17T06:26:07.147538Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.382735Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:0ec6c7a329c43b4964d1a2fefa371a61aae191024adcf05fb0734e69689b1391","observation_id":"df5a5daf-c291-4eb0-8c32-af1a286e8981","resolution":{"observed_at":"2026-08-14T04:27:01.382735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-14T04:27:01.415201Z","title":"Siglip 2: Multilingual vision-language encoders with improved semantic understanding, localization, and dense features.arXiv preprint arXiv:2502.14786,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-17T06:26:07.147538Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.415201Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:b29b02290bdaf171eb465c0096f718cff946dcb5ef55091233f278d464e8e999","observation_id":"98d7f6f8-d680-4a1a-a310-45b741db355f","resolution":{"observed_at":"2026-08-14T04:27:01.415201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:27:01.436760Z","title":"S-VAM: Shortcut video-action model by self-distilling geometric and semantic foresight.arXiv preprint arXiv:2603.16195,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-17T06:26:07.147538Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.436760Z"},"links":{"citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:a46dd5d740009b464cddf57ef251008e84c2295a21c36671b46d12b91a70fd87","observation_id":"27bcc08b-6877-4a20-ad7d-935a2ad0db66","resolution":{"observed_at":"2026-08-14T04:27:01.436760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.13515","snapshot_observed_at":"2026-08-14T04:27:01.450632Z","title":"Maskwam: Unifying mask prompting and prediction for world-action models.arXiv preprint arXiv:2606.13515,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-17T06:26:07.147538Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.450632Z"},"links":{"cited_paper":"/paper/2606.13515","citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:3dc0421460b101bc13d35bb0168ea4ad940961238f13c9dbfec0a39112652f3f","observation_id":"0c20bc1a-e422-464d-878c-7855c0698104","resolution":{"observed_at":"2026-08-14T04:27:01.450632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.16666","last_updated":"2026-03-23T05:41:14Z","snapshot_observed_at":"2026-08-20T03:53:25.888886Z","submitted_at":"2026-03-17T15:33:43Z","title":"Fast-WAM: Do World Action Models Need Test-time Future Imagination?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.16666","snapshot_observed_at":"2026-08-14T04:27:01.455192Z","title":"Fast-wam: Do world action models need test-time future imagination?arXiv preprint arXiv:2603.16666,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-17T06:26:07.147538Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.455192Z"},"links":{"cited_paper":"/paper/2603.16666","citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:f6c36c4072a00d601a8dc83998d16e1043111baa3fb8206227bc2e8803ceaa52","observation_id":"f19e0cf9-3b5d-42c8-8b9a-e98d39b885b3","resolution":{"observed_at":"2026-08-14T04:27:01.455192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:27:01.462371Z","title":"FlowVLA: Visual chain of thought-based motion reasoning for vision-language-action models.arXiv preprint arXiv:2508.18269,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-17T06:26:07.147538Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.462371Z"},"links":{"citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:54f1d7cd6bbbcabc8593b3eca57cf23c0e908ba980f59f20510791a35d86d47f","observation_id":"ea6ecb71-d1cd-4df9-b9cb-08a5ea330434","resolution":{"observed_at":"2026-08-14T04:27:01.462371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:27:01.467787Z","title":"DualCoT-VLA: Visual-linguistic chain of thought via parallel reasoning for vision-language-action models.arXiv preprint arXiv:2603.22280,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-17T06:26:07.147538Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.467787Z"},"links":{"citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:261f1f7f90c90791411c02c73d6df183337130ecee40820e964d144eedd5f9a7","observation_id":"01a340b4-28fb-446a-a0ba-9d9f01afd41b","resolution":{"observed_at":"2026-08-14T04:27:01.467787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02792","last_updated":"2025-05-23T00:47:24Z","snapshot_observed_at":"2026-08-10T02:54:28.264405Z","submitted_at":"2025-04-03T17:38:59Z","title":"Unified World Models: Coupling Video and Action Diffusion for Pretraining on Large Robotic Datasets","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02792","snapshot_observed_at":"2026-08-14T04:27:01.479963Z","title":"Unified world models: Coupling video and action diffusion for pretraining on large robotic datasets.arXiv preprint arXiv:2504.02792,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-17T06:26:07.147538Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.479963Z"},"links":{"cited_paper":"/paper/2504.02792","citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:ba387250d2eb2334d18127613f113f06af9342075125007ac413b579ced01233","observation_id":"c3d68a9d-5b10-45b2-81f9-802e6f4f655e","resolution":{"observed_at":"2026-08-14T04:27:01.479963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.04927","last_updated":"2026-07-06T10:57:01Z","snapshot_observed_at":"2026-08-14T09:59:31.893846Z","submitted_at":"2026-07-06T10:57:01Z","title":"DSWAM: A Dual-System World Action Foundation Model for Fine-Grained Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2607.04927","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.04927","snapshot_observed_at":"2026-08-14T04:27:01.554266Z","title":"DSWAM: A Dual-System World Action Foundation Model for Fine-Grained Robot Manipulation","venue":"cs.RO","work_id":"0d74b52b-3d57-4e7b-956d-902d705b5442","year":2026},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-17T06:26:07.147538Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.485780Z"},"links":{"cited_paper":"/paper/2607.04927","citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:f45d8be40ed8ab87b380e24813b7016f45747f46c42e43cdaea0988407001a86","observation_id":"e357fa73-6940-4db3-bb28-3a4ac4759dd9","resolution":{"observed_at":"2026-08-14T04:27:01.558768Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-08-14T04:27:01.402929Z","title":"ReconVLA: Reconstructive vision-language-action model as effective robot perceiver","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-17T06:26:07.147538Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.402929Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:712a423dc69fc14c1c3afcce36622a77f1543af3b05843358cb0cb492c2526cb","observation_id":"6a50ebe8-ed3b-405d-baff-8aefda09b651","resolution":{"observed_at":"2026-08-14T04:27:01.402929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06111","last_updated":"2025-11-03T11:52:57Z","snapshot_observed_at":"2026-08-09T00:51:47.897197Z","submitted_at":"2025-05-09T15:11:13Z","title":"UniVLA: Learning to Act Anywhere with Task-centric Latent Actions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06111","snapshot_observed_at":"2026-08-14T04:27:01.238908Z","title":"Univla: Learning to act anywhere with task-centric latent actions.arXiv preprint arXiv:2505.06111,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-17T06:26:07.147538Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.238908Z"},"links":{"cited_paper":"/paper/2505.06111","citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:8f71abc0cea3d7f9504c5159589e3845db30624713f6be30c86299370931b01b","observation_id":"7cca0c34-2788-4da8-bdce-8b05e6dbe381","resolution":{"observed_at":"2026-08-14T04:27:01.238908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13626","last_updated":"2025-12-26T12:19:56Z","snapshot_observed_at":"2026-08-21T10:57:34.843204Z","submitted_at":"2025-10-15T14:51:36Z","title":"LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.13626","snapshot_observed_at":"2026-08-14T04:27:01.290804Z","title":"Libero-plus: In-depth robustness analysis of vision-language-action models.arXiv preprint arXiv:2510.13626,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-17T06:26:07.147538Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.290804Z"},"links":{"cited_paper":"/paper/2510.13626","citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:6b6df6d1828073af5fba53d1625e07c28766d93550a8f14fc5eaa419d8d244f2","observation_id":"b1b0234c-48e2-4d0c-8b5f-f201e595275f","resolution":{"observed_at":"2026-08-14T04:27:01.290804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-14T04:27:01.206906Z","title":"Gr00t n1: An open foundation model for generalist humanoid robots.arXiv preprint arXiv:2503.14734,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-17T06:26:07.147538Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.206906Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:599853627d748655cf848e82c1458e47efaf2887cea1cbc20906968d6bce1690","observation_id":"5e761f15-8856-4ccf-af6c-764da0415a20","resolution":{"observed_at":"2026-08-14T04:27:01.206906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21998","last_updated":"2026-03-22T15:37:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-29T17:07:43Z","title":"Causal World Modeling for Robot Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.21998","snapshot_observed_at":"2026-08-14T04:27:01.327148Z","title":"Causal world modeling for robot control.arXiv preprint arXiv:2601.21998,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-17T06:26:07.147538Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.327148Z"},"links":{"cited_paper":"/paper/2601.21998","citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:cbca02867e3f0e0593ad599c21dfb5a4a8f2e4815db7539b7dd5bbd9c9969c8d","observation_id":"3c97199d-61b9-4aae-a5e6-e6f88464c71c","resolution":{"observed_at":"2026-08-14T04:27:01.327148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-17T06:26:07.147538Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 0 inbound Pith citation observations for arXiv:2608.08839."}