{"as_of":"2026-08-11T00:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:adc388dc962e3e74a2f7c72e5ccccdc40284fe6a53212e5196f2d4e4ce992133","coverage":[{"denominator":120,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T05:06:52.022607Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.07408/citation-record","integrity":"/paper/2608.07408/integrity","json":"/paper/2608.07408/citation-record.json","paper":"/paper/2608.07408"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-08-10T05:06:51.699806Z","title":"Cosmos 3: Omnimodal world models for physical ai.arXiv preprint arXiv:2606.02800, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.699806Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:c1084d36fa116c25553d311dbf8bae05cccac8d6c10de7b49172abb1f0bf8424","observation_id":"91dddf21-8cd7-473a-a03a-66e3ae65cbcf","resolution":{"observed_at":"2026-08-10T05:06:51.699806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06205","last_updated":"2025-05-13T14:11:59Z","snapshot_observed_at":"2026-08-07T03:18:17.365096Z","submitted_at":"2024-10-08T17:07:01Z","title":"Round and Round We Go! What makes Rotary Positional Encodings useful?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06205","snapshot_observed_at":"2026-08-10T05:06:51.704237Z","title":"Round and round we go! what makes rotary positional encodings useful? InInternational Conference on Learning Representations (ICLR), 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.704237Z"},"links":{"cited_paper":"/paper/2410.06205","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:8d3902fb9b73c841adb98ce045f99b057048c1813ed3edb18d07f2b85d0e2a7f","observation_id":"7528a57e-f4fd-4f91-afb6-ee3666f0aa7e","resolution":{"observed_at":"2026-08-10T05:06:51.704237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.03159","last_updated":"2026-07-23T22:35:14Z","snapshot_observed_at":"2026-08-02T12:34:11.019179Z","submitted_at":"2026-06-02T05:11:05Z","title":"NVIDIA OmniDreams: Real-Time Generative World Model for Closed-Loop Autonomous Vehicle Simulation","version":2},"cited_work":{"arxiv_id":"2606.03159","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.03159","snapshot_observed_at":"2026-08-10T05:06:56.401302Z","title":"NVIDIA OmniDreams: Real-Time Generative World Model for Closed-Loop Autonomous Vehicle Simulation","venue":"cs.CV","work_id":"548f4bce-8347-4c16-8fba-df5ade7aaf54","year":2026},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.707884Z"},"links":{"cited_paper":"/paper/2606.03159","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:9c74484077e2e9ff20a25fbe6ae42ebb695fb7567efcd98015179be9e188beac","observation_id":"a8f3e74f-95e1-41ce-9902-adf2a33ca7dc","resolution":{"observed_at":"2026-08-10T05:06:56.404991Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-10T05:06:51.711233Z","title":"Peters, and Arman Cohan","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.711233Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:551e8f18da9f31c517222b438630c0a3bcfb231059b700da267bc9d1a503c17c","observation_id":"5d95ce7c-d24c-4c40-9d2a-26901cf9f142","resolution":{"observed_at":"2026-08-10T05:06:51.711233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.21489","last_updated":"2026-05-21T21:50:17Z","snapshot_observed_at":"2026-08-02T14:20:11.088817Z","submitted_at":"2026-05-20T17:59:52Z","title":"Variance Reduction for Expectations with Diffusion Teachers","version":2},"cited_work":{"arxiv_id":"2605.21489","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.21489","snapshot_observed_at":"2026-08-10T05:06:56.377038Z","title":"Variance Reduction for Expectations with Diffusion Teachers","venue":"cs.LG","work_id":"39608073-51f4-4080-8e00-5705cfb40914","year":2026},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.714636Z"},"links":{"cited_paper":"/paper/2605.21489","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:62e42c57e028458e052ed05eff03d145b6797e7f6ecaf2faf94214247878afec","observation_id":"c47d67ba-feee-4af2-ab43-c0b46352b11f","resolution":{"observed_at":"2026-08-10T05:06:56.381256Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.718099Z","title":"Token merging: Your ViT but faster","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.718099Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:9ddbd4cb8c6908a594cf45582a74f70602bbe8bf6c34044b30cd7d0374cb17ca","observation_id":"d29b49ed-1b39-413e-a48e-73f7cd861f3c","resolution":{"observed_at":"2026-08-10T05:06:51.718099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.721638Z","title":"Recurrentmemorytransformer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.721638Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:6b32f6d7a08366c5a36737649c880cc9702a31c6b9aafed355a832169d8948c1","observation_id":"c4c3c9d2-ba07-46f1-9448-e4fe74264f76","resolution":{"observed_at":"2026-08-10T05:06:51.721638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.724686Z","title":"Mixture of contexts for long video generation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.724686Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:a0b4491f78c0370f74185d06e648e67f1ec1a7617c84d7087b85441ed467b3a3","observation_id":"fe7ebef4-6ad7-4617-bf71-6a922bc30e3e","resolution":{"observed_at":"2026-08-10T05:06:51.724686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.727509Z","title":"PyramidKV: Dynamic KV cache compression based on pyramidal information funneling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.727509Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:ac92a9fd19121f434a1a333b315fe85633473691419f3b51c892926ef75b81e1","observation_id":"8f8f6f4e-e63a-4705-8c2c-04581997312a","resolution":{"observed_at":"2026-08-10T05:06:51.727509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.730698Z","title":"Diffusion forcing: Next-token prediction meets full-sequence diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.730698Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:7630c56bfa4ee078a059c96296afcafb2a815742a7c59d2cd100cc32c79249f1","observation_id":"66121e07-549e-442d-9b59-46cfcd0d5f47","resolution":{"observed_at":"2026-08-10T05:06:51.730698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.733972Z","title":"Past- and future-informed kv cache policy with salience estimation in autoregressive video diffusion.arXiv preprint arXiv:2601.21896, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.733972Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:dd9481f962c2c62413fe9b900042eb7470dc10de6d0e28ebc53ca2ae7bdbeb32","observation_id":"72569696-3196-41d8-a983-122bbe4ae8d2","resolution":{"observed_at":"2026-08-10T05:06:51.733972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.06939","last_updated":"2026-04-13T17:35:53Z","snapshot_observed_at":"2026-07-06T22:55:20.208897Z","submitted_at":"2026-04-08T11:03:22Z","title":"Grounded Forcing: Bridging Time-Independent Semantics and Proximal Dynamics in Autoregressive Video Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.06939","snapshot_observed_at":"2026-08-10T05:06:51.737173Z","title":"Grounded forcing: Bridging time-independent semantics and proximal dynamics in autoregressive video synthesis.arXiv preprint arXiv:2604.06939, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.737173Z"},"links":{"cited_paper":"/paper/2604.06939","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:fb946c5d6cc477f0110e2f848d027d5ef63724b8e58eb71d4940c51c5a7f82a7","observation_id":"1ffda83b-fb20-41b7-af03-d9bafca2f1e2","resolution":{"observed_at":"2026-08-10T05:06:51.737173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15595","last_updated":"2023-06-28T04:26:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-27T16:26:26Z","title":"Extending Context Window of Large Language Models via Positional Interpolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15595","snapshot_observed_at":"2026-08-10T05:06:51.740643Z","title":"Extending context window of large language models via positional interpolation.arXiv preprint arXiv:2306.15595, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.740643Z"},"links":{"cited_paper":"/paper/2306.15595","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:ab77dce6b2d6b53589a3d7206b2c91df5aab380a0cb442796f309a64f0e02c90","observation_id":"fc86cc5f-0460-4489-9718-5e58d3fe3b02","resolution":{"observed_at":"2026-08-10T05:06:51.740643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.744146Z","title":"Context forcing: Consistent autoregressive video generation with long context.arXiv preprint arXiv:2602.06028, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.744146Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:0eb341f3799cb25462a8f32f7cb7ee638e7749b395ffdcd68af9687eff480801","observation_id":"64a0907e-d5ff-458c-bdeb-997c74c5484a","resolution":{"observed_at":"2026-08-10T05:06:51.744146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21996","last_updated":"2026-05-28T06:02:27Z","snapshot_observed_at":"2026-08-07T13:15:36.558064Z","submitted_at":"2025-05-28T05:55:44Z","title":"VRAG: Learning World Models for Interactive Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21996","snapshot_observed_at":"2026-08-10T05:06:51.747413Z","title":"Learning world models for interactive video generation.arXiv preprint arXiv:2505.21996, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.747413Z"},"links":{"cited_paper":"/paper/2505.21996","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:7c71a6ffaf81a620b816a1773a9d490ae83ad6aa7508e4b9a91a3c7719f8b194","observation_id":"6baf39b6-e159-4933-80e4-39e35ece8d5b","resolution":{"observed_at":"2026-08-10T05:06:51.747413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.751167Z","title":"FINCH: Prompt-guided key-value cache compression for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.751167Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:e1909b61541a71c0209cb773aa9ee6b60b45191496bf0d06cbd018ffc024a902","observation_id":"634e47f8-392f-448a-aff0-da0d87426578","resolution":{"observed_at":"2026-08-10T05:06:51.751167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.754420Z","title":"Lol: Longer than longer, scaling video generation to hour.arXiv preprint arXiv:2601.16914, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.754420Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:aa95a2771f49a99097f70ad2fbc08d1bcffc06474080a32e82375042d15307fd","observation_id":"cbd6ee8d-35dc-491d-8390-ac9135b57c4f","resolution":{"observed_at":"2026-08-10T05:06:51.754420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.02283","last_updated":"2025-10-02T17:55:42Z","snapshot_observed_at":"2026-08-09T17:36:50.125769Z","submitted_at":"2025-10-02T17:55:42Z","title":"Self-Forcing++: Towards Minute-Scale High-Quality Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.02283","snapshot_observed_at":"2026-08-10T05:06:51.757833Z","title":"Self-Forcing++: Towards minute-scale high-quality video generation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.757833Z"},"links":{"cited_paper":"/paper/2510.02283","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:5c82471c975b6304bc77879725e789f2b3580e72605591b0147bf9db125298a7","observation_id":"19f274db-1514-4a23-8140-2e0eacc5720d","resolution":{"observed_at":"2026-08-10T05:06:51.757833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.02860","last_updated":"2019-06-02T21:21:48Z","snapshot_observed_at":"2026-07-06T07:25:48.468658Z","submitted_at":"2019-01-09T18:28:19Z","title":"Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.02860","snapshot_observed_at":"2026-08-10T05:06:51.761506Z","title":"Le, and Ruslan Salakhutdinov","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.761506Z"},"links":{"cited_paper":"/paper/1901.02860","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:a60145d8ee54036d8439a3019096d4ed77551ee393a224497639143a2cfb640b","observation_id":"40a1ac60-fc60-45cb-8c83-9d9ada4bd0cf","resolution":{"observed_at":"2026-08-10T05:06:51.761506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.765198Z","title":"Oasis: A universe in a transformer.https://oasis-model.github.io, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.765198Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:57bd5e0a73848749a8fe993a012279ad84efc32fbaa4e058840b179a41813ecb","observation_id":"ea1c6f51-d05b-4b31-96ce-bb17f324f423","resolution":{"observed_at":"2026-08-10T05:06:51.765198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.768499Z","title":"WorldScore: A unified evaluation benchmark for world generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.768499Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:a6b3021b569486da824930960f006222b37baac956a2bc9333ca130484f937cb","observation_id":"f437397a-bae7-430f-8b66-5650f628291b","resolution":{"observed_at":"2026-08-10T05:06:51.768499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.771607Z","title":"A unified framework for approximating and clustering data","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.771607Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:2bbf089cca25d458e4227c421484708ce1386c5a18aeab4a5dfea8aa45e089ad","observation_id":"f019ce2e-f743-4eb5-89d2-ca3c65e8642a","resolution":{"observed_at":"2026-08-10T05:06:51.771607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.775432Z","title":"Memcam: Memory- augmented camera control for consistent video generation.arXiv preprint arXiv:2603.26193, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.775432Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:01ac2ad3248f6cfbfd072d67f8a0481883ba4a19015ce8c077c0d0e87cb0b8ba","observation_id":"03483878-b4e0-499b-81bd-85e31a3f7192","resolution":{"observed_at":"2026-08-10T05:06:51.775432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18719","last_updated":"2024-05-30T17:51:53Z","snapshot_observed_at":"2026-08-08T13:23:50.253213Z","submitted_at":"2024-05-29T02:57:15Z","title":"Contextual Position Encoding: Learning to Count What's Important","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18719","snapshot_observed_at":"2026-08-10T05:06:51.778667Z","title":"Contextual position encoding: Learning to count what’s important.arXiv preprint arXiv:2405.18719, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.778667Z"},"links":{"cited_paper":"/paper/2405.18719","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:7e984ab158d2e324a9c90890b11312e3b3ae1662cafd42201e68a0b44ba16c2c","observation_id":"e3736da0-d508-4182-964d-a81e8e3f08e5","resolution":{"observed_at":"2026-08-10T05:06:51.778667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.781948Z","title":"Genie 3: A new frontier for world models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.781948Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:c95600f2b46f1274e57c7042803a30c8ee3610cf0762a30ad7dd30b89cdac4e1","observation_id":"a6f6d7e9-d04d-43b0-b90f-1d8a30699903","resolution":{"observed_at":"2026-08-10T05:06:51.781948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.784638Z","title":"Mamba: Linear-time sequence modeling with selective state spaces","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.784638Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:fd6d15609dc3b6a28bcc8868289d96a513f25a80d0e728d3adc5cdf33319e33e","observation_id":"45dba7e6-fa47-460a-947d-89942018d259","resolution":{"observed_at":"2026-08-10T05:06:51.784638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19325","last_updated":"2025-05-18T02:27:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T03:38:06Z","title":"Long-Context Autoregressive Video Modeling with Next-Frame Prediction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19325","snapshot_observed_at":"2026-08-10T05:06:51.787420Z","title":"Long-context autoregressive video modeling with next-frame prediction.arXiv preprint arXiv:2503.19325, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.787420Z"},"links":{"cited_paper":"/paper/2503.19325","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:49e3e12262e816bc11a85e25599889795b3f0b5cd08db956ecd811e9d72cecbf","observation_id":"5b919a9d-fe83-4fc2-966b-325295ad91bb","resolution":{"observed_at":"2026-08-10T05:06:51.787420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.18215","last_updated":"2026-04-21T16:05:42Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:00:17Z","title":"Memorize When Needed: Decoupled Memory Control for Spatially Consistent Long-Horizon Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.18215","snapshot_observed_at":"2026-08-10T05:06:51.790280Z","title":"Memorize when needed: Decoupled memory control for spatially consistent long-horizon video generation.arXiv preprint arXiv:2604.18215, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.790280Z"},"links":{"cited_paper":"/paper/2604.18215","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:6b4df4205d8e8be73b112af42d4d3e28a68e2d847407b11967fe965f1f5c6a7a","observation_id":"6e8384ef-1551-4dec-8358-f5370072c761","resolution":{"observed_at":"2026-08-10T05:06:51.790280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.793059Z","title":"Recurrent world models facilitate policy evolution","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.793059Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:0a6771c0ec9d333a8a36188b91d748165efa097d3e7a625b3f8ecacbcb8c92bd","observation_id":"d25dd89a-6b4d-4c51-b4aa-3497b5ac48b2","resolution":{"observed_at":"2026-08-10T05:06:51.793059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.795696Z","title":"Mastering diverse control tasks through world models.Nature, 640:647–653, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.795696Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:e7e9ede3926f9820f19e946799160c6b2b6139e02df43a80a24416f942c6f9ed","observation_id":"52bc8748-c20a-4621-be85-6e16b6584354","resolution":{"observed_at":"2026-08-10T05:06:51.795696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12665","last_updated":"2025-06-03T17:18:23Z","snapshot_observed_at":"2026-08-07T18:09:46.801825Z","submitted_at":"2025-02-18T09:11:51Z","title":"A$^2$ATS: Retrieval-Based KV Cache Reduction via Windowed Rotary Position Embedding and Query-Aware Vector Quantization","version":2},"cited_work":{"arxiv_id":"2502.12665","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.12665","snapshot_observed_at":"2026-08-10T05:06:55.942533Z","title":"A$^2$ATS: Retrieval-Based KV Cache Reduction via Windowed Rotary Position Embedding and Query-Aware Vector Quantization","venue":"cs.CL","work_id":"fe339f44-c37f-44fb-a1e9-227a8ede709e","year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.798489Z"},"links":{"cited_paper":"/paper/2502.12665","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:311575ab5c79e6bad1b62ab2a053426f9d85254bd8a127956d36cd07539a8bed","observation_id":"d3ed0f70-18c3-4768-826a-8056568bb32c","resolution":{"observed_at":"2026-08-10T05:06:55.948862Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13009","last_updated":"2026-04-07T11:37:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-18T15:28:53Z","title":"Matrix-game 2.0: An open-source real-time and streaming interactive world model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.13009","snapshot_observed_at":"2026-08-10T05:06:51.801289Z","title":"Matrix-game 2.0: An open-source, real-time, and streaming interactive world model.arXiv preprint arXiv:2508.13009, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.801289Z"},"links":{"cited_paper":"/paper/2508.13009","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:8c2ef59411296c2f667b233845f7e4de777d610e20205c2e1a15fb150e5c0b55","observation_id":"613f3692-f94d-4567-af19-01e552b5d47d","resolution":{"observed_at":"2026-08-10T05:06:51.801289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14773","last_updated":"2025-04-16T13:38:58Z","snapshot_observed_at":"2026-08-09T14:37:44.086189Z","submitted_at":"2024-03-21T18:27:29Z","title":"StreamingT2V: Consistent, Dynamic, and Extendable Long Video Generation from Text","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14773","snapshot_observed_at":"2026-08-10T05:06:51.804256Z","title":"StreamingT2V: Consistent, dynamic, and extendable long video generation from text","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.804256Z"},"links":{"cited_paper":"/paper/2403.14773","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:a84bd4c27c6f9dccd227f2f680f97607712de80920bf83b5231aab9a65373da8","observation_id":"1ecc7a16-0e7d-4c3a-91e9-62594a23f9c8","resolution":{"observed_at":"2026-08-10T05:06:51.804256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13298","last_updated":"2024-07-16T04:54:56Z","snapshot_observed_at":"2026-07-06T17:47:30.518562Z","submitted_at":"2024-03-20T04:47:13Z","title":"Rotary Position Embedding for Vision Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13298","snapshot_observed_at":"2026-08-10T05:06:51.807153Z","title":"Rotary position embedding for vision transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.807153Z"},"links":{"cited_paper":"/paper/2403.13298","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:1d9a93e63d34519581eb06946fb0abac1cbca2cf2991dc64bb6bc6875334dff5","observation_id":"22778dbf-972b-4f61-a063-b0dcb288ae08","resolution":{"observed_at":"2026-08-10T05:06:51.807153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.810004Z","title":"RELIC: Interactive video world model with long-horizon memory.arXiv preprint arXiv:2512.04040, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.810004Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:2f4ccff52756fbb1d8bf9331788ba21f3d5c147d0c4ec1bf984f0d7ca711b936","observation_id":"d5056227-bf25-4709-829e-8880f2b2cb0b","resolution":{"observed_at":"2026-08-10T05:06:51.810004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17739","last_updated":"2025-07-14T04:23:36Z","snapshot_observed_at":"2026-08-10T13:01:13.628884Z","submitted_at":"2024-12-23T17:44:01Z","title":"Fourier Position Embedding: Enhancing Attention's Periodic Extension for Length Generalization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.17739","snapshot_observed_at":"2026-08-10T05:06:51.812677Z","title":"Fourier position embedding: Enhancing attention’s periodic extension for length generalization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.812677Z"},"links":{"cited_paper":"/paper/2412.17739","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:7df319b528c6a0419160dfce60d136ee5c7a9fa0451537aa6aaf384a3c3ec1f9","observation_id":"bfa75425-95e9-4cc8-95a2-268522f777dc","resolution":{"observed_at":"2026-08-10T05:06:51.812677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.815893Z","title":"Vid2World: Crafting video diffusion models to interactive world models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.815893Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:0191e94a10eaac7913379b619dd5c902b13cf6fd47ea4fee7185f5d478392553","observation_id":"578fb85c-1927-4c6b-b32e-f9ebd635c0e0","resolution":{"observed_at":"2026-08-10T05:06:51.815893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08009","last_updated":"2025-11-10T04:36:27Z","snapshot_observed_at":"2026-08-02T00:07:53.851104Z","submitted_at":"2025-06-09T17:59:55Z","title":"Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08009","snapshot_observed_at":"2026-08-10T05:06:51.818857Z","title":"Self forcing: Bridging the train-test gap in autoregressive video diffusion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.818857Z"},"links":{"cited_paper":"/paper/2506.08009","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:006274310f2885e1c916b39b6dc061e654c35f5d5da932e65d137746c50ea214","observation_id":"a7b5482e-334b-40b0-9d81-117133e1dfaa","resolution":{"observed_at":"2026-08-10T05:06:51.818857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.07852","last_updated":"2022-11-02T00:35:56Z","snapshot_observed_at":"2026-08-08T13:23:08.347838Z","submitted_at":"2022-03-11T23:44:33Z","title":"Block-Recurrent Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.07852","snapshot_observed_at":"2026-08-10T05:06:51.822520Z","title":"Block-recurrent transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.822520Z"},"links":{"cited_paper":"/paper/2203.07852","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:ad7b95b729ca5f095090df44e17a0797d812fe233a62471264839cf93216f2ce","observation_id":"c161ec1f-f0c5-4703-939c-b9dcdc7b853a","resolution":{"observed_at":"2026-08-10T05:06:51.822520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.825902Z","title":"Transformers are RNNs: Fast autore- gressive transformers with linear attention","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.825902Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:42e7b91bdae391673db0fa3c6da3a1b8334422a7ac1ffabc696fa5b64d975d08","observation_id":"ee220334-8634-4eca-a680-40f0eee0b7e0","resolution":{"observed_at":"2026-08-10T05:06:51.825902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.19466","last_updated":"2023-11-06T19:48:10Z","snapshot_observed_at":"2026-07-06T15:35:41.522547Z","submitted_at":"2023-05-31T00:29:55Z","title":"The Impact of Positional Encoding on Length Generalization in Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.19466","snapshot_observed_at":"2026-08-10T05:06:51.829142Z","title":"The impact of positional encoding on length generalization in transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.829142Z"},"links":{"cited_paper":"/paper/2305.19466","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:543c835dc26544c5a5690b2c7a19630a8cb6d8e0d919944165a26f52836cc7a6","observation_id":"8f2611ed-07eb-4757-83a6-b167dacfe868","resolution":{"observed_at":"2026-08-10T05:06:51.829142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.832659Z","title":"Jay Kuo, and Peter A","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.832659Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:9db1012906f28ae373b49fd16d79d5d88ed654c9f1ea784541aa6310266d348e","observation_id":"1962a171-d7bb-4c8a-979f-14fbaf6a2575","resolution":{"observed_at":"2026-08-10T05:06:51.832659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.835834Z","title":"Robust nonnegative matrix factorization using l21-norm","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.835834Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:e5b6db4314684facfd8d22ff65e288a43074effb032fcfbd8085ce72ccdd29ad","observation_id":"b421cdb8-9622-4ef8-b681-bbcdd47326a1","resolution":{"observed_at":"2026-08-10T05:06:51.835834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.839051Z","title":"Lee and H","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.839051Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:f13e8a0d279c4196f0d609765528bf245f7594f64e098712bc79511d4d8991f4","observation_id":"88b6d623-057b-4204-9a35-ba8d372a4def","resolution":{"observed_at":"2026-08-10T05:06:51.839051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.17196","last_updated":"2026-04-30T15:40:24Z","snapshot_observed_at":"2026-07-06T22:33:34.164422Z","submitted_at":"2025-10-20T06:17:57Z","title":"Understanding and Improving Length Generalization in Hierarchical Sparse Attention Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.17196","snapshot_observed_at":"2026-08-10T05:06:51.842394Z","title":"Understanding and improving length generalization in hierarchical sparse attention models.arXiv preprint arXiv:2510.17196, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.842394Z"},"links":{"cited_paper":"/paper/2510.17196","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:42a5e886b7e5dfe545a2c942b75e94f3b9923b65966bc9237f6c62dab6c346cb","observation_id":"383659e2-0643-4ac9-824d-9b509bfdda14","resolution":{"observed_at":"2026-08-10T05:06:51.842394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.07775","last_updated":"2026-05-03T01:49:14Z","snapshot_observed_at":"2026-07-30T09:22:37.641917Z","submitted_at":"2026-02-08T02:16:02Z","title":"Rolling Sink: Bridging Limited-Horizon Training and Open-Ended Testing in Autoregressive Video Diffusion","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.07775","snapshot_observed_at":"2026-08-10T05:06:51.845827Z","title":"Rolling sink: Bridging limited-horizon training and open-ended testing in autoregressive video diffusion.arXiv preprint arXiv:2602.07775, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.845827Z"},"links":{"cited_paper":"/paper/2602.07775","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:88f79b847b396c2d371221178156e001424094c583d5a80bbec0bf194bc24ed9","observation_id":"905facbf-630e-4981-9740-9d27a14b048c","resolution":{"observed_at":"2026-08-10T05:06:51.845827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.849683Z","title":"Train short, inference long: Training-free horizon extension for autoregressive video generation.arXiv preprint arXiv:2602.14027, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.849683Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:46db8df13fca6fdbb3a130f3f5a4f2a94daa5e0e5eb8de641b7ecbed10d1adbb","observation_id":"6723b123-bdad-46d4-bdbb-9b27cc723b67","resolution":{"observed_at":"2026-08-10T05:06:51.849683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.853092Z","title":"PackCache: A training-free acceleration method for unified autoregressive video generation via compact KV-cache.arXiv preprint arXiv:2601.04359, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.853092Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:65b7a67ca8fd5e3967863d04e416851bda3cd294411b78b7a1694b124fdca945","observation_id":"7e76c29e-770c-49e0-a061-6c12c4a6f8b7","resolution":{"observed_at":"2026-08-10T05:06:51.853092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.10103","last_updated":"2026-04-28T08:33:18Z","snapshot_observed_at":"2026-07-06T22:58:47.599383Z","submitted_at":"2026-04-11T08:54:07Z","title":"Long-Horizon Streaming Video Generation via Hybrid Attention with Decoupled Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.10103","snapshot_observed_at":"2026-08-10T05:06:51.856531Z","title":"Long-horizon streaming video generation via hybrid attention with decoupled distillation.arXiv preprint arXiv:2604.10103, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.856531Z"},"links":{"cited_paper":"/paper/2604.10103","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:8a5e3bb0eac52d612ad51512bc3478759e410ed66b3e426af006116dbeddbcfd","observation_id":"02f61ce5-176a-42d0-b586-cf9e55dc44fb","resolution":{"observed_at":"2026-08-10T05:06:51.856531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.860251Z","title":"Cameras as relative positional encoding","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.860251Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:9210ca25074ef0f0e4d29467b835b01f4b2e62097f545905c20e9344a62758f5","observation_id":"bb0d9e24-d699-45a6-ac54-f152584b9165","resolution":{"observed_at":"2026-08-10T05:06:51.860251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18903","last_updated":"2025-08-14T14:03:30Z","snapshot_observed_at":"2026-08-10T10:39:31.441499Z","submitted_at":"2025-06-23T17:59:56Z","title":"VMem: Consistent Interactive Video Scene Generation with Surfel-Indexed View Memory","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18903","snapshot_observed_at":"2026-08-10T05:06:51.863744Z","title":"VMem: Consistent interactive video scene generation with surfel-indexed view memory","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.863744Z"},"links":{"cited_paper":"/paper/2506.18903","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:66fa2be083f1628f8263462e6c448ad18e5ee522732fa76f83e566920741e7e1","observation_id":"de891703-bf83-4994-a4e0-ab76812214f2","resolution":{"observed_at":"2026-08-10T05:06:51.863744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.866780Z","title":"Stable video infinity: Infinite-length video generation with error recycling.arXiv preprint arXiv:2510.09212, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.866780Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:07dd100874f7b20a2e043db3e1e9251f8720a2ee3a7cdbe4b17ca6cfbc5a2450","observation_id":"32182234-1248-4cdc-bd14-87e95f0bce03","resolution":{"observed_at":"2026-08-10T05:06:51.866780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14469","last_updated":"2024-06-17T03:01:58Z","snapshot_observed_at":"2026-08-07T22:57:56.263839Z","submitted_at":"2024-04-22T17:42:58Z","title":"SnapKV: LLM Knows What You are Looking for Before Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14469","snapshot_observed_at":"2026-08-10T05:06:51.869780Z","title":"SnapKV:LLMknowswhatyouarelookingforbeforegeneration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.869780Z"},"links":{"cited_paper":"/paper/2404.14469","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:2c5b56651f4e503eb6282241226eea22a8556680492bf29a2846bdfbbcf235e7","observation_id":"94be4b49-5b3b-4c47-9e14-b5e75d728040","resolution":{"observed_at":"2026-08-10T05:06:51.869780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22976","last_updated":"2026-05-08T04:02:37Z","snapshot_observed_at":"2026-08-02T20:46:05.777520Z","submitted_at":"2025-05-29T01:28:57Z","title":"LoopNav: Benchmarking Spatial Consistency in World Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22976","snapshot_observed_at":"2026-08-10T05:06:51.873150Z","title":"Toward memory-aided world models: Benchmarking via spatial consistency.arXiv preprint arXiv:2505.22976, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.873150Z"},"links":{"cited_paper":"/paper/2505.22976","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:14e87ae08d01df505e5da5a12c8b8c8672bd709e6211794ed0379576500db930","observation_id":"562e98e3-2e84-4069-9556-a10cd7445178","resolution":{"observed_at":"2026-08-10T05:06:51.873150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.25161","last_updated":"2025-09-29T17:57:14Z","snapshot_observed_at":"2026-08-09T09:15:39.740119Z","submitted_at":"2025-09-29T17:57:14Z","title":"Rolling Forcing: Autoregressive Long Video Diffusion in Real Time","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.25161","snapshot_observed_at":"2026-08-10T05:06:51.876309Z","title":"Rolling forcing: Autoregressive long video diffusion in real time","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.876309Z"},"links":{"cited_paper":"/paper/2509.25161","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:4b663cb8bdc03435e2c902183d0592da22ea77a8e309ffeca3e975b16b96a793","observation_id":"9329cf75-9c5e-4d92-8c27-a520c49578a8","resolution":{"observed_at":"2026-08-10T05:06:51.876309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02750","last_updated":"2024-07-25T09:16:05Z","snapshot_observed_at":"2026-07-06T17:25:18.238343Z","submitted_at":"2024-02-05T06:06:47Z","title":"KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02750","snapshot_observed_at":"2026-08-10T05:06:51.879558Z","title":"KIVI: A tuning-free asymmetric 2-bit quantization for KV cache","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.879558Z"},"links":{"cited_paper":"/paper/2402.02750","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:46d1456f920a0d370057f58f873741133ecbbb1e5ed6302a119e111b50ed2a84","observation_id":"5e2835f8-be93-4c5a-acbf-5a5e80310f76","resolution":{"observed_at":"2026-08-10T05:06:51.879558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.882731Z","title":"JacNet: Learning functions with structured Jacobians","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.882731Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:0c0c73722ea12a95ec214b5bed0b410b01deee67395ef01fe2f8080d070089ed","observation_id":"f941b651-7c6a-4d9e-be46-daeada6be491","resolution":{"observed_at":"2026-08-10T05:06:51.882731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.12754","last_updated":"2022-08-26T16:07:14Z","snapshot_observed_at":"2026-07-06T13:45:53.490825Z","submitted_at":"2022-08-26T16:07:14Z","title":"Task Selection for AutoML System Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.12754","snapshot_observed_at":"2026-08-10T05:06:51.885612Z","title":"Task selection for AutoML system evaluation.arXiv preprint arXiv:2208.12754, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.885612Z"},"links":{"cited_paper":"/paper/2208.12754","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:8b39456f9bd1fe00270f4346f2d7297b9441aa6c037bdbb37fbefca5eb84456b","observation_id":"552639f3-182c-4464-b22a-91d52fc77809","resolution":{"observed_at":"2026-08-10T05:06:51.885612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.888849Z","title":"ATT3D: Amortized text-to-3D object synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.888849Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:dea76aee27dcdf81d8b9747d10bbaa8991eb8bc00ba5e40c3088e1666c13e92f","observation_id":"9525ee8d-21fe-4950-9617-1cc7aa81e211","resolution":{"observed_at":"2026-08-10T05:06:51.888849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.891520Z","title":"Flow caching for autoregressive video generation.arXiv preprint arXiv:2602.10825, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.891520Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:25158ecf6c8713efd03fb0e493a9634b5e02f9cc4d4b170c033943a3b50cef30","observation_id":"710479b7-ebba-4f2e-a7f6-96d07dceb05c","resolution":{"observed_at":"2026-08-10T05:06:51.891520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.04921","last_updated":"2026-04-06T17:58:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-06T17:58:42Z","title":"TriAttention: Efficient Long Reasoning with Trigonometric KV Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.04921","snapshot_observed_at":"2026-08-10T05:06:51.894378Z","title":"TriAttention: Efficient long reasoning with trigonometric KV compression.arXiv preprint arXiv:2604.04921, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.894378Z"},"links":{"cited_paper":"/paper/2604.04921","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:54f515703160c64f2c41601126a2fbd71cb7449e9a58cbf6711a877d8e3ad717","observation_id":"db742686-b706-49a0-b81c-697c9cdfe559","resolution":{"observed_at":"2026-08-10T05:06:51.894378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.897344Z","title":"PackForcing: Short video training suffices for long video sampling and long context inference.arXiv preprint arXiv:2603.25730, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.897344Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:5fec2ed2598d48077e79805d5bbf268fab6f65ca628b75a70808dac89b4a42ab","observation_id":"5a383fa8-5c2d-4d8f-aa09-a6fae5d36853","resolution":{"observed_at":"2026-08-10T05:06:51.897344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16300","last_updated":"2023-11-20T01:16:17Z","snapshot_observed_at":"2026-08-04T15:01:39.394740Z","submitted_at":"2023-05-25T17:53:42Z","title":"Landmark Attention: Random-Access Infinite Context Length for Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16300","snapshot_observed_at":"2026-08-10T05:06:51.900992Z","title":"Landmark attention: Random-access infinite context length for trans- formers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.900992Z"},"links":{"cited_paper":"/paper/2305.16300","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:df6950cb1f4328934adeefd706a544e84d1f39cc32e51bc4ab8407b36173805b","observation_id":"4d4e19e2-0b8a-485f-8a01-00bd839a6c22","resolution":{"observed_at":"2026-08-10T05:06:51.900992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07143","last_updated":"2024-08-09T22:37:25Z","snapshot_observed_at":"2026-08-02T14:27:24.212588Z","submitted_at":"2024-04-10T16:18:42Z","title":"Leave No Context Behind: Efficient Infinite Context Transformers with Infini-attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07143","snapshot_observed_at":"2026-08-10T05:06:51.904460Z","title":"Leave no context behind: Efficient infinite context transformers with Infini-attention.arXiv preprint arXiv:2404.07143, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.904460Z"},"links":{"cited_paper":"/paper/2404.07143","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:c6955aadff77f4752e5e1810eae319ee27bd4ba7fc6c2777389b16ea6bcad967","observation_id":"a788e2bf-48d1-495e-8bb0-e2821e928d0a","resolution":{"observed_at":"2026-08-10T05:06:51.904460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.908045Z","title":"KVPress: A compression library for transformer KV caches.https://github.com/NVIDIA/kvpress, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.908045Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:aae7cabd4ce874b578ece8f895f6c031a4be0740ace90df43dafee3c854d8ed3","observation_id":"f7d0633f-ef88-46a1-8be5-ae07b9b18d9f","resolution":{"observed_at":"2026-08-10T05:06:51.908045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.02473","last_updated":"2026-07-22T11:47:21Z","snapshot_observed_at":"2026-08-10T04:00:25.183173Z","submitted_at":"2025-12-02T07:06:23Z","title":"WorldPack: Dynamic Frame Compression for Long-context Video World Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.02473","snapshot_observed_at":"2026-08-10T05:06:51.911350Z","title":"WorldPack: Compressed memory improves spatial consistency in video world modeling.arXiv preprint arXiv:2512.02473, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.911350Z"},"links":{"cited_paper":"/paper/2512.02473","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:46f95bcb271943d0c5d397ba638f2a7babdfb70086a563329a5b659293ef306e","observation_id":"866ad531-9c4e-4db8-952d-3b7609f609b1","resolution":{"observed_at":"2026-08-10T05:06:51.911350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00071","last_updated":"2026-02-06T19:40:50Z","snapshot_observed_at":"2026-08-01T02:15:47.181936Z","submitted_at":"2023-08-31T18:18:07Z","title":"YaRN: Efficient Context Window Extension of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00071","snapshot_observed_at":"2026-08-10T05:06:51.914934Z","title":"YaRN: Efficient context window extension of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.914934Z"},"links":{"cited_paper":"/paper/2309.00071","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:6980253915ed1ffec2d0266605326b72ad64fc4939f6848c955038f34674659b","observation_id":"e412048b-faec-4d7f-921a-bd699312e06b","resolution":{"observed_at":"2026-08-10T05:06:51.914934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.918609Z","title":"Long-context state-space video world models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.918609Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:114991715be3bec853bcdcbf5186163a1b0c097b3ee1470f5ca195108e18999b","observation_id":"56cb717b-9da6-449f-b17c-be8f860716db","resolution":{"observed_at":"2026-08-10T05:06:51.918609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.921685Z","title":"Smith, and Mike Lewis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.921685Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:aef18c1d4cee42cfb013595cb591354e703d3581fc00a338a7b40a1b3cadc217","observation_id":"79e8cde5-5f8c-425a-ac7c-ea83f84bc309","resolution":{"observed_at":"2026-08-10T05:06:51.921685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.924869Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.924869Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:007a74bf1aa10e0951314af5985b960425adc472bb97ff7b46f270dcd775728b","observation_id":"1443c73a-8bf6-4d74-96cb-d73da9750e97","resolution":{"observed_at":"2026-08-10T05:06:51.924869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.928398Z","title":"Rae, Anna Potapenko, Siddhant M","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.928398Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:7783672301c9872105b1fa711b800b33b1f0aa37b39e324a8ff62450225a7c87","observation_id":"930ccfba-f3f9-4bc8-a89a-01a40f5b13ea","resolution":{"observed_at":"2026-08-10T05:06:51.928398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04621","last_updated":"2025-05-07T17:59:38Z","snapshot_observed_at":"2026-08-07T22:23:35.494972Z","submitted_at":"2025-05-07T17:59:38Z","title":"Score Distillation Sampling for Audio: Source Separation, Synthesis, and Beyond","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04621","snapshot_observed_at":"2026-08-10T05:06:51.931568Z","title":"Score distillation sampling for audio: Source separation, synthesis, and beyond","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.931568Z"},"links":{"cited_paper":"/paper/2505.04621","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:5a460099783edf2e92919ae066223f9c83802888bbbf0f2a6883177b6e28cf63","observation_id":"0aefec3a-6ed3-4e7c-b7a2-edc059d454c3","resolution":{"observed_at":"2026-08-10T05:06:51.931568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.935154Z","title":"Fast autoregressive video diffusion and world models with temporal cache compression and sparse attention.arXiv preprint arXiv:2602.01801, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.935154Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:29a69e1e962b2e7a4e7d7be955019b9931f64c9b2053d049f385abede8c2b2fc","observation_id":"53088a46-4a55-42aa-bd86-9a3623203d8b","resolution":{"observed_at":"2026-08-10T05:06:51.935154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.938252Z","title":"LongRoPE2: Near-lossless LLM context window scaling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.938252Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:b2d3ffe7b8d5c5ad3c1a98fe17e47443beb9167586e0938fe0616388f8b3670c","observation_id":"97763b1a-405f-4127-8696-1a6dd8e498d4","resolution":{"observed_at":"2026-08-10T05:06:51.938252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06764","last_updated":"2025-07-24T03:58:47Z","snapshot_observed_at":"2026-08-07T11:01:49.684719Z","submitted_at":"2025-02-10T18:44:25Z","title":"History-Guided Video Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06764","snapshot_observed_at":"2026-08-10T05:06:51.941856Z","title":"History-guided video diffusion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.941856Z"},"links":{"cited_paper":"/paper/2502.06764","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:8354dbe90da587e4fe0a4201bc798283116d32e56d43d607083e486a644246df","observation_id":"219c96eb-d2b2-44d7-ad62-c753a18d971a","resolution":{"observed_at":"2026-08-10T05:06:51.941856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23274","last_updated":"2024-12-03T00:28:32Z","snapshot_observed_at":"2026-07-06T19:42:25.742756Z","submitted_at":"2024-10-30T17:54:56Z","title":"Multi-student Diffusion Distillation for Better One-step Generators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23274","snapshot_observed_at":"2026-08-10T05:06:51.945440Z","title":"Multi-student diffusion distillation for better one-step generators","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.945440Z"},"links":{"cited_paper":"/paper/2410.23274","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:577ff3cc068833d5324e90c8bd2f52a036e02c6bb9528fb1f728d1c858ad807a","observation_id":"8722fe6f-b7dc-4e9d-9be1-807e6a546a3b","resolution":{"observed_at":"2026-08-10T05:06:51.945440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.948895Z","title":"Composition of memory experts for diffusion world models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.948895Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:6836186d601d1b04118723f01ddabc3f9e3b7043a81a1717026a68c8628e5a2f","observation_id":"bb5f8c81-180b-4a75-aa0e-09ae3ecb1078","resolution":{"observed_at":"2026-08-10T05:06:51.948895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.951728Z","title":"RoFormer: Enhanced transformer with rotary position embedding.Neurocomputing, 568:127063, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.951728Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:0944c6adc3b8b7fda57f494ce02efed354f5a611b334390f1acadb1be23e9cef","observation_id":"22efbd61-f2aa-4b2c-b95f-ab977bbe44dc","resolution":{"observed_at":"2026-08-10T05:06:51.951728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.14614","last_updated":"2026-06-09T16:18:08Z","snapshot_observed_at":"2026-08-03T16:11:09.055651Z","submitted_at":"2025-12-16T17:22:46Z","title":"WorldPlay: Towards Long-Term Geometric Consistency for Real-Time Interactive World Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.14614","snapshot_observed_at":"2026-08-10T05:06:51.954581Z","title":"WorldPlay: Towards long-term geometric consistency for real-time interactive world modeling.arXiv preprint arXiv:2512.14614, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.954581Z"},"links":{"cited_paper":"/paper/2512.14614","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:a96630e583c598eac9ecc8d85e590f8f1b3d8d557cec15d163644bcba910635e","observation_id":"2ced6be5-c8ec-446c-b8be-33feb282cf57","resolution":{"observed_at":"2026-08-10T05:06:51.954581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.957468Z","title":"Learning to (learn at test time): RNNs with expressive hidden states","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.957468Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:8ca352ca49f69f367dcfdef80d623a8edd9cbd3dab9f240508cf63471a9877e9","observation_id":"dcb9b390-15dd-4de5-96cd-15fd81384c7e","resolution":{"observed_at":"2026-08-10T05:06:51.957468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10554","last_updated":"2022-12-20T18:56:20Z","snapshot_observed_at":"2026-08-09T00:51:36.452647Z","submitted_at":"2022-12-20T18:56:20Z","title":"A Length-Extrapolatable Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10554","snapshot_observed_at":"2026-08-10T05:06:51.960146Z","title":"A length-extrapolatable transformer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.960146Z"},"links":{"cited_paper":"/paper/2212.10554","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:54982e719838134789697e62aa4118e583e17fe57e9106170b6032440655b717","observation_id":"0e61fcb2-60a9-41fe-b00d-cac9563f47a0","resolution":{"observed_at":"2026-08-10T05:06:51.960146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20540","last_updated":"2026-01-28T12:37:01Z","snapshot_observed_at":"2026-08-03T01:29:14.204066Z","submitted_at":"2026-01-28T12:37:01Z","title":"Advancing Open-source World Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.20540","snapshot_observed_at":"2026-08-10T05:06:51.963230Z","title":"Advancing open-source world models.arXiv preprint arXiv:2601.20540, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.963230Z"},"links":{"cited_paper":"/paper/2601.20540","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:20590616625b12b4e7e1d7b76f52b8e22228a9a2536dc00828965991e97f92de","observation_id":"924e2455-efe2-417e-a089-a8c83e870d69","resolution":{"observed_at":"2026-08-10T05:06:51.963230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.966146Z","title":"KeepKV: Achieving periodic lossless KV cache compression for efficient LLM inference","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.966146Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:c45dfe8948ee54dbe27b98cd77ced011ed02301892562b00199c7a33c95ad3de","observation_id":"df4eb73f-d4b9-4344-aaf1-80db9dbf98d8","resolution":{"observed_at":"2026-08-10T05:06:51.966146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.968987Z","title":"Diffusion models are real-time game engines","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.968987Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:4afc7611d1c5ea8f344fd832bf7779ee1b1bdee4d22fb5f2e8fe63f4ad9de7ea","observation_id":"a5e1beab-7c38-4a85-8e41-2c2aa5a3315e","resolution":{"observed_at":"2026-08-10T05:06:51.968987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.971985Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.971985Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:7801b34661c2201d46f07ae35951116cb0d8b99b8feacccc5b5bccea1050adfc","observation_id":"c6859384-b193-442f-9602-689ba0412c20","resolution":{"observed_at":"2026-08-10T05:06:51.971985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.974974Z","title":"Fast transformers with clustered attention","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.974974Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:a893cce74aed7b6a2686b1e4d306122d707f08dbdfa1035fd6317b01edcb007c","observation_id":"878363cd-acd2-4c73-8f18-0e636e4ee5fd","resolution":{"observed_at":"2026-08-10T05:06:51.974974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-10T05:06:51.977937Z","title":"Wan: Open and advanced large-scale video generative models.arXiv preprint arXiv:2503.20314, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.977937Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:0dd7a1a49e320fbff8096044f28a8ce7418e22e77689f2d538e4421def8249cb","observation_id":"140f24d8-7ecf-4516-941f-a07656c5dd05","resolution":{"observed_at":"2026-08-10T05:06:51.977937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13476","last_updated":"2024-11-26T09:46:25Z","snapshot_observed_at":"2026-08-05T12:30:14.699982Z","submitted_at":"2024-11-20T17:22:31Z","title":"When Precision Meets Position: BFloat16 Breaks Down RoPE in Long-Context Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13476","snapshot_observed_at":"2026-08-10T05:06:51.980988Z","title":"When precision meets position: BFloat16 breaks down RoPE in long-context training.Transactions on Machine Learning Research (TMLR), 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.980988Z"},"links":{"cited_paper":"/paper/2411.13476","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:727a9d6c56ac208a0c382eb16149c0b7fa4339ce012e738bdf2ffa2cd1f25df6","observation_id":"a1dd92ba-2805-4c71-b625-635ae12b24d6","resolution":{"observed_at":"2026-08-10T05:06:51.980988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04768","last_updated":"2020-06-14T08:15:54Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:37:52Z","title":"Linformer: Self-Attention with Linear Complexity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04768","snapshot_observed_at":"2026-08-10T05:06:51.983926Z","title":"Li, Madian Khabsa, Han Fang, and Hao Ma","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.983926Z"},"links":{"cited_paper":"/paper/2006.04768","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:3d5120f61db85cb487582f8135a08460ddaca1f5ee5753fef64e7ed8f9362053","observation_id":"50d18257-3043-4ec0-a6c0-2fd075c40d31","resolution":{"observed_at":"2026-08-10T05:06:51.983926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09595","last_updated":"2024-11-14T17:08:23Z","snapshot_observed_at":"2026-08-08T05:29:13.481798Z","submitted_at":"2024-11-14T17:08:23Z","title":"LLaMA-Mesh: Unifying 3D Mesh Generation with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.09595","snapshot_observed_at":"2026-08-10T05:06:51.987484Z","title":"LLaMA-Mesh: Unifying 3D mesh generation with language models.arXiv preprint arXiv:2411.09595, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.987484Z"},"links":{"cited_paper":"/paper/2411.09595","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:f8fbfa96afe04af98c8c8c2798e5960a702be8dd4de5e6128a78ff439b7a7958","observation_id":"44e33ebc-3b39-4e69-bb25-391ef2aca2a3","resolution":{"observed_at":"2026-08-10T05:06:51.987484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:51.991027Z","title":"Bovik, Hamid R","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.991027Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:46d6a23ff7fecd9e5ac6dd0a71676c42cd00c7fe7f0a971dc9dfca958e62045e","observation_id":"81426352-910e-48fa-85ad-b2c179e619bd","resolution":{"observed_at":"2026-08-10T05:06:51.991027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08995","last_updated":"2026-04-13T03:48:38Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T06:00:09Z","title":"Matrix-Game 3.0: Real-Time and Streaming Interactive World Model with Long-Horizon Memory","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.08995","snapshot_observed_at":"2026-08-10T05:06:51.994602Z","title":"Matrix-game 3.0: Real-time and streaming interactive world model with long-horizon memory.arXiv preprint arXiv:2604.08995, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.994602Z"},"links":{"cited_paper":"/paper/2604.08995","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:24ac02547a7addd60b77a2d1bdc65c589bf3f40d7222666f43b5e285266a7f1c","observation_id":"c11f2c74-cb6f-4071-8458-ab4a9998adef","resolution":{"observed_at":"2026-08-10T05:06:51.994602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05173","snapshot_observed_at":"2026-08-10T05:06:51.998314Z","title":"VideoRoPE: What makes for good video rotary position embedding? In International Conference on Machine Learning (ICML), 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:51.998314Z"},"links":{"cited_paper":"/paper/2502.05173","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:f7a6e1a3ec84dc55e9d08430332ddabd0c159e8e9895a112a132b0ea170df9b2","observation_id":"bf6b92ab-aa87-4a59-8ff8-96e0a87c7b1b","resolution":{"observed_at":"2026-08-10T05:06:51.998314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-10T16:56:54.588021Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05284","snapshot_observed_at":"2026-08-10T05:06:52.002085Z","title":"Video world models with long-term spatial memory","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:52.002085Z"},"links":{"cited_paper":"/paper/2506.05284","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:050cfca26c1a0525b80662e97d27ad57ebd389dd3b11a0701d97f6ff60e76184","observation_id":"45019931-55ad-42dd-9581-576a360adc4c","resolution":{"observed_at":"2026-08-10T05:06:52.002085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:52.005790Z","title":"Corgi: Cached memory guided video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:52.005790Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:afff53c68b019337831e3e2f67a55563d6b73699d5de9a6d4d6e091f8a03644c","observation_id":"2a0e4fff-a6e0-4dda-822e-60fcaf2c95d5","resolution":{"observed_at":"2026-08-10T05:06:52.005790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:52.009046Z","title":"Motion attribution for video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:52.009046Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:075fa035788cb69f26137b7c11396cbfda93441ecae35a2101c27d3bcd5f4fb4","observation_id":"7563504e-80c6-4111-a504-757d267ce84f","resolution":{"observed_at":"2026-08-10T05:06:52.009046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:52.012470Z","title":"Rabe, DeLesley Hutchins, and Christian Szegedy","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:52.012470Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:3d96a0ca912677e0335cd4e3285498d2f5189533878089f80488973466238efd","observation_id":"9dff48ed-dcf2-486a-93ee-30cedd49be66","resolution":{"observed_at":"2026-08-10T05:06:52.012470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:52.015881Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:52.015881Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:4eddb07b0759b5fcfab84de30bffed2ae11f5464b19ef450a0c76f377136e6ea","observation_id":"fc0d617b-5107-4687-b585-3c4dbbe1e106","resolution":{"observed_at":"2026-08-10T05:06:52.015881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10819","last_updated":"2024-10-14T17:59:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-14T17:59:58Z","title":"DuoAttention: Efficient Long-Context LLM Inference with Retrieval and Streaming Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10819","snapshot_observed_at":"2026-08-10T05:06:52.019067Z","title":"DuoAttention: Efficient long-context LLM inference with retrieval and streaming heads","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:52.019067Z"},"links":{"cited_paper":"/paper/2410.10819","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:28b6912bcbf9938fe00d3e908bdfa001255eb6f8bd41521cf263ef7733c5193c","observation_id":"a7be016b-15e7-4e9c-a3dd-2d7e75e1965e","resolution":{"observed_at":"2026-08-10T05:06:52.019067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:06:52.022607Z","title":"WorldMem: Long-term consistent world simulation with memory","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:52.022607Z"},"links":{"citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:a1f5addcb6a2fee4654e2bdfe5a3832a94dc80d849676a10584e8dcf7481e428","observation_id":"b9d48c43-e88a-44e5-9b91-b8019f21f757","resolution":{"observed_at":"2026-08-10T05:06:52.022607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T00:13:46.686335Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":97,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":120},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 100 of 120 outbound references and 0 inbound Pith citation observations for arXiv:2608.07408."}