{"as_of":"2026-08-19T19:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c07521a08bd0694aea895d48778e095b1f7d634f4e129977b33cfb09289e1199","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:12:17.628244Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":28,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T05:06:52.053244Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T17:58:47.760773Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03141","snapshot_observed_at":"2026-08-07T00:15:37.627688Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14769","last_updated":"2025-08-09T11:31:44Z","snapshot_observed_at":"2026-08-17T21:56:16.787726Z","submitted_at":"2025-06-17T17:59:12Z","title":"CDP: Towards Robust Autoregressive Visuomotor Policy Learning via Causal Diffusion","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:37.627688Z"},"links":{"cited_paper":"/paper/2506.03141","citing_paper":"/paper/2506.14769"},"observation_digest":"sha256:035ae5144998bc92fc2c0c4b7254c4035cfcafcecfe32fcec7d349bf2952975a","observation_id":"71645466-37ac-464f-bbfc-e2b05e1791ba","resolution":{"observed_at":"2026-08-07T00:15:37.627688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03141","snapshot_observed_at":"2026-08-03T21:59:33.245663Z","title":"Context as memory: Scene-consistent interactive long video generation with memory retrieval.arXiv preprint arXiv:2506.03141, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.12940","last_updated":"2026-07-27T04:39:47Z","snapshot_observed_at":"2026-08-13T01:59:34.407782Z","submitted_at":"2025-11-17T03:47:12Z","title":"Recurrent Autoregressive Diffusion: Global Memory Meets Local Attention","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T21:59:33.245663Z"},"links":{"cited_paper":"/paper/2506.03141","citing_paper":"/paper/2511.12940"},"observation_digest":"sha256:a3b0a3dabf25e7cbef9abe7307a00d063210b137639bcfddf666ca9075aab3a1","observation_id":"ce1a6f6f-7ba5-45e6-896e-8926d8ebb6d2","resolution":{"observed_at":"2026-08-03T21:59:33.245663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"cited_work":{"arxiv_id":"2506.03141","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03141","snapshot_observed_at":"2026-07-03T17:58:47.760773Z","title":"Context as memory: Scene-consistent interactive long video generation with memory retrieval.arXiv preprint arXiv:2506.03141","venue":null,"work_id":"e279c098-3b79-4f32-a246-d51ad9df6c2a","year":2025},"citing_paper":{"arxiv_id":"2511.17792","last_updated":"2026-04-15T17:49:12Z","snapshot_observed_at":"2026-08-14T15:07:06.842834Z","submitted_at":"2025-11-21T21:36:02Z","title":"Target-Bench: Can Video World Models Achieve Mapless Path Planning with Semantic Targets?","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-17T20:00:20.895672Z"},"links":{"cited_paper":"/paper/2506.03141","citing_paper":"/paper/2511.17792"},"observation_digest":"sha256:9d166f79b6bd466ab36294930d47d82a65b28cf688a5027058a5a12b2c9680f6","observation_id":"d1ff0185-3f70-425f-a363-857e497202a6","resolution":{"observed_at":"2026-05-17T20:02:04.221770Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03141","snapshot_observed_at":"2026-08-03T20:15:36.183372Z","title":"Context as memory: Scene-consistent interactive long video generation with memory retrieval.arXiv preprint arXiv:2506.03141,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.20644","last_updated":"2026-07-09T17:59:10Z","snapshot_observed_at":"2026-08-18T12:35:53.127359Z","submitted_at":"2025-11-25T18:59:02Z","title":"Vision-Language Memory for Spatial Reasoning","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-03T20:15:36.183372Z"},"links":{"cited_paper":"/paper/2506.03141","citing_paper":"/paper/2511.20644"},"observation_digest":"sha256:b97ae46f1993dba1e30a0b4759891067a8c1e410e852c957ea2d5228bfbfbb2d","observation_id":"dde0d32c-cd0c-4c25-a363-3914c8c1b8c7","resolution":{"observed_at":"2026-08-03T20:15:36.183372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"cited_work":{"arxiv_id":"2506.03141","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03141","snapshot_observed_at":"2026-07-03T17:58:47.760773Z","title":"Context as memory: Scene-consistent interactive long video generation with memory retrieval.arXiv preprint arXiv:2506.03141","venue":null,"work_id":"e279c098-3b79-4f32-a246-d51ad9df6c2a","year":2025},"citing_paper":{"arxiv_id":"2512.14614","last_updated":"2026-06-09T16:18:08Z","snapshot_observed_at":"2026-08-14T16:23:20.854858Z","submitted_at":"2025-12-16T17:22:46Z","title":"WorldPlay: Towards Long-Term Geometric Consistency for Real-Time Interactive World Modeling","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-15T14:29:56.348733Z"},"links":{"cited_paper":"/paper/2506.03141","citing_paper":"/paper/2512.14614"},"observation_digest":"sha256:40d0c65a58dd4b9487da2e07e735a08b70363b2301a74201a632dba1684190f3","observation_id":"7d25cc99-4b09-45c2-b852-a67e1d1a6801","resolution":{"observed_at":"2026-05-15T14:29:56.497402Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03141","snapshot_observed_at":"2026-08-03T16:11:18.301098Z","title":"Context as memory: Scene-consistent interactive long video generation with memory retrieval.arXiv preprint arXiv:2506.03141,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.14614","last_updated":"2026-06-09T16:18:08Z","snapshot_observed_at":"2026-08-14T16:23:20.854858Z","submitted_at":"2025-12-16T17:22:46Z","title":"WorldPlay: Towards Long-Term Geometric Consistency for Real-Time Interactive World Modeling","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-03T16:11:18.301098Z"},"links":{"cited_paper":"/paper/2506.03141","citing_paper":"/paper/2512.14614"},"observation_digest":"sha256:ec84705166d44c07dc401fc54452ae435d4e4bdb471d470bf8f57d949301f3b9","observation_id":"be1124f5-f6ad-4afc-b78c-e2f9f667a430","resolution":{"observed_at":"2026-08-03T16:11:18.301098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03141","snapshot_observed_at":"2026-08-03T15:29:00.649927Z","title":"Context as memory: Scene-consistent interactive long video generation with memory retrieval.arXiv preprint arXiv:2506.03141, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.17796","last_updated":"2026-06-24T08:52:20Z","snapshot_observed_at":"2026-08-13T02:26:05.415227Z","submitted_at":"2025-12-18T18:59:18Z","title":"CustomX: Unified Character, Action, and Scene Customization in Video World Models","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-03T15:29:00.649927Z"},"links":{"cited_paper":"/paper/2506.03141","citing_paper":"/paper/2512.17796"},"observation_digest":"sha256:8ac018d7849031ff5a13ca02c15d7ac7e54a6110ba340ce6ce20de39eb26762f","observation_id":"0b4530a8-a06c-45de-88d2-bb72ea16e39d","resolution":{"observed_at":"2026-08-03T15:29:00.649927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03141","snapshot_observed_at":"2026-08-02T20:36:13.810793Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.22960","last_updated":"2026-06-29T11:22:33Z","snapshot_observed_at":"2026-08-14T12:23:22.280746Z","submitted_at":"2026-02-26T12:54:46Z","title":"UCM: Unified Modeling of Camera Control and Memory with Time-aware Positional Encoding Warping for World Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T20:36:13.810793Z"},"links":{"cited_paper":"/paper/2506.03141","citing_paper":"/paper/2602.22960"},"observation_digest":"sha256:bafeb03a9b728ddaa1ce3834155dd5dfcfa1206727a3c6e5906eda5d5cba9717","observation_id":"6fe4146b-c908-4b1e-93fc-c505b9f41773","resolution":{"observed_at":"2026-08-02T20:36:13.810793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"cited_work":{"arxiv_id":"2506.03141","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03141","snapshot_observed_at":"2026-07-03T17:58:47.760773Z","title":"Context as memory: Scene-consistent interactive long video generation with memory retrieval.arXiv preprint arXiv:2506.03141","venue":null,"work_id":"e279c098-3b79-4f32-a246-d51ad9df6c2a","year":2025},"citing_paper":{"arxiv_id":"2604.04514","last_updated":"2026-04-06T08:27:26Z","snapshot_observed_at":"2026-08-17T07:47:15.901558Z","submitted_at":"2026-04-06T08:27:26Z","title":"SuperLocalMemory V3.3: The Living Brain -- Biologically-Inspired Forgetting, Cognitive Quantization, and Multi-Channel Retrieval for Zero-LLM Agent Memory Systems","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T19:48:34.606351Z"},"links":{"cited_paper":"/paper/2506.03141","citing_paper":"/paper/2604.04514"},"observation_digest":"sha256:779ca0806a73e0386a35b10c1b648fec268f1526316296e9920446df8034a688","observation_id":"08ab7c33-aa47-4062-9ef4-dc1d07f78abd","resolution":{"observed_at":"2026-05-10T22:30:50.645013Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"cited_work":{"arxiv_id":"2506.03141","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03141","snapshot_observed_at":"2026-07-03T17:58:47.760773Z","title":"Context as memory: Scene-consistent interactive long video generation with memory retrieval.arXiv preprint arXiv:2506.03141","venue":null,"work_id":"e279c098-3b79-4f32-a246-d51ad9df6c2a","year":2025},"citing_paper":{"arxiv_id":"2604.06339","last_updated":"2026-04-07T18:17:05Z","snapshot_observed_at":"2026-08-16T06:51:21.904839Z","submitted_at":"2026-04-07T18:17:05Z","title":"Evolution of Video Generative Foundations","version":1},"reference_index":281,"source":"pdf_text","source_observed_at":"2026-05-10T18:41:38.616611Z"},"links":{"cited_paper":"/paper/2506.03141","citing_paper":"/paper/2604.06339"},"observation_digest":"sha256:778b4d9560dbfee87e268b61756a82f3870677ed5e3743da831889e1142372f8","observation_id":"f841b663-8e70-4ab6-be4e-e21884641ba2","resolution":{"observed_at":"2026-05-11T00:05:51.270209Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"cited_work":{"arxiv_id":"2506.03141","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03141","snapshot_observed_at":"2026-07-03T17:58:47.760773Z","title":"Context as memory: Scene-consistent interactive long video generation with memory retrieval.arXiv preprint arXiv:2506.03141","venue":null,"work_id":"e279c098-3b79-4f32-a246-d51ad9df6c2a","year":2025},"citing_paper":{"arxiv_id":"2604.08542","last_updated":"2026-04-09T17:59:50Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:59:50Z","title":"Scal3R: Scalable Test-Time Training for Large-Scale 3D Reconstruction","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-10T16:56:14.380078Z"},"links":{"cited_paper":"/paper/2506.03141","citing_paper":"/paper/2604.08542"},"observation_digest":"sha256:09d26dc18591042c8d884f4e3f22edfedbca7126dd3a67c877f79a834626f6b7","observation_id":"9845b9fb-5bfd-40eb-9c42-9c1f1c7f4afb","resolution":{"observed_at":"2026-05-11T07:50:59.685157Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"cited_work":{"arxiv_id":"2506.03141","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03141","snapshot_observed_at":"2026-07-03T17:58:47.760773Z","title":"Context as memory: Scene-consistent interactive long video generation with memory retrieval.arXiv preprint arXiv:2506.03141","venue":null,"work_id":"e279c098-3b79-4f32-a246-d51ad9df6c2a","year":2025},"citing_paper":{"arxiv_id":"2604.14268","last_updated":"2026-04-15T17:59:17Z","snapshot_observed_at":"2026-08-12T17:33:25.813833Z","submitted_at":"2026-04-15T17:59:17Z","title":"HY-World 2.0: A Multi-Modal World Model for Reconstructing, Generating, and Simulating 3D Worlds","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-10T13:45:24.961208Z"},"links":{"cited_paper":"/paper/2506.03141","citing_paper":"/paper/2604.14268"},"observation_digest":"sha256:f73d6099e1ba5f75776ac27caa33c781061694f8fdcd68822fc5588f378459c7","observation_id":"9bd845dc-2172-4866-a22a-5d35380d1722","resolution":{"observed_at":"2026-05-10T13:45:27.154100Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"cited_work":{"arxiv_id":"2506.03141","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03141","snapshot_observed_at":"2026-07-03T17:58:47.760773Z","title":"Context as memory: Scene-consistent interactive long video generation with memory retrieval.arXiv preprint arXiv:2506.03141","venue":null,"work_id":"e279c098-3b79-4f32-a246-d51ad9df6c2a","year":2025},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-08-11T21:17:05.183857Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"cited_paper":"/paper/2506.03141","citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:56b34eee493660debc97fbfe16623625831339201bc7fc783013b1b5f3070aa7","observation_id":"f4f4daf0-08e0-4e10-9967-4d9d4c0dbb9d","resolution":{"observed_at":"2026-05-10T10:09:08.126250Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"cited_work":{"arxiv_id":"2506.03141","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03141","snapshot_observed_at":"2026-07-03T17:58:47.760773Z","title":"Context as memory: Scene-consistent interactive long video generation with memory retrieval.arXiv preprint arXiv:2506.03141","venue":null,"work_id":"e279c098-3b79-4f32-a246-d51ad9df6c2a","year":2025},"citing_paper":{"arxiv_id":"2605.14487","last_updated":"2026-05-14T07:27:39Z","snapshot_observed_at":"2026-08-11T04:01:43.208982Z","submitted_at":"2026-05-14T07:27:39Z","title":"Head Forcing: Long Autoregressive Video Generation via Head Heterogeneity","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-15T02:31:48.593354Z"},"links":{"cited_paper":"/paper/2506.03141","citing_paper":"/paper/2605.14487"},"observation_digest":"sha256:8612a7ffc665e23b9e45d0186cf67f8791b5ab20299474a732b7c45a306a3a9d","observation_id":"036bfba9-9d4c-4994-835c-98b4c678c78f","resolution":{"observed_at":"2026-05-15T02:33:32.128967Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"cited_work":{"arxiv_id":"2506.03141","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03141","snapshot_observed_at":"2026-07-03T17:58:47.760773Z","title":"Context as memory: Scene-consistent interactive long video generation with memory retrieval.arXiv preprint arXiv:2506.03141","venue":null,"work_id":"e279c098-3b79-4f32-a246-d51ad9df6c2a","year":2025},"citing_paper":{"arxiv_id":"2605.28816","last_updated":"2026-05-27T17:59:31Z","snapshot_observed_at":"2026-08-13T23:19:52.582867Z","submitted_at":"2026-05-27T17:59:31Z","title":"Gamma-World: Generative Multi-Agent World Modeling Beyond Two Players","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-29T13:34:03.020051Z"},"links":{"cited_paper":"/paper/2506.03141","citing_paper":"/paper/2605.28816"},"observation_digest":"sha256:ea5d833dc603bbc3b1db2e42d5b21293094d3024dcbcfebfb618f37c861d0812","observation_id":"90e471ac-c942-4b50-b2fc-8f0d726cf0c4","resolution":{"observed_at":"2026-06-29T13:53:29.081619Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"cited_work":{"arxiv_id":"2506.03141","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03141","snapshot_observed_at":"2026-07-03T17:58:47.760773Z","title":"Context as memory: Scene-consistent interactive long video generation with memory retrieval.arXiv preprint arXiv:2506.03141","venue":null,"work_id":"e279c098-3b79-4f32-a246-d51ad9df6c2a","year":2025},"citing_paper":{"arxiv_id":"2605.31158","last_updated":"2026-06-18T05:06:04Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T11:06:03Z","title":"Light Interaction: Training-Free Inference Acceleration for Interactive Video World Models","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T22:43:32.749425Z"},"links":{"cited_paper":"/paper/2506.03141","citing_paper":"/paper/2605.31158"},"observation_digest":"sha256:a4b22c531c519a6b470a195513901e47013095c454faa89f836bae08ad44b43a","observation_id":"11b18680-c829-415d-8f2e-fd1bbfbe7f9a","resolution":{"observed_at":"2026-07-01T19:26:00.130065Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"cited_work":{"arxiv_id":"2506.03141","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03141","snapshot_observed_at":"2026-07-03T17:58:47.760773Z","title":"Context as memory: Scene-consistent interactive long video generation with memory retrieval.arXiv preprint arXiv:2506.03141","venue":null,"work_id":"e279c098-3b79-4f32-a246-d51ad9df6c2a","year":2025},"citing_paper":{"arxiv_id":"2605.31336","last_updated":"2026-05-29T14:17:59Z","snapshot_observed_at":"2026-08-08T11:08:50.003696Z","submitted_at":"2026-05-29T14:17:59Z","title":"DecMem: Towards Minute-Long Consistent World Generation with Decoupled Memory","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-28T22:38:10.473453Z"},"links":{"cited_paper":"/paper/2506.03141","citing_paper":"/paper/2605.31336"},"observation_digest":"sha256:ae0f1a18d17e79c9a06ca7e3f9528882c90c5a162a358b3e17db6e981646a784","observation_id":"32f981f9-c8bb-43fa-8478-fc258d0b67fd","resolution":{"observed_at":"2026-06-28T22:42:46.789949Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"cited_work":{"arxiv_id":"2506.03141","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03141","snapshot_observed_at":"2026-07-03T17:58:47.760773Z","title":"Context as memory: Scene-consistent interactive long video generation with memory retrieval.arXiv preprint arXiv:2506.03141","venue":null,"work_id":"e279c098-3b79-4f32-a246-d51ad9df6c2a","year":2025},"citing_paper":{"arxiv_id":"2606.02753","last_updated":"2026-06-01T18:20:20Z","snapshot_observed_at":"2026-08-16T00:06:16.567037Z","submitted_at":"2026-06-01T18:20:20Z","title":"MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T14:52:30.406683Z"},"links":{"cited_paper":"/paper/2506.03141","citing_paper":"/paper/2606.02753"},"observation_digest":"sha256:e28262b872471aa9aab680bf804ff84515239a39d572a4b4955aa053d72690a6","observation_id":"8a09830f-5302-4e12-9481-88fd0609a359","resolution":{"observed_at":"2026-07-01T22:56:20.240121Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"cited_work":{"arxiv_id":"2506.03141","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03141","snapshot_observed_at":"2026-07-03T17:58:47.760773Z","title":"Context as memory: Scene-consistent interactive long video generation with memory retrieval.arXiv preprint arXiv:2506.03141","venue":null,"work_id":"e279c098-3b79-4f32-a246-d51ad9df6c2a","year":2025},"citing_paper":{"arxiv_id":"2606.09803","last_updated":"2026-06-08T17:54:10Z","snapshot_observed_at":"2026-08-12T22:21:00.037802Z","submitted_at":"2026-06-08T17:54:10Z","title":"Echo-Memory: A Controlled Study of Memory in Action World Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-27T16:58:37.552036Z"},"links":{"cited_paper":"/paper/2506.03141","citing_paper":"/paper/2606.09803"},"observation_digest":"sha256:f06c86f3e23571f16a8e028086a70af29ea62f6950f6a37a8ff5d1d5670fe1e8","observation_id":"31c4f39c-d9b9-47c6-917c-871c65fc4759","resolution":{"observed_at":"2026-07-03T00:57:29.617097Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"cited_work":{"arxiv_id":"2506.03141","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03141","snapshot_observed_at":"2026-07-03T17:58:47.760773Z","title":"Context as memory: Scene-consistent interactive long video generation with memory retrieval.arXiv preprint arXiv:2506.03141","venue":null,"work_id":"e279c098-3b79-4f32-a246-d51ad9df6c2a","year":2025},"citing_paper":{"arxiv_id":"2606.09828","last_updated":"2026-06-08T17:59:54Z","snapshot_observed_at":"2026-08-14T17:26:29.934753Z","submitted_at":"2026-06-08T17:59:54Z","title":"Latent Spatial Memory for Video World Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-27T16:47:42.761342Z"},"links":{"cited_paper":"/paper/2506.03141","citing_paper":"/paper/2606.09828"},"observation_digest":"sha256:284ef2842d82572cd8cd96d4c6a52c4be3aa2e3e588dcd6035cf34ac5aee2f96","observation_id":"99edf4a0-a104-4d72-b421-d62804aad845","resolution":{"observed_at":"2026-07-03T01:07:30.554029Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"cited_work":{"arxiv_id":"2506.03141","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03141","snapshot_observed_at":"2026-07-03T17:58:47.760773Z","title":"Context as memory: Scene-consistent interactive long video generation with memory retrieval.arXiv preprint arXiv:2506.03141","venue":null,"work_id":"e279c098-3b79-4f32-a246-d51ad9df6c2a","year":2025},"citing_paper":{"arxiv_id":"2606.10671","last_updated":"2026-08-04T12:43:00Z","snapshot_observed_at":"2026-08-07T23:11:38.667750Z","submitted_at":"2026-06-09T10:22:18Z","title":"FadeMem: Distance-Aware Memory Consolidation for Autoregressive Video Diffusion","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-06-27T13:44:44.550033Z"},"links":{"cited_paper":"/paper/2506.03141","citing_paper":"/paper/2606.10671"},"observation_digest":"sha256:af26843ab022c4989bc7478f4c9357bc343a6f9ef7e9d8e94ea88dcf5022f4bd","observation_id":"1086bb37-ba36-442f-93c6-7b29e02e7aba","resolution":{"observed_at":"2026-07-03T04:37:37.482634Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"cited_work":{"arxiv_id":"2506.03141","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03141","snapshot_observed_at":"2026-07-03T17:58:47.760773Z","title":"Context as memory: Scene-consistent interactive long video generation with memory retrieval.arXiv preprint arXiv:2506.03141","venue":null,"work_id":"e279c098-3b79-4f32-a246-d51ad9df6c2a","year":2025},"citing_paper":{"arxiv_id":"2606.16449","last_updated":"2026-06-16T02:33:07Z","snapshot_observed_at":"2026-08-17T01:09:27.291570Z","submitted_at":"2026-06-15T09:20:32Z","title":"PermaVid: Consistent Video Generation Across Edits via Disentangled Context Memory","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T03:23:58.455778Z"},"links":{"cited_paper":"/paper/2506.03141","citing_paper":"/paper/2606.16449"},"observation_digest":"sha256:cfe8bb4775b65acafe0fe19cd99459ee9c6faa6cc8365640b8cc163a65e6ec9f","observation_id":"6d2f390b-73ae-473a-8785-784f244508a6","resolution":{"observed_at":"2026-07-03T17:58:47.762544Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"cited_work":{"arxiv_id":"2506.03141","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03141","snapshot_observed_at":"2026-07-03T17:58:47.760773Z","title":"Context as memory: Scene-consistent interactive long video generation with memory retrieval.arXiv preprint arXiv:2506.03141","venue":null,"work_id":"e279c098-3b79-4f32-a246-d51ad9df6c2a","year":2025},"citing_paper":{"arxiv_id":"2606.31734","last_updated":"2026-06-30T14:31:32Z","snapshot_observed_at":"2026-08-07T09:44:34.339704Z","submitted_at":"2026-06-30T14:31:32Z","title":"MemLearner: Learning to Query Context memory for Video World Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-01T05:30:56.140465Z"},"links":{"cited_paper":"/paper/2506.03141","citing_paper":"/paper/2606.31734"},"observation_digest":"sha256:d60f21c3afb6e89052ccce729068ac417be09442b8599b28f6945cbf029dcfe6","observation_id":"7bf165a4-308a-412f-8e7b-143ac53ad726","resolution":{"observed_at":"2026-07-01T10:25:41.877273Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"cited_work":{"arxiv_id":"2506.03141","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03141","snapshot_observed_at":"2026-07-03T17:58:47.760773Z","title":"Context as memory: Scene-consistent interactive long video generation with memory retrieval.arXiv preprint arXiv:2506.03141","venue":null,"work_id":"e279c098-3b79-4f32-a246-d51ad9df6c2a","year":2025},"citing_paper":{"arxiv_id":"2607.02517","last_updated":"2026-07-02T17:59:59Z","snapshot_observed_at":"2026-08-11T21:37:50.159218Z","submitted_at":"2026-07-02T17:59:59Z","title":"WorldDirector: Building Controllable World Simulators with Persistent Dynamic Memory","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-03T14:28:24.922144Z"},"links":{"cited_paper":"/paper/2506.03141","citing_paper":"/paper/2607.02517"},"observation_digest":"sha256:6aef71fa3c1fa5dd420daabd05fb68d7629eac1623e3790fd599dca7baba4d70","observation_id":"8e84fb0f-18ac-4197-8c51-0b5170118c76","resolution":{"observed_at":"2026-07-03T14:28:31.047823Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03141","snapshot_observed_at":"2026-08-01T22:25:26.677846Z","title":"Context as memory: Scene-consistent interactive long video generation with memory retrieval.arXiv preprint arXiv:2506.03141, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15772","last_updated":"2026-07-17T09:03:37Z","snapshot_observed_at":"2026-08-18T14:28:01.215311Z","submitted_at":"2026-07-17T09:03:37Z","title":"SlotMem: Character-Addressable Internal Memory for Narrative Long Video Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T22:25:26.677846Z"},"links":{"cited_paper":"/paper/2506.03141","citing_paper":"/paper/2607.15772"},"observation_digest":"sha256:6951ec1de3f43dfc757940e38c3e563c1db6e9c9a39e2c126fc668066640c4d3","observation_id":"d03d8117-f012-4c67-ad39-cdec4511a596","resolution":{"observed_at":"2026-08-01T22:25:26.677846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03141","snapshot_observed_at":"2026-08-01T10:37:56.086456Z","title":"Context as memory: Scene-consistent interactive long video gen- eration with memory retrieval,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20174","last_updated":"2026-07-22T14:06:39Z","snapshot_observed_at":"2026-08-14T15:44:28.290456Z","submitted_at":"2026-07-22T14:06:39Z","title":"StreamHOI: Interaction-aware Temporal Memory Adaptation for Streaming HOI Video Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T10:37:56.086456Z"},"links":{"cited_paper":"/paper/2506.03141","citing_paper":"/paper/2607.20174"},"observation_digest":"sha256:1505b7621b380d4bb209b60f3aafe78bbe164a08010d53f74b10574e903dba65","observation_id":"8b85fad5-f630-4ea3-bbe1-05ccf3774b37","resolution":{"observed_at":"2026-08-01T10:37:56.086456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03141","snapshot_observed_at":"2026-08-01T00:52:27.986020Z","title":"Context as memory: Scene-consistent interactive long video generation with memory retrieval.arXiv preprint arXiv:2506.03141,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26037","last_updated":"2026-07-28T17:45:25Z","snapshot_observed_at":"2026-08-19T07:03:31.070300Z","submitted_at":"2026-07-28T17:45:25Z","title":"Wonder: Video World Model Done Better","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T00:52:27.986020Z"},"links":{"cited_paper":"/paper/2506.03141","citing_paper":"/paper/2607.26037"},"observation_digest":"sha256:75feae4eda0fb9402ea10968365150d048180debd1064d24131397445c62ff36","observation_id":"b9f5f915-f899-4ff6-bc6a-ddad2266ea8e","resolution":{"observed_at":"2026-08-01T00:52:27.986020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03141","snapshot_observed_at":"2026-08-10T05:06:52.053244Z","title":"Context as memory: Scene-consistent interactive long video generation with memory retrieval.arXiv preprint arXiv:2506.03141, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07408","last_updated":"2026-08-07T16:55:57Z","snapshot_observed_at":"2026-08-19T18:40:13.295692Z","submitted_at":"2026-08-07T16:55:57Z","title":"Addressable Memory for Video World Models","version":1},"reference_index":110,"source":"pdf_text","source_observed_at":"2026-08-10T05:06:52.053244Z"},"links":{"cited_paper":"/paper/2506.03141","citing_paper":"/paper/2608.07408"},"observation_digest":"sha256:371c315e28d5a5984b4a36fd969539b5940a9c71bd8a071b046c4dfa5c8a062b","observation_id":"bb90fd8c-9d3c-4522-8872-b1243849f5be","resolution":{"observed_at":"2026-08-10T05:06:52.053244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.03141/citation-record","integrity":"/paper/2506.03141/integrity","json":"/paper/2506.03141/citation-record.json","paper":"/paper/2506.03141"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-16T13:54:44.432320Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-08-07T11:12:17.523287Z","title":"arXiv preprint arXiv:2405.04233 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:17.523287Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2506.03141"},"observation_digest":"sha256:7729cb889a163336dcf888db8e449ef6ea620cdb6b7baff9246648cc9e86768d","observation_id":"96500013-c643-49cf-bbf2-11d951ccd5f1","resolution":{"observed_at":"2026-08-07T11:12:17.523287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01392","last_updated":"2024-12-10T01:32:23Z","snapshot_observed_at":"2026-08-16T13:38:04.174848Z","submitted_at":"2024-07-01T15:43:25Z","title":"Diffusion Forcing: Next-token Prediction Meets Full-Sequence Diffusion","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01392","snapshot_observed_at":"2026-08-07T11:12:17.526708Z","title":"arXiv preprint arXiv:2407.01392 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:17.526708Z"},"links":{"cited_paper":"/paper/2407.01392","citing_paper":"/paper/2506.03141"},"observation_digest":"sha256:0106b10e91b9cfd8a5f1b9579243d5c7e8b97c40c6ec8c8a790ea9ecd84c4e74","observation_id":"468cb3db-974f-4d36-a19a-cea2cd2c4080","resolution":{"observed_at":"2026-08-07T11:12:17.526708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-08-13T00:09:27.237577Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-08-07T11:12:17.529993Z","title":"arXiv preprint arXiv:2412.14169 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:17.529993Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2506.03141"},"observation_digest":"sha256:f91fcca76dc9683f9446d5915c3e114ddab0f10286e664fba32f56ab6a54a92c","observation_id":"5207c38b-a15d-4fc2-9cad-8683c84282c9","resolution":{"observed_at":"2026-08-07T11:12:17.529993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03568","last_updated":"2024-12-04T18:59:05Z","snapshot_observed_at":"2026-08-17T08:30:58.061060Z","submitted_at":"2024-12-04T18:59:05Z","title":"The Matrix: Infinite-Horizon World Generation with Real-Time Moving Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03568","snapshot_observed_at":"2026-08-07T11:12:17.533297Z","title":"arXiv preprint arXiv:2412.03568 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:17.533297Z"},"links":{"cited_paper":"/paper/2412.03568","citing_paper":"/paper/2506.03141"},"observation_digest":"sha256:df6f55ebbdad3b8c79cc0e032149593f1839caa2378ea012e48a464c1a545c38","observation_id":"e17f759b-4999-4706-b9c5-0c7da8281d6d","resolution":{"observed_at":"2026-08-07T11:12:17.533297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17398","last_updated":"2024-10-28T05:53:17Z","snapshot_observed_at":"2026-08-16T13:48:56.802800Z","submitted_at":"2024-05-27T17:49:15Z","title":"Vista: A Generalizable Driving World Model with High Fidelity and Versatile Controllability","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17398","snapshot_observed_at":"2026-08-07T11:12:17.536837Z","title":"arXiv preprint arXiv:2405.17398 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:17.536837Z"},"links":{"cited_paper":"/paper/2405.17398","citing_paper":"/paper/2506.03141"},"observation_digest":"sha256:eaadccc394ce14b19d0013f92db9c0a6613f3687ba90c9d41505a5d812bc2fe4","observation_id":"c6a3478b-e369-4ba5-a83e-ec5dc458715d","resolution":{"observed_at":"2026-08-07T11:12:17.536837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19325","last_updated":"2025-05-18T02:27:31Z","snapshot_observed_at":"2026-08-15T15:00:19.916941Z","submitted_at":"2025-03-25T03:38:06Z","title":"Long-Context Autoregressive Video Modeling with Next-Frame Prediction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19325","snapshot_observed_at":"2026-08-07T11:12:17.540549Z","title":"arXiv preprint arXiv:2503.19325 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:17.540549Z"},"links":{"cited_paper":"/paper/2503.19325","citing_paper":"/paper/2506.03141"},"observation_digest":"sha256:5f98c9d89a85ad4169daa408de59242bed636d3d01099e55d6db52b1211cf9fa","observation_id":"39b33f8d-ef86-4377-880c-95334fc5b127","resolution":{"observed_at":"2026-08-07T11:12:17.540549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10589","last_updated":"2025-03-13T17:40:07Z","snapshot_observed_at":"2026-08-16T12:50:17.497627Z","submitted_at":"2025-03-13T17:40:07Z","title":"Long Context Tuning for Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10589","snapshot_observed_at":"2026-08-07T11:12:17.543716Z","title":"arXiv preprint arXiv:2503.10589 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:17.543716Z"},"links":{"cited_paper":"/paper/2503.10589","citing_paper":"/paper/2506.03141"},"observation_digest":"sha256:0bbccbf0b39a6d3f3815bf7add55dabf06a45726a04334bfdf20ac6bec3c5011","observation_id":"94f46396-c3a3-488a-8088-5f17cf2bac18","resolution":{"observed_at":"2026-08-07T11:12:17.543716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02101","last_updated":"2025-03-13T18:35:06Z","snapshot_observed_at":"2026-08-16T17:39:09.604516Z","submitted_at":"2024-04-02T16:52:41Z","title":"CameraCtrl: Enabling Camera Control for Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02101","snapshot_observed_at":"2026-08-07T11:12:17.546924Z","title":"arXiv preprint arXiv:2404.02101 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:17.546924Z"},"links":{"cited_paper":"/paper/2404.02101","citing_paper":"/paper/2506.03141"},"observation_digest":"sha256:3c29954ebc3660123a0269fb90a135197940c5444c99ae9f9caeeab3f26cfe49","observation_id":"4968c0f2-f214-4591-a6d7-c0a464770805","resolution":{"observed_at":"2026-08-07T11:12:17.546924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:12:18.160650Z","title":"Nature 638, 8051 (2025), 656–663","venue":null,"work_id":"2cad1723-9b2f-4fa0-9d84-c3917264a76c","year":2025},"citing_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:17.559224Z"},"links":{"citing_paper":"/paper/2506.03141"},"observation_digest":"sha256:3da0e8bd2c2fb5ba1f3bd7df6ba855f0e1da675bdeb8cb6ab1e648cc99c25b56","observation_id":"8bc79a47-42df-46fc-b00b-d217d8829960","resolution":{"observed_at":"2026-08-07T11:12:18.190896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-08-14T12:12:01.418974Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14125","snapshot_observed_at":"2026-08-07T11:12:17.562082Z","title":"arXiv preprint arXiv:2312.14125 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:17.562082Z"},"links":{"cited_paper":"/paper/2312.14125","citing_paper":"/paper/2506.03141"},"observation_digest":"sha256:487e299a1067c5b824e2b08c07eed37ef7c8791f5776af22f1ab55f134d930bd","observation_id":"1557b2fb-9902-45a5-bb9e-73018f3f936e","resolution":{"observed_at":"2026-08-07T11:12:17.562082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-17T07:44:10.213698Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-07T11:12:17.565245Z","title":"arXiv preprint arXiv:2412.03603 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:17.565245Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2506.03141"},"observation_digest":"sha256:60fa562d01823f9f096f465ba00d9a01a4d3aaa9f72acbca54a6d20fd8c041ac","observation_id":"f164a619-6614-4125-8079-d425f15bb81e","resolution":{"observed_at":"2026-08-07T11:12:17.565245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11838","last_updated":"2024-11-01T14:45:36Z","snapshot_observed_at":"2026-08-16T13:42:07.461220Z","submitted_at":"2024-06-17T17:59:58Z","title":"Autoregressive Image Generation without Vector Quantization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11838","snapshot_observed_at":"2026-08-07T11:12:17.568138Z","title":"arXiv preprint arXiv:2406.11838 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:17.568138Z"},"links":{"cited_paper":"/paper/2406.11838","citing_paper":"/paper/2506.03141"},"observation_digest":"sha256:b5fb081f6ff5286ce81dade308affd1b3e1dd4e330fddb26e2024776fa02fe00","observation_id":"773edda9-b519-40e9-bd44-3fbd4b748581","resolution":{"observed_at":"2026-08-07T11:12:17.568138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-16T02:30:42.660030Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-07T11:12:17.571141Z","title":"arXiv preprint arXiv:2210.02747 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:17.571141Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2506.03141"},"observation_digest":"sha256:48b79720743e1e98519e2327d72c51a77b0dc9e386e33844ef0299bcc57dc0ec","observation_id":"bebabb30-3ed8-4b82-8837-93653fb3088a","resolution":{"observed_at":"2026-08-07T11:12:17.571141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-07T11:12:17.574359Z","title":"arXiv preprint arXiv:2209.03003 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:17.574359Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2506.03141"},"observation_digest":"sha256:325fed21150a4767858783dd0edf24ae51494cdc3b287596be8b6aef5914f607","observation_id":"3034e4c1-579f-4738-8759-035a7747bfac","resolution":{"observed_at":"2026-08-07T11:12:17.574359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06699","last_updated":"2025-03-21T08:55:03Z","snapshot_observed_at":"2026-08-18T22:55:15.570074Z","submitted_at":"2024-12-09T17:44:56Z","title":"You See it, You Got it: Learning 3D Creation on Pose-Free Videos at Scale","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06699","snapshot_observed_at":"2026-08-07T11:12:17.577727Z","title":"arXiv preprint arXiv:2412.06699 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:17.577727Z"},"links":{"cited_paper":"/paper/2412.06699","citing_paper":"/paper/2506.03141"},"observation_digest":"sha256:0e06d4bd898fcbd610368dcc723c25e14b8c407d378dbf822cf341cc18ebbbbe","observation_id":"f1bdfee4-7e77-4aaf-bde2-6aa6c01532dc","resolution":{"observed_at":"2026-08-07T11:12:17.577727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18072","last_updated":"2024-10-23T17:56:11Z","snapshot_observed_at":"2026-08-16T13:06:31.854495Z","submitted_at":"2024-10-23T17:56:11Z","title":"WorldSimBench: Towards Video Generation Models as World Simulators","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18072","snapshot_observed_at":"2026-08-07T11:12:17.580891Z","title":"arXiv preprint arXiv:2410.18072 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:17.580891Z"},"links":{"cited_paper":"/paper/2410.18072","citing_paper":"/paper/2506.03141"},"observation_digest":"sha256:b0123339f72767553f46a0091ca7a127c40516c95c55f779f36a28cb02deb578","observation_id":"ad3d3edd-91d0-4cee-b070-a8c5e36db9c5","resolution":{"observed_at":"2026-08-07T11:12:17.580891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03751","last_updated":"2025-03-05T18:59:50Z","snapshot_observed_at":"2026-08-16T12:52:45.629494Z","submitted_at":"2025-03-05T18:59:50Z","title":"GEN3C: 3D-Informed World-Consistent Video Generation with Precise Camera Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03751","snapshot_observed_at":"2026-08-07T11:12:17.584083Z","title":"arXiv preprint arXiv:2503.03751 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:17.584083Z"},"links":{"cited_paper":"/paper/2503.03751","citing_paper":"/paper/2506.03141"},"observation_digest":"sha256:e893b0e3eb80209088f2ccf6c7bca889b64017fb629169458461cfbb75e19425","observation_id":"8d5e1cb6-f92b-4d6b-b121-90883bf3ce44","resolution":{"observed_at":"2026-08-07T11:12:17.584083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20523","last_updated":"2025-03-26T13:11:35Z","snapshot_observed_at":"2026-08-12T12:54:06.280248Z","submitted_at":"2025-03-26T13:11:35Z","title":"GAIA-2: A Controllable Multi-View Generative World Model for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20523","snapshot_observed_at":"2026-08-07T11:12:17.587192Z","title":"arXiv preprint arXiv:2503.20523 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:17.587192Z"},"links":{"cited_paper":"/paper/2503.20523","citing_paper":"/paper/2506.03141"},"observation_digest":"sha256:af75ef6e13e315dc8e63d03686aafef8a6a41e3e39f689cd219ac1a812a42141","observation_id":"9ecc685f-7530-4d00-b580-cb169fdbe5cd","resolution":{"observed_at":"2026-08-07T11:12:17.587192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06764","last_updated":"2025-07-24T03:58:47Z","snapshot_observed_at":"2026-08-13T16:17:52.423891Z","submitted_at":"2025-02-10T18:44:25Z","title":"History-Guided Video Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06764","snapshot_observed_at":"2026-08-07T11:12:17.590181Z","title":"arXiv preprint arXiv:2502.06764 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:17.590181Z"},"links":{"cited_paper":"/paper/2502.06764","citing_paper":"/paper/2506.03141"},"observation_digest":"sha256:078d0316c4ec548d3f00d46cbf93d143a6b230811043ad475207dcfb3d3642b1","observation_id":"dda9aaae-1482-42cc-a9f4-eda9127e58af","resolution":{"observed_at":"2026-08-07T11:12:17.590181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:12:18.111901Z","title":"Neurocomputing 568 (2024), 127063","venue":null,"work_id":"07f51430-6547-4d6b-ac17-4eb67d9ab0ed","year":2024},"citing_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:17.599097Z"},"links":{"citing_paper":"/paper/2506.03141"},"observation_digest":"sha256:442d641e148019519ddf38dcab26a5ef55b01570e24d33dc596f9063e0a54791","observation_id":"b2d53f0e-589e-42a4-9d88-b4cb0224f1ca","resolution":{"observed_at":"2026-08-07T11:12:18.116788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14837","last_updated":"2025-04-24T03:03:57Z","snapshot_observed_at":"2026-08-14T07:06:06.462400Z","submitted_at":"2024-08-27T07:46:07Z","title":"Diffusion Models Are Real-Time Game Engines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14837","snapshot_observed_at":"2026-08-07T11:12:17.602243Z","title":"arXiv preprint arXiv:2408.14837 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:17.602243Z"},"links":{"cited_paper":"/paper/2408.14837","citing_paper":"/paper/2506.03141"},"observation_digest":"sha256:d021f8094661721d09649e38dcf339216c4a8c4a3c34a81f1f4ef84a356e4973","observation_id":"a001fb6c-167b-497d-abd4-6a2425a18c5d","resolution":{"observed_at":"2026-08-07T11:12:17.602243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-08-12T22:34:51.361078Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-07T11:12:17.605426Z","title":"arXiv preprint arXiv:2503.20314 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:17.605426Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2506.03141"},"observation_digest":"sha256:c126e6fa703aa4c0c7f37ae07b52d5cbb982150ef12b445bf318154e74cf56a3","observation_id":"3954512d-2626-4f56-b70d-85bff10e5ceb","resolution":{"observed_at":"2026-08-07T11:12:17.605426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:12:17.608684Z","title":"arXiv preprint arXiv:2504.12369 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:17.608684Z"},"links":{"citing_paper":"/paper/2506.03141"},"observation_digest":"sha256:f5b5b1a95d2f10d2a316a1f32b084e9c4f94dcff988ff91e02af8306782ae51e","observation_id":"51c0d825-0d6b-49cc-b3b1-3d36c4abce7b","resolution":{"observed_at":"2026-08-07T11:12:17.608684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12190","last_updated":"2023-11-27T13:36:04Z","snapshot_observed_at":"2026-08-16T14:51:02.499752Z","submitted_at":"2023-10-18T14:42:16Z","title":"DynamiCrafter: Animating Open-domain Images with Video Diffusion Priors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12190","snapshot_observed_at":"2026-08-07T11:12:17.611750Z","title":"arXiv:2310.12190 Wilson Yan, Yunzhi Zhang, Pieter Abbeel, and Aravind Srinivas","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:17.611750Z"},"links":{"cited_paper":"/paper/2310.12190","citing_paper":"/paper/2506.03141"},"observation_digest":"sha256:9f04e1e3f700236a6397776af17147a74e659ca394360371a55990b986a21dd7","observation_id":"63f2037b-dfa4-421c-8dff-7cc6ac4c35ff","resolution":{"observed_at":"2026-08-07T11:12:17.611750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10157","last_updated":"2021-09-14T21:20:06Z","snapshot_observed_at":"2026-08-17T06:54:13.493934Z","submitted_at":"2021-04-20T17:58:03Z","title":"VideoGPT: Video Generation using VQ-VAE and Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.10157","snapshot_observed_at":"2026-08-07T11:12:17.615226Z","title":"arXiv preprint arXiv:2104.10157 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:17.615226Z"},"links":{"cited_paper":"/paper/2104.10157","citing_paper":"/paper/2506.03141"},"observation_digest":"sha256:270b0f63bf8ac21f8134c899631bcd59db2d496de128e10386cabea5be230ddb","observation_id":"070cf774-429d-4527-8ac3-3d3ac9f4e7b8","resolution":{"observed_at":"2026-08-07T11:12:17.615226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06114","last_updated":"2024-09-26T17:14:09Z","snapshot_observed_at":"2026-08-13T12:06:46.989903Z","submitted_at":"2023-10-09T19:42:22Z","title":"Learning Interactive Real-World Simulators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06114","snapshot_observed_at":"2026-08-07T11:12:17.618634Z","title":"arXiv preprint arXiv:2310.06114 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:17.618634Z"},"links":{"cited_paper":"/paper/2310.06114","citing_paper":"/paper/2506.03141"},"observation_digest":"sha256:712e80652f32e67e006f3eff5f52084da277247e1888461e58063eccd1be32de","observation_id":"380ebcbe-bcee-4c43-920b-fcc981c7c491","resolution":{"observed_at":"2026-08-07T11:12:17.618634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T11:12:17.621640Z","title":"arXiv preprint arXiv:2408.01800 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:17.621640Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2506.03141"},"observation_digest":"sha256:72e8b2f0e83169b2635d2e93a7ffa5837d4d5ce77117df25b90815ff87ce2b6e","observation_id":"f7ac7720-375c-4570-8838-c8086d939f8b","resolution":{"observed_at":"2026-08-07T11:12:17.621640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:12:17.625179Z","title":"arXiv preprint arXiv:2504.12626 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:17.625179Z"},"links":{"citing_paper":"/paper/2506.03141"},"observation_digest":"sha256:3922968c39b77bad724029a63902aa229d1865a27cda6f6c33b7120bc6bdcc21","observation_id":"f2e97719-1b60-47d7-b361-26030eecb2f6","resolution":{"observed_at":"2026-08-07T11:12:17.625179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.09817","last_updated":"2018-05-24T17:58:02Z","snapshot_observed_at":"2026-08-16T00:52:41.730888Z","submitted_at":"2018-05-24T17:58:02Z","title":"Stereo Magnification: Learning View Synthesis using Multiplane Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.09817","snapshot_observed_at":"2026-08-07T11:12:17.628244Z","title":"arXiv preprint arXiv:1805.09817 (2018)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:17.628244Z"},"links":{"cited_paper":"/paper/1805.09817","citing_paper":"/paper/2506.03141"},"observation_digest":"sha256:9de262f9759c60b2e2e7f7d65d379b811676dfa1557a74f950c83bd336f90bf6","observation_id":"f6a2a3d5-53e1-45bd-b213-d0d9de257a71","resolution":{"observed_at":"2026-08-07T11:12:17.628244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:12:18.142124Z","title":"Advances in neural information processing systems (2019)","venue":null,"work_id":"b19e10bd-9b63-4d4f-9830-c8ab5d3398b1","year":2019},"citing_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:17.593059Z"},"links":{"citing_paper":"/paper/2506.03141"},"observation_digest":"sha256:23cc16f6596f78eb6409132a733f0b275e1544a6aa75ce45701ab3ff13137395","observation_id":"a5be92bd-a567-4562-8033-355fce2ec885","resolution":{"observed_at":"2026-08-07T11:12:18.149202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:12:18.229952Z","title":"Advances in neural information processing systems (2020)","venue":null,"work_id":"c595e745-7b06-47bc-bab3-e124740b7e2a","year":2020},"citing_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:17.550328Z"},"links":{"citing_paper":"/paper/2506.03141"},"observation_digest":"sha256:fe8aa5c9534dd12acdb3174b88d190f26bbe2ff972a7ffff2156a7239ef3a7c9","observation_id":"77ac232f-da3f-453a-afa3-9b1dbe1500d8","resolution":{"observed_at":"2026-08-07T11:12:18.253056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:12:18.126990Z","title":"International Conference on Learning Representations (2021)","venue":null,"work_id":"1cc81360-fa21-4171-bb88-5197210a00d6","year":2021},"citing_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:17.595978Z"},"links":{"citing_paper":"/paper/2506.03141"},"observation_digest":"sha256:ff332c8884eb663cc3ad1ed4c62d3b9a4a9eab66ec97308dd7751b359ed8855a","observation_id":"c5935c72-52a4-4402-a5b3-4dd5f6b98ae5","resolution":{"observed_at":"2026-08-07T11:12:18.132297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-07T11:12:17.553177Z","title":"arXiv preprint arXiv:2207.12598 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:17.553177Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2506.03141"},"observation_digest":"sha256:3534544641231c2d974fbab3b06737dcd9811e71cb7b88528a2d2e64752fb93b","observation_id":"a511b16c-3105-449a-bf73-f9b0187af0c6","resolution":{"observed_at":"2026-08-07T11:12:17.553177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17080","last_updated":"2023-09-29T09:20:37Z","snapshot_observed_at":"2026-07-06T16:25:21.571679Z","submitted_at":"2023-09-29T09:20:37Z","title":"GAIA-1: A Generative World Model for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17080","snapshot_observed_at":"2026-08-07T11:12:17.556236Z","title":"arXiv preprint arXiv:2309.17080 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:17.556236Z"},"links":{"cited_paper":"/paper/2309.17080","citing_paper":"/paper/2506.03141"},"observation_digest":"sha256:85f7c6411e892abf524af2c7064e27e353665e9df9135fdad6c3862e56737892","observation_id":"a4be7c35-fe9b-4b9b-9f88-0027e84dbf49","resolution":{"observed_at":"2026-08-07T11:12:17.556236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07760","last_updated":"2024-12-10T18:55:17Z","snapshot_observed_at":"2026-08-18T20:56:02.528729Z","submitted_at":"2024-12-10T18:55:17Z","title":"SynCamMaster: Synchronizing Multi-Camera Video Generation from Diverse Viewpoints","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07760","snapshot_observed_at":"2026-08-07T11:12:17.519375Z","title":"arXiv:2412.07760 [cs.CV] https: //arxiv.org/abs/2412.07760 Fan Bao, Chendong Xiang, Gang Yue, Guande He, Hongzhou Zhu, Kaiwen Zheng, Min Zhao, Shilong Liu, Yaole Wang, and Jun Zhu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:17.519375Z"},"links":{"cited_paper":"/paper/2412.07760","citing_paper":"/paper/2506.03141"},"observation_digest":"sha256:f56e2acc9fba8a7f01b91fb5cde62de2ad9d59f80c5029c1313a67be483c6cea","observation_id":"4c299b7d-e5e4-4399-8a2c-bc9d2752a7ab","resolution":{"observed_at":"2026-08-07T11:12:17.519375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11647","last_updated":"2025-07-09T08:09:06Z","snapshot_observed_at":"2026-08-16T12:49:55.041410Z","submitted_at":"2025-03-14T17:59:31Z","title":"ReCamMaster: Camera-Controlled Generative Rendering from A Single Video","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11647","snapshot_observed_at":"2026-08-07T11:12:17.515261Z","title":"arXiv preprint arXiv:2503.11647 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:17.515261Z"},"links":{"cited_paper":"/paper/2503.11647","citing_paper":"/paper/2506.03141"},"observation_digest":"sha256:f438b7a3c73cf845c99052f6ef2adbedd0fb297b23c4d878ca695789d94dd653","observation_id":"477ec2b4-1a64-493d-8dd1-d564b4d5e006","resolution":{"observed_at":"2026-08-07T11:12:17.515261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.03141","last_updated":"2025-08-12T02:27:56Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T02:15:14.230994Z","submitted_at":"2025-06-03T17:59:05Z","title":"Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":5},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 28 inbound Pith citation observations for arXiv:2506.03141."}