{"as_of":"2026-08-16T08:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5170b32f12f020ab6eda7b810540429e2f0ac28ea6e8b7a9f8cc4442c68f7b9c","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T22:21:55.284941Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T06:04:25.857689Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T02:59:26.816825Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.03520","last_updated":"2024-12-09T06:58:05Z","snapshot_observed_at":"2026-08-15T14:35:40.823601Z","submitted_at":"2024-12-04T18:02:49Z","title":"Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03520","snapshot_observed_at":"2026-08-05T06:04:25.857689Z","title":"Seeing beyond views: Multi-view driving scene video generation with holistic attention.arXiv preprint arXiv:2412.03520, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.07996","last_updated":"2026-07-20T17:34:32Z","snapshot_observed_at":"2026-08-07T09:38:31.708978Z","submitted_at":"2025-09-04T17:59:58Z","title":"3D and 4D World Modeling: A Survey","version":4},"reference_index":153,"source":"pdf_text","source_observed_at":"2026-08-05T06:04:25.857689Z"},"links":{"cited_paper":"/paper/2412.03520","citing_paper":"/paper/2509.07996"},"observation_digest":"sha256:725aaf8e5d79dfe41333a80739f5a551c79cf94035f2e1aca18e998c2bdca645","observation_id":"f91311a3-2b91-4fbe-92b0-34b289a2ee7f","resolution":{"observed_at":"2026-08-05T06:04:25.857689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03520","last_updated":"2024-12-09T06:58:05Z","snapshot_observed_at":"2026-08-15T14:35:40.823601Z","submitted_at":"2024-12-04T18:02:49Z","title":"Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention","version":2},"cited_work":{"arxiv_id":"2412.03520","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.03520","snapshot_observed_at":"2026-07-04T02:59:26.816825Z","title":"arXiv preprint arXiv:2412.03520 (2024) 4","venue":null,"work_id":"64dfd2bf-f126-423b-a0bd-c840e97a16c2","year":2024},"citing_paper":{"arxiv_id":"2605.26113","last_updated":"2026-05-25T17:59:48Z","snapshot_observed_at":"2026-08-15T10:52:02.121418Z","submitted_at":"2026-05-25T17:59:48Z","title":"AnyScene: Towards Highly Controllable Driving Scene Generation at Anywhere and Beyond","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-29T21:15:12.465970Z"},"links":{"cited_paper":"/paper/2412.03520","citing_paper":"/paper/2605.26113"},"observation_digest":"sha256:0acf6f3c45ef7aa2a78e0fe5cf66782ff57851441ddfbe74392f8ad897e35b9b","observation_id":"7d11b940-307e-4be8-838e-b3e1f365bffd","resolution":{"observed_at":"2026-06-29T22:04:00.917788Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03520","last_updated":"2024-12-09T06:58:05Z","snapshot_observed_at":"2026-08-15T14:35:40.823601Z","submitted_at":"2024-12-04T18:02:49Z","title":"Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention","version":2},"cited_work":{"arxiv_id":"2412.03520","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.03520","snapshot_observed_at":"2026-07-04T02:59:26.816825Z","title":"arXiv preprint arXiv:2412.03520 (2024) 4","venue":null,"work_id":"64dfd2bf-f126-423b-a0bd-c840e97a16c2","year":2024},"citing_paper":{"arxiv_id":"2606.20110","last_updated":"2026-06-18T11:34:26Z","snapshot_observed_at":"2026-08-01T19:05:47.270913Z","submitted_at":"2026-06-18T11:34:26Z","title":"FrozenDrive: Zero-Shot Text-Guided Driving Scene Generation and Data Augmentation with Parameter-Free Frozen Diffusion Model","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-26T18:34:56.810124Z"},"links":{"cited_paper":"/paper/2412.03520","citing_paper":"/paper/2606.20110"},"observation_digest":"sha256:91b8dc6f65147920935acb1fe5f1069444369506faed53338ededdb301f0d27b","observation_id":"8936245c-c2a3-481b-ad45-94e36a4fdb7e","resolution":{"observed_at":"2026-07-04T02:59:26.818843Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03520","last_updated":"2024-12-09T06:58:05Z","snapshot_observed_at":"2026-08-15T14:35:40.823601Z","submitted_at":"2024-12-04T18:02:49Z","title":"Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03520","snapshot_observed_at":"2026-07-13T01:26:27.220907Z","title":"Seeing beyond views: Multi-view driving scene video generation with holistic attention.arXiv preprint arXiv:2412.03520, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09655","last_updated":"2026-07-10T17:54:14Z","snapshot_observed_at":"2026-08-15T14:53:56.996419Z","submitted_at":"2026-07-10T17:54:14Z","title":"OpenLongTail: Generative Scaling of Long-Tail Driving Data","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-13T01:26:27.220907Z"},"links":{"cited_paper":"/paper/2412.03520","citing_paper":"/paper/2607.09655"},"observation_digest":"sha256:4348b530510d62835f57571f3e87241f6f648b21c9fcb0e06ae8e20f2f1ca628","observation_id":"b9abc561-2a76-422b-ae75-2b9e445820e8","resolution":{"observed_at":"2026-07-13T01:26:27.220907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.03520/citation-record","integrity":"/paper/2412.03520/integrity","json":"/paper/2412.03520/citation-record.json","paper":"/paper/2412.03520"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:21:55.007365Z","title":"Align your latents: High-resolution video synthesis with la- tent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03520","last_updated":"2024-12-09T06:58:05Z","snapshot_observed_at":"2026-08-15T14:35:40.823601Z","submitted_at":"2024-12-04T18:02:49Z","title":"Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T22:21:55.007365Z"},"links":{"citing_paper":"/paper/2412.03520"},"observation_digest":"sha256:1ced2be075e60663702a8cedc08146a1744c2f2cb1200b56e583cf49934a37ff","observation_id":"1261bc12-a048-4ad5-872f-b5c867e132bc","resolution":{"observed_at":"2026-08-11T22:21:55.007365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:21:55.015259Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.03520","last_updated":"2024-12-09T06:58:05Z","snapshot_observed_at":"2026-08-15T14:35:40.823601Z","submitted_at":"2024-12-04T18:02:49Z","title":"Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T22:21:55.015259Z"},"links":{"citing_paper":"/paper/2412.03520"},"observation_digest":"sha256:0b78c60b36819d70403104e823ae27037925b3ca316eae8d9506ed66ff153287","observation_id":"98067dba-b1f7-463c-8922-ce9af8599900","resolution":{"observed_at":"2026-08-11T22:21:55.015259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:21:55.022805Z","title":"nuscenes: A multi- modal dataset for autonomous driving","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.03520","last_updated":"2024-12-09T06:58:05Z","snapshot_observed_at":"2026-08-15T14:35:40.823601Z","submitted_at":"2024-12-04T18:02:49Z","title":"Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T22:21:55.022805Z"},"links":{"citing_paper":"/paper/2412.03520"},"observation_digest":"sha256:acc2967f706c581cf782957e862acc97699ef7123f188293731f4d1a34fad2f4","observation_id":"7402b4cf-592c-4764-a99a-55ace1f146cb","resolution":{"observed_at":"2026-08-11T22:21:55.022805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19512","last_updated":"2023-10-30T13:12:40Z","snapshot_observed_at":"2026-08-13T01:39:12.659510Z","submitted_at":"2023-10-30T13:12:40Z","title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19512","snapshot_observed_at":"2026-08-11T22:21:55.029391Z","title":"Videocrafter1: Open diffusion models for high-quality video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.03520","last_updated":"2024-12-09T06:58:05Z","snapshot_observed_at":"2026-08-15T14:35:40.823601Z","submitted_at":"2024-12-04T18:02:49Z","title":"Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T22:21:55.029391Z"},"links":{"cited_paper":"/paper/2310.19512","citing_paper":"/paper/2412.03520"},"observation_digest":"sha256:1658f31b1519ade00049b9a7c2403a75a50165f6c7d92a9852b7dda268dd09a3","observation_id":"c493a015-0b0b-429e-869c-8c1eb6f50845","resolution":{"observed_at":"2026-08-11T22:21:55.029391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09047","last_updated":"2024-01-17T08:30:32Z","snapshot_observed_at":"2026-08-13T04:40:49.704758Z","submitted_at":"2024-01-17T08:30:32Z","title":"VideoCrafter2: Overcoming Data Limitations for High-Quality Video Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09047","snapshot_observed_at":"2026-08-11T22:21:55.035366Z","title":"Videocrafter2: Overcoming data limitations for high-quality video diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03520","last_updated":"2024-12-09T06:58:05Z","snapshot_observed_at":"2026-08-15T14:35:40.823601Z","submitted_at":"2024-12-04T18:02:49Z","title":"Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T22:21:55.035366Z"},"links":{"cited_paper":"/paper/2401.09047","citing_paper":"/paper/2412.03520"},"observation_digest":"sha256:50121766d2c00f369e8792f49e37b61a93b5eba4fda6d29e1e86eefd77677091","observation_id":"6d9d3a85-22cd-4eab-ae5d-e96b73321327","resolution":{"observed_at":"2026-08-11T22:21:55.035366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:21:56.182041Z","title":"Persformer: 3d lane detection via perspective transformer and the openlane benchmark","venue":null,"work_id":"3403823d-4996-4163-99ca-7da3a485eeb0","year":2022},"citing_paper":{"arxiv_id":"2412.03520","last_updated":"2024-12-09T06:58:05Z","snapshot_observed_at":"2026-08-15T14:35:40.823601Z","submitted_at":"2024-12-04T18:02:49Z","title":"Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T22:21:55.041882Z"},"links":{"citing_paper":"/paper/2412.03520"},"observation_digest":"sha256:29552c9c7f7fefa7be944a4bf8831ef3eb1e4963b584fffcde5d90e5f637f3aa","observation_id":"7183b1cd-2c72-49ef-84b9-96139a831d55","resolution":{"observed_at":"2026-08-11T22:21:56.188214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14475","last_updated":"2025-07-25T02:48:16Z","snapshot_observed_at":"2026-08-15T04:56:48.161896Z","submitted_at":"2024-05-23T12:04:51Z","title":"MagicDrive3D: Controllable 3D Generation for Any-View Rendering in Street Scenes","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14475","snapshot_observed_at":"2026-08-11T22:21:55.047416Z","title":"Magicdrive3d: Controllable 3d genera- tion for any-view rendering in street scenes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03520","last_updated":"2024-12-09T06:58:05Z","snapshot_observed_at":"2026-08-15T14:35:40.823601Z","submitted_at":"2024-12-04T18:02:49Z","title":"Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T22:21:55.047416Z"},"links":{"cited_paper":"/paper/2405.14475","citing_paper":"/paper/2412.03520"},"observation_digest":"sha256:f4aab9cf972c6c467ca69f0216caa9f782245f3aedf58e47ac6db993f4595803","observation_id":"286acbde-e74d-46a9-afbb-aa259be4d544","resolution":{"observed_at":"2026-08-11T22:21:55.047416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:21:56.161392Z","title":"Magicdrive: Street view generation with diverse 3d geometry control","venue":null,"work_id":"89625347-4311-4cdb-8ef9-5efbe4a05d7e","year":null},"citing_paper":{"arxiv_id":"2412.03520","last_updated":"2024-12-09T06:58:05Z","snapshot_observed_at":"2026-08-15T14:35:40.823601Z","submitted_at":"2024-12-04T18:02:49Z","title":"Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T22:21:55.053138Z"},"links":{"citing_paper":"/paper/2412.03520"},"observation_digest":"sha256:80e11ac943830bcaeea17a96420fe822a02c8b7fb7e5ad4e7050d370a6aad5a5","observation_id":"99d89f3e-ca6c-4972-aee5-821e6c7f0f08","resolution":{"observed_at":"2026-08-11T22:21:56.168071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:21:55.059616Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.03520","last_updated":"2024-12-09T06:58:05Z","snapshot_observed_at":"2026-08-15T14:35:40.823601Z","submitted_at":"2024-12-04T18:02:49Z","title":"Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T22:21:55.059616Z"},"links":{"citing_paper":"/paper/2412.03520"},"observation_digest":"sha256:41d73be8d8c3b9748b4d8cdadbfd1d9b808c1a8dcb2851a7b96b0769e81a4f1e","observation_id":"d43296b9-aa0b-4b07-8a8b-7d63700ee705","resolution":{"observed_at":"2026-08-11T22:21:55.059616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-08-12T19:21:15.526321Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-08-11T22:21:55.065835Z","title":"Cogvideo: Large-scale pretraining for text-to-video generation via transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03520","last_updated":"2024-12-09T06:58:05Z","snapshot_observed_at":"2026-08-15T14:35:40.823601Z","submitted_at":"2024-12-04T18:02:49Z","title":"Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T22:21:55.065835Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2412.03520"},"observation_digest":"sha256:866f60a2e7d5ddcd2e68701c81e37c5e83b59654a12f8a9c0bac4bdb2ee24ec8","observation_id":"8d4c8905-cd80-4290-b30e-f903b78ff28a","resolution":{"observed_at":"2026-08-11T22:21:55.065835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-11T22:21:55.073748Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.03520","last_updated":"2024-12-09T06:58:05Z","snapshot_observed_at":"2026-08-15T14:35:40.823601Z","submitted_at":"2024-12-04T18:02:49Z","title":"Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T22:21:55.073748Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2412.03520"},"observation_digest":"sha256:c83e05b1b7af1d3cdcf940d3305fbd818cf3fbd21bc6d341d3264aa485e3e80a","observation_id":"faa48062-5193-4a7e-aa37-a5f34ea9e360","resolution":{"observed_at":"2026-08-11T22:21:55.073748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:21:56.125811Z","title":"Monocular quasi-dense 3d object tracking","venue":null,"work_id":"d84bf592-f4fc-4712-b7ff-f3aaf35dc9b9","year":1992},"citing_paper":{"arxiv_id":"2412.03520","last_updated":"2024-12-09T06:58:05Z","snapshot_observed_at":"2026-08-15T14:35:40.823601Z","submitted_at":"2024-12-04T18:02:49Z","title":"Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T22:21:55.079303Z"},"links":{"citing_paper":"/paper/2412.03520"},"observation_digest":"sha256:75a693aa0ef64f3250e87395f179c562c91fd858c292fc2ba9dde0454e821e91","observation_id":"3d8ff2f5-d5e5-4038-98d2-736241d6baa1","resolution":{"observed_at":"2026-08-11T22:21:56.131127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11790","last_updated":"2022-06-16T09:15:52Z","snapshot_observed_at":"2026-07-06T12:21:28.059661Z","submitted_at":"2021-12-22T10:48:06Z","title":"BEVDet: High-performance Multi-camera 3D Object Detection in Bird-Eye-View","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.11790","snapshot_observed_at":"2026-08-11T22:21:55.085759Z","title":"Bevdet: High-performance multi-camera 3d object de- tection in bird-eye-view","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.03520","last_updated":"2024-12-09T06:58:05Z","snapshot_observed_at":"2026-08-15T14:35:40.823601Z","submitted_at":"2024-12-04T18:02:49Z","title":"Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T22:21:55.085759Z"},"links":{"cited_paper":"/paper/2112.11790","citing_paper":"/paper/2412.03520"},"observation_digest":"sha256:01dd39c7d22717c7154884c5c05702677ba21291feef5c0fda662f79da69c05a","observation_id":"21c478e2-8821-486f-9f41-d911576dc833","resolution":{"observed_at":"2026-08-11T22:21:55.085759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:21:56.106962Z","title":"An- chor3dlane: Learning to regress 3d anchors for monocular 3d lane detection","venue":null,"work_id":"9448231d-f319-4cab-8397-93f69c2a3828","year":2023},"citing_paper":{"arxiv_id":"2412.03520","last_updated":"2024-12-09T06:58:05Z","snapshot_observed_at":"2026-08-15T14:35:40.823601Z","submitted_at":"2024-12-04T18:02:49Z","title":"Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T22:21:55.092727Z"},"links":{"citing_paper":"/paper/2412.03520"},"observation_digest":"sha256:cc5d4591e633fead6b74374cfb8e6e6f59250a869ffd1cd3c27e4bc55f0cfe76","observation_id":"234fdd8c-f7b5-408d-98d2-ef31f83c27ef","resolution":{"observed_at":"2026-08-11T22:21:56.113541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:21:56.087038Z","title":"Polarformer: Multi- camera 3d object detection with polar transformer","venue":null,"work_id":"57946682-f27b-4925-a2d6-af5c51c91075","year":2023},"citing_paper":{"arxiv_id":"2412.03520","last_updated":"2024-12-09T06:58:05Z","snapshot_observed_at":"2026-08-15T14:35:40.823601Z","submitted_at":"2024-12-04T18:02:49Z","title":"Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T22:21:55.099733Z"},"links":{"citing_paper":"/paper/2412.03520"},"observation_digest":"sha256:444d305f9095d944ba84ead573e3fd2ef548e4d1636724e2f10c4506ba83c07a","observation_id":"ccc49ff7-1c36-41f8-a2d0-748695b5dc00","resolution":{"observed_at":"2026-08-11T22:21:56.093141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07771","last_updated":"2023-10-11T18:00:08Z","snapshot_observed_at":"2026-08-13T05:51:53.766455Z","submitted_at":"2023-10-11T18:00:08Z","title":"DrivingDiffusion: Layout-Guided multi-view driving scene video generation with latent diffusion model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07771","snapshot_observed_at":"2026-08-11T22:21:55.107476Z","title":"Drivingdif- fusion: Layout-guided multi-view driving scene video 9 generation with latent diffusion model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03520","last_updated":"2024-12-09T06:58:05Z","snapshot_observed_at":"2026-08-15T14:35:40.823601Z","submitted_at":"2024-12-04T18:02:49Z","title":"Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T22:21:55.107476Z"},"links":{"cited_paper":"/paper/2310.07771","citing_paper":"/paper/2412.03520"},"observation_digest":"sha256:cb1d5666e157ae7d25a448cc3580048cb922459566a11c579fc21cd4831fdc99","observation_id":"32869267-ec82-4f2b-a468-bb5864902378","resolution":{"observed_at":"2026-08-11T22:21:55.107476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:21:55.116016Z","title":"Bevformer: Learning bird’s-eye-view representation from multi-camera images via spatiotemporal transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03520","last_updated":"2024-12-09T06:58:05Z","snapshot_observed_at":"2026-08-15T14:35:40.823601Z","submitted_at":"2024-12-04T18:02:49Z","title":"Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T22:21:55.116016Z"},"links":{"citing_paper":"/paper/2412.03520"},"observation_digest":"sha256:d634a31a25fa1fdb558a080984fdac8672a42e1f0613615b63910d7591fb5a3f","observation_id":"5a5cdd1c-2e21-46e4-bf4b-d4c062eb42d9","resolution":{"observed_at":"2026-08-11T22:21:55.116016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:21:56.052810Z","title":"Nuwa-infinity: Autoregressive over autoregressive generation for infinite visual synthesis","venue":null,"work_id":"a132d408-def5-4b02-9376-9051adfc991e","year":2022},"citing_paper":{"arxiv_id":"2412.03520","last_updated":"2024-12-09T06:58:05Z","snapshot_observed_at":"2026-08-15T14:35:40.823601Z","submitted_at":"2024-12-04T18:02:49Z","title":"Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T22:21:55.122969Z"},"links":{"citing_paper":"/paper/2412.03520"},"observation_digest":"sha256:0db1cda5f00517450fc47faab0a1e10a7709ed3bfc671877670df700c1e4a337","observation_id":"5c685560-50f8-4630-bb8a-69f75013730f","resolution":{"observed_at":"2026-08-11T22:21:56.059341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:21:55.130309Z","title":"Petrv2: A unified framework for 3d perception from multi-camera images","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03520","last_updated":"2024-12-09T06:58:05Z","snapshot_observed_at":"2026-08-15T14:35:40.823601Z","submitted_at":"2024-12-04T18:02:49Z","title":"Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T22:21:55.130309Z"},"links":{"citing_paper":"/paper/2412.03520"},"observation_digest":"sha256:2d05618eb3dd30fe3f75cfc6db2c4ce339abf01a95380aa7f11ee1f43c3f0025","observation_id":"fd64fd1b-6af8-4d7f-b4aa-d75ea977888b","resolution":{"observed_at":"2026-08-11T22:21:55.130309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:21:56.021071Z","title":"Bevfusion: Multi- task multi-sensor fusion with unified bird’s-eye view repre- sentation","venue":null,"work_id":"77677749-fda7-45a4-b310-afcb67ae9641","year":2023},"citing_paper":{"arxiv_id":"2412.03520","last_updated":"2024-12-09T06:58:05Z","snapshot_observed_at":"2026-08-15T14:35:40.823601Z","submitted_at":"2024-12-04T18:02:49Z","title":"Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T22:21:55.136066Z"},"links":{"citing_paper":"/paper/2412.03520"},"observation_digest":"sha256:451850bf2786c6220a057a1ec168cf136ba2b6c1850dae1a52b98f1998684e4f","observation_id":"30d3c843-9f98-4948-ac27-b914a24a61da","resolution":{"observed_at":"2026-08-11T22:21:56.027546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:21:56.000868Z","title":"On aliased resizing and surprising subtleties in gan evaluation","venue":null,"work_id":"ec264897-9f4f-4d76-bbb9-4280116d2894","year":2022},"citing_paper":{"arxiv_id":"2412.03520","last_updated":"2024-12-09T06:58:05Z","snapshot_observed_at":"2026-08-15T14:35:40.823601Z","submitted_at":"2024-12-04T18:02:49Z","title":"Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T22:21:55.141853Z"},"links":{"citing_paper":"/paper/2412.03520"},"observation_digest":"sha256:651e56078b4ec9c7d86051bb000c3053d33abbe253c8b65e481ad24fcca06126","observation_id":"9deff6c3-5270-4434-b757-7df5932e5532","resolution":{"observed_at":"2026-08-11T22:21:56.007125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:21:55.147114Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.03520","last_updated":"2024-12-09T06:58:05Z","snapshot_observed_at":"2026-08-15T14:35:40.823601Z","submitted_at":"2024-12-04T18:02:49Z","title":"Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T22:21:55.147114Z"},"links":{"citing_paper":"/paper/2412.03520"},"observation_digest":"sha256:b292c44a97712a2883f015e86206e0fac1932fa4a6323ace28a6a74181babafe","observation_id":"a01c8e0b-e0b5-4b6f-a10e-38efd6d605ad","resolution":{"observed_at":"2026-08-11T22:21:55.147114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06070","last_updated":"2025-03-08T08:43:03Z","snapshot_observed_at":"2026-08-14T06:25:06.545953Z","submitted_at":"2024-08-12T11:41:18Z","title":"ControlNeXt: Powerful and Efficient Control for Image and Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06070","snapshot_observed_at":"2026-08-11T22:21:55.152774Z","title":"Controlnext: Powerful and effi- cient control for image and video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03520","last_updated":"2024-12-09T06:58:05Z","snapshot_observed_at":"2026-08-15T14:35:40.823601Z","submitted_at":"2024-12-04T18:02:49Z","title":"Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T22:21:55.152774Z"},"links":{"cited_paper":"/paper/2408.06070","citing_paper":"/paper/2412.03520"},"observation_digest":"sha256:45e0181ef08f66829279430fbc67e31ef360e29667a8a7f4f964b93903bf4600","observation_id":"ea662dcd-aef0-454f-92db-56837ce83e0f","resolution":{"observed_at":"2026-08-11T22:21:55.152774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:21:55.968455Z","title":null,"venue":null,"work_id":"1e8ca84a-6adf-4814-b7c6-c9e50a766750","year":2020},"citing_paper":{"arxiv_id":"2412.03520","last_updated":"2024-12-09T06:58:05Z","snapshot_observed_at":"2026-08-15T14:35:40.823601Z","submitted_at":"2024-12-04T18:02:49Z","title":"Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T22:21:55.157939Z"},"links":{"citing_paper":"/paper/2412.03520"},"observation_digest":"sha256:cb8c8a9c62ae1f3a77af37d8f103580e32227284dc040fe3689885e44c28b00f","observation_id":"d6db93f6-0960-4679-bafa-754cb6342bc0","resolution":{"observed_at":"2026-08-11T22:21:55.974041Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:21:55.950484Z","title":"Frame-recurrent video super-resolution","venue":null,"work_id":"f70acda0-dadb-4958-b3a6-c47ca9aa6b5b","year":2018},"citing_paper":{"arxiv_id":"2412.03520","last_updated":"2024-12-09T06:58:05Z","snapshot_observed_at":"2026-08-15T14:35:40.823601Z","submitted_at":"2024-12-04T18:02:49Z","title":"Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T22:21:55.162844Z"},"links":{"citing_paper":"/paper/2412.03520"},"observation_digest":"sha256:dd19b12e9df8bd424da68d60e1f2974065b0c9802a7f7c6ba2e3244d008c7297","observation_id":"f82c7d4a-cfcc-4fe8-b1ec-3493e5d64b1e","resolution":{"observed_at":"2026-08-11T22:21:55.955922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-11T22:21:55.168004Z","title":"Score-based generative modeling through stochastic differential equa- tions","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2412.03520","last_updated":"2024-12-09T06:58:05Z","snapshot_observed_at":"2026-08-15T14:35:40.823601Z","submitted_at":"2024-12-04T18:02:49Z","title":"Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T22:21:55.168004Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2412.03520"},"observation_digest":"sha256:12eec2afab503cc222e6f8bf201b87c3e0bf6b62383e842eefa1d7ba7b29f8fc","observation_id":"d1f2369d-96c3-470f-8152-9eecd07d1fa3","resolution":{"observed_at":"2026-08-11T22:21:55.168004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:21:55.931202Z","title":"Street- view image generation from a bird’s-eye view layout","venue":null,"work_id":"d900b617-7179-4b92-b863-032301d301e3","year":2024},"citing_paper":{"arxiv_id":"2412.03520","last_updated":"2024-12-09T06:58:05Z","snapshot_observed_at":"2026-08-15T14:35:40.823601Z","submitted_at":"2024-12-04T18:02:49Z","title":"Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T22:21:55.173906Z"},"links":{"citing_paper":"/paper/2412.03520"},"observation_digest":"sha256:c2415959c801e282642b7e63bb7130d3a55f26591036b1f5c484307a046afcb0","observation_id":"c00b3bed-531c-4656-8a72-505a9c0dcff6","resolution":{"observed_at":"2026-08-11T22:21:55.937691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-08-15T00:26:15.250313Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-11T22:21:55.179249Z","title":"To- wards accurate generative models of video: A new metric & challenges","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.03520","last_updated":"2024-12-09T06:58:05Z","snapshot_observed_at":"2026-08-15T14:35:40.823601Z","submitted_at":"2024-12-04T18:02:49Z","title":"Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T22:21:55.179249Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2412.03520"},"observation_digest":"sha256:1d617c2b5e90263cc72d54e85634aa696768eef590756c952ced876857e87948","observation_id":"6ab425f2-8602-4c93-a212-b00a64c7df9b","resolution":{"observed_at":"2026-08-11T22:21:55.179249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06571","last_updated":"2023-08-12T13:53:10Z","snapshot_observed_at":"2026-08-14T13:59:50.878772Z","submitted_at":"2023-08-12T13:53:10Z","title":"ModelScope Text-to-Video Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06571","snapshot_observed_at":"2026-08-11T22:21:55.185113Z","title":"Modelscope text-to-video technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03520","last_updated":"2024-12-09T06:58:05Z","snapshot_observed_at":"2026-08-15T14:35:40.823601Z","submitted_at":"2024-12-04T18:02:49Z","title":"Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T22:21:55.185113Z"},"links":{"cited_paper":"/paper/2308.06571","citing_paper":"/paper/2412.03520"},"observation_digest":"sha256:fab5912ac6003a5711e23a6e1e872fe4b69a593be6cfe9fd391a0157d77c3d34","observation_id":"918468f5-232a-47f5-97d6-c84887e05b5b","resolution":{"observed_at":"2026-08-11T22:21:55.185113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10874","last_updated":"2024-04-24T11:22:00Z","snapshot_observed_at":"2026-08-13T11:39:34.773518Z","submitted_at":"2023-05-18T11:06:15Z","title":"Swap Attention in Spatiotemporal Diffusions for Text-to-Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10874","snapshot_observed_at":"2026-08-11T22:21:55.190603Z","title":"Videofactory: Swap at- tention in spatiotemporal diffusions for text-to-video gener- ation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03520","last_updated":"2024-12-09T06:58:05Z","snapshot_observed_at":"2026-08-15T14:35:40.823601Z","submitted_at":"2024-12-04T18:02:49Z","title":"Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T22:21:55.190603Z"},"links":{"cited_paper":"/paper/2305.10874","citing_paper":"/paper/2412.03520"},"observation_digest":"sha256:7dc3e330dc88ba8eb058ac69864ed597f2309299da7b313a98d0f4f5f909a7df","observation_id":"52e689b0-0447-45a6-8c07-7e6606a3d111","resolution":{"observed_at":"2026-08-11T22:21:55.190603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.09777","last_updated":"2023-11-27T05:09:29Z","snapshot_observed_at":"2026-08-13T10:10:52.493348Z","submitted_at":"2023-09-18T13:58:42Z","title":"DriveDreamer: Towards Real-world-driven World Models for Autonomous Driving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.09777","snapshot_observed_at":"2026-08-11T22:21:55.197273Z","title":"Drivedreamer: Towards real-world- driven world models for autonomous driving","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03520","last_updated":"2024-12-09T06:58:05Z","snapshot_observed_at":"2026-08-15T14:35:40.823601Z","submitted_at":"2024-12-04T18:02:49Z","title":"Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T22:21:55.197273Z"},"links":{"cited_paper":"/paper/2309.09777","citing_paper":"/paper/2412.03520"},"observation_digest":"sha256:dfe03288b35b4169b636ae374e96db1807bf3455841899aa89a8beb77249339c","observation_id":"5d018bf1-1197-4bca-bfd4-dea17f858687","resolution":{"observed_at":"2026-08-11T22:21:55.197273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:21:55.911836Z","title":"End-to-end video instance segmentation with transformers","venue":null,"work_id":"a6348714-6950-407b-bc8e-7d048aa55b47","year":2021},"citing_paper":{"arxiv_id":"2412.03520","last_updated":"2024-12-09T06:58:05Z","snapshot_observed_at":"2026-08-15T14:35:40.823601Z","submitted_at":"2024-12-04T18:02:49Z","title":"Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T22:21:55.203627Z"},"links":{"citing_paper":"/paper/2412.03520"},"observation_digest":"sha256:9ac551a162728a09a8b98a64709a536e9dff4ff7e6eb6729dc501954703ce664","observation_id":"bcf02dd3-1b15-468a-9809-cfbf8b2ce20c","resolution":{"observed_at":"2026-08-11T22:21:55.918436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15103","last_updated":"2023-09-27T03:51:52Z","snapshot_observed_at":"2026-08-14T11:04:59.421484Z","submitted_at":"2023-09-26T17:52:03Z","title":"LAVIE: High-Quality Video Generation with Cascaded Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15103","snapshot_observed_at":"2026-08-11T22:21:55.209284Z","title":"Lavie: High-quality video gener- ation with cascaded latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03520","last_updated":"2024-12-09T06:58:05Z","snapshot_observed_at":"2026-08-15T14:35:40.823601Z","submitted_at":"2024-12-04T18:02:49Z","title":"Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T22:21:55.209284Z"},"links":{"cited_paper":"/paper/2309.15103","citing_paper":"/paper/2412.03520"},"observation_digest":"sha256:2a9bce38b1741e08f61bce099519909578e4d6227d8c8b946540b8faadc3210b","observation_id":"bc3b5566-be2f-4b5e-a57d-c2abb98257e0","resolution":{"observed_at":"2026-08-11T22:21:55.209284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:21:55.884279Z","title":"Panacea: Panoramic and controllable video generation for autonomous driving","venue":null,"work_id":"7ba06d5d-1e93-48df-8282-2f4a4ff7d13f","year":2024},"citing_paper":{"arxiv_id":"2412.03520","last_updated":"2024-12-09T06:58:05Z","snapshot_observed_at":"2026-08-15T14:35:40.823601Z","submitted_at":"2024-12-04T18:02:49Z","title":"Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T22:21:55.216870Z"},"links":{"citing_paper":"/paper/2412.03520"},"observation_digest":"sha256:26201d6a1910afbf88b5da6e2b11ff6c294774b5550805e3e65909a9b8bb8e24","observation_id":"83bbba93-a6a1-445e-b330-d92470a6a4cb","resolution":{"observed_at":"2026-08-11T22:21:55.889904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.14806","last_updated":"2021-04-30T07:40:35Z","snapshot_observed_at":"2026-08-15T14:31:01.632833Z","submitted_at":"2021-04-30T07:40:35Z","title":"GODIVA: Generating Open-DomaIn Videos from nAtural Descriptions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.14806","snapshot_observed_at":"2026-08-11T22:21:55.224354Z","title":"Godiva: Gen- erating open-domain videos from natural descriptions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.03520","last_updated":"2024-12-09T06:58:05Z","snapshot_observed_at":"2026-08-15T14:35:40.823601Z","submitted_at":"2024-12-04T18:02:49Z","title":"Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T22:21:55.224354Z"},"links":{"cited_paper":"/paper/2104.14806","citing_paper":"/paper/2412.03520"},"observation_digest":"sha256:37261b46988fe773f295488b874e37720b9721cd53f64d4c61db9f1deaf123ea","observation_id":"616c4db0-f7b0-434d-a618-77032c9d0853","resolution":{"observed_at":"2026-08-11T22:21:55.224354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01661","last_updated":"2023-09-23T06:59:18Z","snapshot_observed_at":"2026-08-13T10:41:59.154745Z","submitted_at":"2023-08-03T09:56:31Z","title":"BEVControl: Accurately Controlling Street-view Elements with Multi-perspective Consistency via BEV Sketch Layout","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01661","snapshot_observed_at":"2026-08-11T22:21:55.231028Z","title":"Bevcontrol: Accurately controlling street- view elements with multi-perspective consistency via bev sketch layout","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03520","last_updated":"2024-12-09T06:58:05Z","snapshot_observed_at":"2026-08-15T14:35:40.823601Z","submitted_at":"2024-12-04T18:02:49Z","title":"Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T22:21:55.231028Z"},"links":{"cited_paper":"/paper/2308.01661","citing_paper":"/paper/2412.03520"},"observation_digest":"sha256:0d56d35642a832e79a2fd56c829b95c275a4b342b7e7bf1bfd5e1218369a0c08","observation_id":"d905c105-1d8b-4e68-b6e2-a93531c3682a","resolution":{"observed_at":"2026-08-11T22:21:55.231028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-08-15T19:52:28.153954Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-11T22:21:55.237776Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03520","last_updated":"2024-12-09T06:58:05Z","snapshot_observed_at":"2026-08-15T14:35:40.823601Z","submitted_at":"2024-12-04T18:02:49Z","title":"Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T22:21:55.237776Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2412.03520"},"observation_digest":"sha256:8b6ecb9e9f8ed5e6343e48de2f91bf49e05eb62115ae648460b776179e235c6a","observation_id":"1b81d4a7-90d3-46a7-881f-18d52fb590f5","resolution":{"observed_at":"2026-08-11T22:21:55.237776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:21:55.243096Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03520","last_updated":"2024-12-09T06:58:05Z","snapshot_observed_at":"2026-08-15T14:35:40.823601Z","submitted_at":"2024-12-04T18:02:49Z","title":"Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T22:21:55.243096Z"},"links":{"citing_paper":"/paper/2412.03520"},"observation_digest":"sha256:3d54f5ae13b0a5bfd16f813cfa8041e681f9e69e55100759dda275b0f2f28b04","observation_id":"9da96595-be7c-4b71-a993-b8c9d52f357f","resolution":{"observed_at":"2026-08-11T22:21:55.243096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:21:55.248379Z","title":"Mutr3d: A multi-camera tracking frame- work via 3d-to-2d queries","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03520","last_updated":"2024-12-09T06:58:05Z","snapshot_observed_at":"2026-08-15T14:35:40.823601Z","submitted_at":"2024-12-04T18:02:49Z","title":"Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T22:21:55.248379Z"},"links":{"citing_paper":"/paper/2412.03520"},"observation_digest":"sha256:5779551f2edfd5b5d72000c2960e8ccec4b117407d75302ae6488a01f435ecf7","observation_id":"a2ddb8f7-c0f9-469e-b06b-0f577fdf893e","resolution":{"observed_at":"2026-08-11T22:21:55.248379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15334","last_updated":"2023-03-27T15:35:21Z","snapshot_observed_at":"2026-08-13T12:15:32.382368Z","submitted_at":"2023-03-27T15:35:21Z","title":"ByteTrackV2: 2D and 3D Multi-Object Tracking by Associating Every Detection Box","version":1},"cited_work":{"arxiv_id":"2303.15334","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.15334","snapshot_observed_at":"2026-08-11T22:21:55.359659Z","title":"ByteTrackV2: 2D and 3D Multi-Object Tracking by Associating Every Detection Box","venue":"cs.CV","work_id":"495b1bd4-e358-41f9-9940-90a9b0d35ec2","year":2023},"citing_paper":{"arxiv_id":"2412.03520","last_updated":"2024-12-09T06:58:05Z","snapshot_observed_at":"2026-08-15T14:35:40.823601Z","submitted_at":"2024-12-04T18:02:49Z","title":"Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T22:21:55.254764Z"},"links":{"cited_paper":"/paper/2303.15334","citing_paper":"/paper/2412.03520"},"observation_digest":"sha256:e900fed6bea0958b6926ad6b2d859e4462a782e3bc00b3fccb7a9750a04d36b7","observation_id":"8d33a151-7606-4c35-93be-0aa9408cd3e3","resolution":{"observed_at":"2026-08-11T22:21:55.368563Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13077","last_updated":"2023-05-22T14:48:53Z","snapshot_observed_at":"2026-08-16T01:17:47.460871Z","submitted_at":"2023-05-22T14:48:53Z","title":"ControlVideo: Training-free Controllable Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13077","snapshot_observed_at":"2026-08-11T22:21:55.261327Z","title":"Controlvideo: Training-free controllable text-to-video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03520","last_updated":"2024-12-09T06:58:05Z","snapshot_observed_at":"2026-08-15T14:35:40.823601Z","submitted_at":"2024-12-04T18:02:49Z","title":"Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T22:21:55.261327Z"},"links":{"cited_paper":"/paper/2305.13077","citing_paper":"/paper/2412.03520"},"observation_digest":"sha256:eb679623173fdc21832eaac87ffe4d74ba255e59f751a7fbb9632b436e71b365","observation_id":"f2644c47-3b6b-4252-864b-d9736baa5fde","resolution":{"observed_at":"2026-08-11T22:21:55.261327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:21:55.838804Z","title":"Cross-view transform- ers for real-time map-view semantic segmentation","venue":null,"work_id":"8a02af8d-9447-4cc7-ab0c-a3b8d28bdd27","year":2022},"citing_paper":{"arxiv_id":"2412.03520","last_updated":"2024-12-09T06:58:05Z","snapshot_observed_at":"2026-08-15T14:35:40.823601Z","submitted_at":"2024-12-04T18:02:49Z","title":"Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T22:21:55.266891Z"},"links":{"citing_paper":"/paper/2412.03520"},"observation_digest":"sha256:5a3d75e49f1f87c0cc8c925410146d1b1e34fbe264a8c7ccf48229e5ccf8b5af","observation_id":"ec6acbee-d3fb-497f-9b72-d277c630d8da","resolution":{"observed_at":"2026-08-11T22:21:55.845580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:21:55.815144Z","title":"For MagicDrive-V , we utilize the official pretrained weights to generate videos on the nuScenes validation split","venue":null,"work_id":"2400bcec-288c-4df6-b85e-d028c3d1b5e2","year":1955},"citing_paper":{"arxiv_id":"2412.03520","last_updated":"2024-12-09T06:58:05Z","snapshot_observed_at":"2026-08-15T14:35:40.823601Z","submitted_at":"2024-12-04T18:02:49Z","title":"Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T22:21:55.272750Z"},"links":{"citing_paper":"/paper/2412.03520"},"observation_digest":"sha256:22c9b2b8e970a00aa500d767bb3747c1d2fc309bb63f095bc84c651c52fc3f70","observation_id":"bc1f59bb-0435-41fa-9d3c-39f09eb49b0e","resolution":{"observed_at":"2026-08-11T22:21:55.822689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:21:55.788155Z","title":"Since MagicDrive-V [7] is the only multi-view video generation method that releases model weights, we use the generation results from MagicDrive-V for comparison","venue":null,"work_id":"fb554623-6472-42a2-8780-1ed5f9891d75","year":null},"citing_paper":{"arxiv_id":"2412.03520","last_updated":"2024-12-09T06:58:05Z","snapshot_observed_at":"2026-08-15T14:35:40.823601Z","submitted_at":"2024-12-04T18:02:49Z","title":"Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T22:21:55.279255Z"},"links":{"citing_paper":"/paper/2412.03520"},"observation_digest":"sha256:6aae296510344bcf9934f00ca063208ccd6ec0763430a4807a06c8aacc9c92e0","observation_id":"88ecadad-147f-49ce-8555-f4361ddd6a52","resolution":{"observed_at":"2026-08-11T22:21:55.798258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:21:55.765019Z","title":"We preprocess these videos by segmenting them into clips of 16 frames","venue":null,"work_id":"33673bc2-adb3-44ae-acef-c5abdd864fb4","year":null},"citing_paper":{"arxiv_id":"2412.03520","last_updated":"2024-12-09T06:58:05Z","snapshot_observed_at":"2026-08-15T14:35:40.823601Z","submitted_at":"2024-12-04T18:02:49Z","title":"Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T22:21:55.284941Z"},"links":{"citing_paper":"/paper/2412.03520"},"observation_digest":"sha256:b4fc223ef2c0d6805d001a352c3b72871c97a42548b255ae08bf30096de35562","observation_id":"f82df3af-b086-493e-a5cc-15d2257c23ef","resolution":{"observed_at":"2026-08-11T22:21:55.773035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.03520","last_updated":"2024-12-09T06:58:05Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T14:35:40.823601Z","submitted_at":"2024-12-04T18:02:49Z","title":"Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":1,"verified_fuzzy":16},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 4 inbound Pith citation observations for arXiv:2412.03520."}