{"as_of":"2026-08-07T12:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4726234f37cf36ccf284467c96142183db4039bcf9598dc763b0edd8b7a72e88","coverage":[{"denominator":123,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:39:33.523972Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.04701/citation-record","integrity":"/paper/2608.04701/integrity","json":"/paper/2608.04701/citation-record.json","paper":"/paper/2608.04701"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:23.833592Z","title":"HyperReel: High-fidelity 6-DoF video with ray-conditioned sampling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:23.833592Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:fb31c911bd80e17937d2315a0041c4c413d37183480d2cc0fc6643c539508292","observation_id":"769d24f3-4276-47ab-bf58-0a41c1a8b5b5","resolution":{"observed_at":"2026-08-06T18:39:23.833592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:24.721924Z","title":"Vd3d: Taming large video diffusion transformers for 3d camera control","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:24.721924Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:fb2488e3db74c40e72488c71647bbae9a00aea2f983aee3f6b327ced74030d20","observation_id":"8fe0dbfc-1477-45e3-8e98-c7ff9caec63f","resolution":{"observed_at":"2026-08-06T18:39:24.721924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:25.534842Z","title":"Recammaster: Camera-controlled generative rendering from a single video","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:25.534842Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:73dfa9a3a1773f845b6fb8aae1732100bf69055bbcf807d431f3f0ec56c018d0","observation_id":"58fffe63-7d21-4a44-940a-2446f34cd810","resolution":{"observed_at":"2026-08-06T18:39:25.534842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:25.584804Z","title":"Syncammaster: Synchronizing multi-camera video generation from diverse viewpoints","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:25.584804Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:69971b32b5ddfa8525aab6c74a2e4cfc1fe1243fb1de4a5829ae5e001369d024","observation_id":"2d13d07f-fc27-4ad6-a401-44441acef3f1","resolution":{"observed_at":"2026-08-06T18:39:25.584804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:25.652645Z","title":"Mip-nerf: A multiscale representation for anti-aliasing neural radiance fields","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:25.652645Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:021dd3f0e348dbb6bb95733e2d95eb4ae8ebacf6829757a8088d6439ce20560d","observation_id":"c850955e-a832-4f73-b448-a4c2c64ee766","resolution":{"observed_at":"2026-08-06T18:39:25.652645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:25.758785Z","title":"Mip-nerf 360: Unbounded anti-aliased neural radiance fields","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:25.758785Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:17dc88834ffe7aa30ca1ae0733cfdaa81129df6b150b7aa18a81ae361e3ff06e","observation_id":"4c37c0fe-f8ea-425e-adac-7c4a6c747565","resolution":{"observed_at":"2026-08-06T18:39:25.758785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:25.848067Z","title":"Zip-nerf: Anti-aliased grid-based neural radiance fields","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:25.848067Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:68f62e9fa9f4ced2f1701f9e2bbffa338faec41d4e8c3298a62084b1158e51b5","observation_id":"dee55b3a-b20b-4ba0-9a50-e50b47f54f1c","resolution":{"observed_at":"2026-08-06T18:39:25.848067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-06T18:39:25.912585Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:25.912585Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:bfc3a4d37ae274e29d110bbaaff48cc2b559bd624d81049c3a3a48e59d72e90d","observation_id":"86ae3955-174c-4a0e-bc92-fa54fda7bed9","resolution":{"observed_at":"2026-08-06T18:39:25.912585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:26.032055Z","title":"Align your latents: High-resolution video synthesis with latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:26.032055Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:4ce0d57ca68c5811352d9621c652df7dde3498c3f3e7db23d684f456c58a2368","observation_id":"468aa9ce-c49d-4f7f-9434-4c9d4327bc47","resolution":{"observed_at":"2026-08-06T18:39:26.032055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:26.159781Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:26.159781Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:edc6478358c42d52f5513f34e2253fb84811c1766265695628d6b23b62b7ae14","observation_id":"451a9d82-aa24-47e3-ad7d-324be47c485b","resolution":{"observed_at":"2026-08-06T18:39:26.159781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:26.241951Z","title":"Hexplane: A fast representation for dynamic scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:26.241951Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:7812aa64fb4945af3b16c197790ce7d9a5603bff9ff378883bc31b8fff9566b1","observation_id":"a81e46f1-751d-4f63-96af-00b4be64830e","resolution":{"observed_at":"2026-08-06T18:39:26.241951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:26.328838Z","title":"Uni3c: Unifying precisely 3d-enhanced camera and human motion controls for video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:26.328838Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:0316a2d9b5a36b6f70157339abd85aa80bec2e6497b97c3bc5db8c7a01e48793","observation_id":"486d6bec-ffb2-4397-ab75-b1cce53f4cf2","resolution":{"observed_at":"2026-08-06T18:39:26.328838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:26.391065Z","title":"Mvsnerf: Fast generalizable radiance field reconstruction from multi-view stereo","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:26.391065Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:59b81a3bc4edb4686cf3f7396be8d151e141b6c80e3aff768eefaa232a0d7252","observation_id":"44c6ad67-89e9-49b5-ba45-6af6318db70c","resolution":{"observed_at":"2026-08-06T18:39:26.391065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19512","last_updated":"2023-10-30T13:12:40Z","snapshot_observed_at":"2026-08-07T10:15:15.859263Z","submitted_at":"2023-10-30T13:12:40Z","title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19512","snapshot_observed_at":"2026-08-06T18:39:26.478077Z","title":"Videocrafter1: Open diffusion models for high-quality video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:26.478077Z"},"links":{"cited_paper":"/paper/2310.19512","citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:a5336c774a186c1ce54b09c26b0902cd1be27d5d99c83457da7e6eb6376305e5","observation_id":"1c8e4d68-a0a9-4c4e-ae54-9eec7c072e7c","resolution":{"observed_at":"2026-08-06T18:39:26.478077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12375","last_updated":"2025-06-15T03:50:49Z","snapshot_observed_at":"2026-07-06T20:24:03.105038Z","submitted_at":"2025-01-21T18:53:30Z","title":"Video Depth Anything: Consistent Depth Estimation for Super-Long Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12375","snapshot_observed_at":"2026-08-06T18:39:26.592889Z","title":"Video depth anything: Consistent depth estimation for super-long videos.arXiv:2501.12375, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:26.592889Z"},"links":{"cited_paper":"/paper/2501.12375","citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:ded13492859759951e67753de812425a6fb07d8c88b2781473778b94ea7fee8a","observation_id":"a1ac38ed-ec1a-4c70-8835-a89107fa843d","resolution":{"observed_at":"2026-08-06T18:39:26.592889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:26.705710Z","title":"Mvsplat: Efficient 3d gaussian splatting from sparse multi-view images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:26.705710Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:b54b667f829711b135b1fe904fe2ab1b573d3dc79f31ad04794d0cf41d02745b","observation_id":"7cf94cf7-c846-47ac-8e08-cd2af6e452af","resolution":{"observed_at":"2026-08-06T18:39:26.705710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13384","last_updated":"2023-11-23T11:40:16Z","snapshot_observed_at":"2026-07-06T16:51:06.781541Z","submitted_at":"2023-11-22T13:27:34Z","title":"LucidDreamer: Domain-free Generation of 3D Gaussian Splatting Scenes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.13384","snapshot_observed_at":"2026-08-06T18:39:26.797307Z","title":"Luciddreamer: Domain-free generation of 3d gaussian splatting scenes.arXiv preprint arXiv:2311.13384, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:26.797307Z"},"links":{"cited_paper":"/paper/2311.13384","citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:76f32e1a0203bd8556e4713fa44509ea3274f97e9abfc396e29677575ee9dcb3","observation_id":"8d44ce30-75cb-4e4a-b669-84c568b04b99","resolution":{"observed_at":"2026-08-06T18:39:26.797307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:26.915727Z","title":"Cogvideox-fun, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:26.915727Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:5474ad3897198064766d9e24e86c2399638b512cd60357696bd1455b067bb2ad","observation_id":"a933a4d4-0003-489d-acf4-7743de4756e2","resolution":{"observed_at":"2026-08-06T18:39:26.915727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:27.028938Z","title":"Meva: A large-scale multiview, multimodal video dataset for activity detection","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:27.028938Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:71420003d69df365712754e83687d3000392b2cf253fb6f7f934112c5e9eb3ec","observation_id":"90bb4576-bd9d-46b2-8aab-4ccf285eef67","resolution":{"observed_at":"2026-08-06T18:39:27.028938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20309","last_updated":"2025-07-03T22:28:07Z","snapshot_observed_at":"2026-08-06T20:09:51.889461Z","submitted_at":"2024-03-29T17:29:58Z","title":"InstantSplat: Sparse-view Gaussian Splatting in Seconds","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20309","snapshot_observed_at":"2026-08-06T18:39:27.140041Z","title":"Instantsplat: Unbounded sparse-view pose-free gaussian splatting in 40 seconds.arXiv:2403.20309, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:27.140041Z"},"links":{"cited_paper":"/paper/2403.20309","citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:1638a18d3aeed79cb99083d063a9a0afe50e1e5c25f8f1c3cef720807ee7751c","observation_id":"00ce304d-bf9e-4c9a-b0fa-fc9ad0599a1e","resolution":{"observed_at":"2026-08-06T18:39:27.140041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:27.254619Z","title":"Ae-nerf: Augmenting event-based neural radiance fields for non-ideal conditions and larger scene","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:27.254619Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:ea0f5d106717745c51e4571fd057305e87de2aecc8c8fb1d566680c369910141","observation_id":"161ed4e1-fdca-4013-bc31-0ea89dae746a","resolution":{"observed_at":"2026-08-06T18:39:27.254619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:27.331520Z","title":"K-planes: Explicit radiance fields in space, time, and appearance","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:27.331520Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:a7f391ee8277cb4a179b3b1aa353720f1ec769a7b95af1267c731ae86c60652f","observation_id":"8255a259-f316-408d-9a78-1a950ac137d0","resolution":{"observed_at":"2026-08-06T18:39:27.331520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:27.426239Z","title":"Dynamic view synthesis from dynamic monocular video","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:27.426239Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:8e21fbfac089926b3ac5e1c0934252931980ba263546992197a68c9fefea73ac","observation_id":"2f952cd2-4d11-4e74-bea3-b380794aefb1","resolution":{"observed_at":"2026-08-06T18:39:27.426239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12365","last_updated":"2024-05-13T19:06:48Z","snapshot_observed_at":"2026-07-06T17:46:46.415492Z","submitted_at":"2024-03-19T02:22:21Z","title":"GaussianFlow: Splatting Gaussian Dynamics for 4D Content Creation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12365","snapshot_observed_at":"2026-08-06T18:39:27.524488Z","title":"Gaussianflow: Splatting gaussian dynamics for 4d content creation.arXiv preprint arXiv:2403.12365, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:27.524488Z"},"links":{"cited_paper":"/paper/2403.12365","citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:3494db88ca59d27e3a2e630085aa4d129628d69618ed1a688f29968ed9ffef3c","observation_id":"79747d4e-60ed-4b31-817b-2d46dbad912d","resolution":{"observed_at":"2026-08-06T18:39:27.524488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:27.644521Z","title":"CAT3D: Create Anything in 3D with Multi-View Diffusion Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:27.644521Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:b537ed334d8517ed8d1c935820114ce080eeb213d1a318d0eae105188726e693","observation_id":"fd5358de-745a-4376-b3f2-5d97d80925c5","resolution":{"observed_at":"2026-08-06T18:39:27.644521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:27.763840Z","title":"Fastnerf: High-fidelity neural rendering at 200fps","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:27.763840Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:dd05b3a996dac35c7e62815516f7f2d29a59265f4e8b97354da84ca506a52ead","observation_id":"ee03573d-c21c-445c-93a3-0a3de8f2b8d1","resolution":{"observed_at":"2026-08-06T18:39:27.763840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:27.845553Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:27.845553Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:62a7c6e76f84f9caa88d1fac59113e516080125803445b227042086929ad91a9","observation_id":"b1c86394-00d8-475e-a719-fc6abb078946","resolution":{"observed_at":"2026-08-06T18:39:27.845553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:27.938002Z","title":"Kubric: A scalable dataset generator","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:27.938002Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:86ef2a75b1de35dcd08e0c81835862057aa0db2883ed15b7e540628c60f33aa9","observation_id":"9a2efdd7-a369-45fe-ba12-4790379f3794","resolution":{"observed_at":"2026-08-06T18:39:27.938002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:28.002426Z","title":"Diffusion as shader: 3d-aware video diffusion for versatile video generation control","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:28.002426Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:89dc9c3dc64058a8d3ab5ac805b7525d9cf35708ef4c4025ac7a960137b88705","observation_id":"cb473ccd-7ebf-4a5e-a291-2f8bb1472d1e","resolution":{"observed_at":"2026-08-06T18:39:28.002426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:28.097988Z","title":"Sparsenerf: Distilling depth ranking for few-shot novel view synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:28.097988Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:327ce529675bcbf1998bc40e905ee55031ab333cc5953c737c888fe6473e5ad7","observation_id":"998a7fb4-e8c5-4c4a-8ba6-19a0a77069be","resolution":{"observed_at":"2026-08-06T18:39:28.097988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:28.183868Z","title":"Cameractrl: Enabling camera control for text-to-video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:28.183868Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:3e9484904b30ea59bcc514900f3de4ca8b1191b05f8b683f267c2f3151098b3c","observation_id":"e0cce43d-e7ad-4f7d-8894-8a3bd9897fa5","resolution":{"observed_at":"2026-08-06T18:39:28.183868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:28.289068Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:28.289068Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:ebf91f0fabbd3a82f5f605efd9a34f34339e2cc9316e4a4b2d8d9f6ae59aaddf","observation_id":"d0f11b97-3e74-40db-9aca-165df33a9c41","resolution":{"observed_at":"2026-08-06T18:39:28.289068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:28.359598Z","title":"Tri-miprf: Tri-mip representation for efficient anti-aliasing neural radiance fields","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:28.359598Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:ac2ac95b2cc57a6b7d5c29872b02d3ed8c80037405dfd62bf417ad75860d6f18","observation_id":"5980f02b-83ce-4f61-a2cf-f164a8e98b76","resolution":{"observed_at":"2026-08-06T18:39:28.359598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02095","last_updated":"2024-11-27T07:59:25Z","snapshot_observed_at":"2026-08-03T20:30:51.594078Z","submitted_at":"2024-09-03T17:52:03Z","title":"DepthCrafter: Generating Consistent Long Depth Sequences for Open-world Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02095","snapshot_observed_at":"2026-08-06T18:39:28.438741Z","title":"Depthcrafter: Generating consistent long depth sequences for open-world videos.arXiv preprint arXiv:2409.02095, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:28.438741Z"},"links":{"cited_paper":"/paper/2409.02095","citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:9044d166ecb8a72fd73f0d57014d9e4cdbba111cd1ab95e4d5e3ba819779c95b","observation_id":"ce60f8a1-2a92-48d5-a927-09230e65782c","resolution":{"observed_at":"2026-08-06T18:39:28.438741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10934","last_updated":"2025-08-12T18:39:13Z","snapshot_observed_at":"2026-07-06T22:13:09.586800Z","submitted_at":"2025-08-12T18:39:13Z","title":"ViPE: Video Pose Engine for 3D Geometric Perception","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10934","snapshot_observed_at":"2026-08-06T18:39:28.517132Z","title":"Vipe: Video pose engine for 3d geometric perception","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:28.517132Z"},"links":{"cited_paper":"/paper/2508.10934","citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:fb62d62daedd1e1072e88973c42838fde4a5b7b0ecfd16b564b2d509ad378926","observation_id":"dc20168e-7ce9-4952-a3ef-a3f10fd3146e","resolution":{"observed_at":"2026-08-06T18:39:28.517132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:28.601018Z","title":"Roompainter: View-integrated diffusion for consistent indoor scene texturing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:28.601018Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:8be764ff10c65d78a7514816493978fc89ce5ecf6336a6c6fb14334263ecb54a","observation_id":"ec05a56c-969e-45a1-b196-578961dfac91","resolution":{"observed_at":"2026-08-06T18:39:28.601018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:28.705252Z","title":"Vace: All-in-one video creation and editing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:28.705252Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:87a1792108a4f9ff7ba216b479056e5c3bc719b747b30a9fb58912c12f68deb5","observation_id":"2bf6148f-3857-4b32-a54b-a66be40d8854","resolution":{"observed_at":"2026-08-06T18:39:28.705252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:28.773560Z","title":"3d gaussian splatting for real-time radiance field rendering.ACM TOG, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:28.773560Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:b1e7489c626b46d52659cd495aa7fca3fed4bb750476c19961d604a6a954062c","observation_id":"0555b1df-885b-42be-ac8b-ab0ad77a673f","resolution":{"observed_at":"2026-08-06T18:39:28.773560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10893","last_updated":"2025-08-14T17:58:05Z","snapshot_observed_at":"2026-08-05T20:18:34.296996Z","submitted_at":"2025-08-14T17:58:05Z","title":"STream3R: Scalable Sequential 3D Reconstruction with Causal Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10893","snapshot_observed_at":"2026-08-06T18:39:28.822177Z","title":"Stream3r: Scalable sequential 3d reconstruction with causal transformer.arXiv preprint arXiv:2508.10893, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:28.822177Z"},"links":{"cited_paper":"/paper/2508.10893","citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:6ebc68ff0c30613808f33d96c43e896e471b6bd442a36c615841e83a537cf5ed","observation_id":"90a4c676-3bfd-465c-84b0-1b9015642161","resolution":{"observed_at":"2026-08-06T18:39:28.822177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:28.884751Z","title":"Fast view synthesis of casual videos with soup-of-planes","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:28.884751Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:94e70133e2b077636a0682b3c8d2d59d9e425936c9a1558c1ee5ac072a59dcda","observation_id":"5fca4c42-65e5-45a4-b0b3-32f07d719eb8","resolution":{"observed_at":"2026-08-06T18:39:28.884751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17421","last_updated":"2024-11-29T18:53:12Z","snapshot_observed_at":"2026-07-06T18:20:44.070255Z","submitted_at":"2024-05-27T17:59:07Z","title":"MoSca: Dynamic Gaussian Fusion from Casual Videos via 4D Motion Scaffolds","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17421","snapshot_observed_at":"2026-08-06T18:39:28.956722Z","title":"Mosca: Dynamic gaussian fusion from casual videos via 4d motion scaffolds.arXiv preprint arXiv:2405.17421, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:28.956722Z"},"links":{"cited_paper":"/paper/2405.17421","citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:c37ab6a919eb0312937aee8f82c3e530069d85a4272138d1156755825d73ee13","observation_id":"573b54e6-2e2a-43be-b343-6e1b6f32cf32","resolution":{"observed_at":"2026-08-06T18:39:28.956722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.04847","last_updated":"2023-05-10T05:31:59Z","snapshot_observed_at":"2026-08-03T20:31:56.133732Z","submitted_at":"2022-10-10T17:03:23Z","title":"NerfAcc: A General NeRF Acceleration Toolbox","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.04847","snapshot_observed_at":"2026-08-06T18:39:29.042224Z","title":"Nerfacc: A general nerf acceleration toolbox.arXiv preprint arXiv:2210.04847, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:29.042224Z"},"links":{"cited_paper":"/paper/2210.04847","citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:422d2c91907d66d6341b93312bda4d80b02e45e9bca379c53d5bb1a9a482b982","observation_id":"5a9eb8fe-c915-44b6-99c6-0cf89181d094","resolution":{"observed_at":"2026-08-06T18:39:29.042224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:29.111731Z","title":"Spacetime gaussian feature splatting for real-time dynamic view synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:29.111731Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:819c641284e877ed353e6fd64aaf0db72fc3c722fdfc0945b890109485c360cc","observation_id":"58e8a04a-9c18-4b99-bf68-209b9d030735","resolution":{"observed_at":"2026-08-06T18:39:29.111731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:29.174331Z","title":"Neural scene flow fields for space-time view synthesis of dynamic scenes","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:29.174331Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:a7d473a11671099afe72e88302adb4b43032184ba84b5978bb7d7933bbe92190","observation_id":"0f407144-8978-430f-99e2-7af2060853b1","resolution":{"observed_at":"2026-08-06T18:39:29.174331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:29.237316Z","title":"Dynibar: Neural dynamic image-based rendering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:29.237316Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:1552ffdb754aaba94c5cdfa64e3ab04e5e74ccfdb42529afa3b0436fdb0c3717","observation_id":"da13ffca-f908-4bb7-805c-07c98691cfb8","resolution":{"observed_at":"2026-08-06T18:39:29.237316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12091","last_updated":"2025-04-26T13:48:44Z","snapshot_observed_at":"2026-07-06T20:07:58.873037Z","submitted_at":"2024-12-16T18:58:17Z","title":"Wonderland: Navigating 3D Scenes from a Single Image","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12091","snapshot_observed_at":"2026-08-06T18:39:29.317516Z","title":"Wonderland: Navigating 3d scenes from a single image.arXiv preprint arXiv:2412.12091, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:29.317516Z"},"links":{"cited_paper":"/paper/2412.12091","citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:9e217a523648df537389d38bd6b8da9343994e50a07419a2a6503fe08700f95f","observation_id":"54c225c0-d606-4085-8c50-408b800a7ada","resolution":{"observed_at":"2026-08-06T18:39:29.317516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:29.378999Z","title":"Analytic-splatting: Anti-aliased 3d gaussian splatting via analytic integration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:29.378999Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:6ee6bc33639932f2dad3c6f76e30a7460dc8aa977321313ba8ffb309718779f0","observation_id":"53003682-e36b-4b5f-b7b3-d4371a895f8c","resolution":{"observed_at":"2026-08-06T18:39:29.378999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00131","last_updated":"2024-11-28T14:07:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-28T14:07:45Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00131","snapshot_observed_at":"2026-08-06T18:39:29.458323Z","title":"Open-sora plan: Open-source large video generation model.arXiv preprint arXiv:2412.00131, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:29.458323Z"},"links":{"cited_paper":"/paper/2412.00131","citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:de75775ab177712dbd10512f736dccde9e80014994bbb7de4aafb3952fccb8e5","observation_id":"76d42315-5f7e-4a08-8361-bb61bc3572d4","resolution":{"observed_at":"2026-08-06T18:39:29.458323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:29.557805Z","title":"Barf: Bundle-adjusting neural radiance fields","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:29.557805Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:7b20aa811068aadadf23d92fe7c848c59844628397801f354da9f71b05bbe21b","observation_id":"1e61ebbd-26fe-43ac-bfc5-0d7335376999","resolution":{"observed_at":"2026-08-06T18:39:29.557805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:29.636927Z","title":"Dl3dv-10k: A large-scale scene dataset for deep learning-based 3d vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:29.636927Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:5ca2f04f6865d57c4f16c920a42fd8a251b8186a950e5192c3b346e736862808","observation_id":"81e622cb-5d58-4905-a9af-07bb2ec38caf","resolution":{"observed_at":"2026-08-06T18:39:29.636927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:29.722061Z","title":"Rip-nerf: Anti-aliasing radiance fields with ripmap-encoded platonic solids","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:29.722061Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:6c8eccf334e3373159a5aa6159b7a6462e555517bc63b3392d0b23be4a054bdb","observation_id":"9e4e74a2-3e56-420b-b332-2567a524535a","resolution":{"observed_at":"2026-08-06T18:39:29.722061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:29.816185Z","title":"Zero-1-to-3: Zero-shot one image to 3d object","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:29.816185Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:9a0ba4a22ae2bb37a963a0483a0b3ebfb057c5b6b911a26d70c922196c994dd4","observation_id":"637e9292-1f90-4598-aa7c-4bf05c4f7eed","resolution":{"observed_at":"2026-08-06T18:39:29.816185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20785","last_updated":"2025-03-26T17:59:44Z","snapshot_observed_at":"2026-08-04T13:06:50.999690Z","submitted_at":"2025-03-26T17:59:44Z","title":"Free4D: Tuning-free 4D Scene Generation with Spatial-Temporal Consistency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20785","snapshot_observed_at":"2026-08-06T18:39:29.925434Z","title":"Free4d: Tuning-free 4d scene generation with spatial-temporal consistency.arXiv preprint arXiv:2503.20785, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:29.925434Z"},"links":{"cited_paper":"/paper/2503.20785","citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:83462b74419abeec8fdbc285be7993f4d0e0f67f0a501fb3a6d0938c1c2634c6","observation_id":"a8d59a42-a799-4d22-92f7-b7d5b78e6c1c","resolution":{"observed_at":"2026-08-06T18:39:29.925434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:30.003579Z","title":"See4d: Pose-free 4d generation via auto-regressive video inpainting.arXiv preprint arXiv:2510.26796, 2025","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:30.003579Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:062055680186b28a7f30f3173e92760992bd44268d11685d6077969ba2857dd2","observation_id":"78cdc685-08e7-4f49-a465-f0cf0d440e35","resolution":{"observed_at":"2026-08-06T18:39:30.003579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:30.094528Z","title":"You see it, you got it: Learning 3d creation on pose-free videos at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:30.094528Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:1e8cc1b168d045b6ec71fd4d0e49f432053a0f8abed2b4192c3d5af0bf82665e","observation_id":"bbef90e0-4b4d-4de1-b902-fc6c16a76d2e","resolution":{"observed_at":"2026-08-06T18:39:30.094528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18633","last_updated":"2025-08-26T03:18:31Z","snapshot_observed_at":"2026-08-05T16:23:35.382635Z","submitted_at":"2025-08-26T03:18:31Z","title":"ROSE: Remove Objects with Side Effects in Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18633","snapshot_observed_at":"2026-08-06T18:39:30.164403Z","title":"Rose: Remove objects with side effects in videos.arXiv preprint arXiv:2508.18633, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:30.164403Z"},"links":{"cited_paper":"/paper/2508.18633","citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:a9e647548d72acc518a7dbabf0b340ab3383cb4dcc30c1eb47ba8a1abbba3d2e","observation_id":"8c614ffc-41a7-401a-8fa4-e5a0cf4c670b","resolution":{"observed_at":"2026-08-06T18:39:30.164403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:30.234553Z","title":"Nerf: Representing scenes as neural radiance fields for view synthesis","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:30.234553Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:2c4e437c2a860a3d771f02d007e7f74fb3ce0a8b4f0234c461dddb7f06a6c1f3","observation_id":"5615a911-6bbd-495b-8cb6-1355093eec02","resolution":{"observed_at":"2026-08-06T18:39:30.234553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:30.311305Z","title":"Multidiff: Consistent novel view synthesis from a single image","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:30.311305Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:5a820bae13f751db6f762013be0cd9afd1c186fdb980ea85c6b58b76413948c8","observation_id":"607840ad-6bc8-4ecb-9ed2-15cbba771280","resolution":{"observed_at":"2026-08-06T18:39:30.311305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:30.355482Z","title":"Instant neural graphics primitives with a multiresolution hash encoding.ACM Transactions on Graphics (ToG), 41(4):1–15, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:30.355482Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:ebf3f9b569a000c67206c8981ee35171c7d1129f943322a9e67480355c60aae9","observation_id":"38a5225e-3015-436a-a1df-0f87dd53f666","resolution":{"observed_at":"2026-08-06T18:39:30.355482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02371","last_updated":"2025-02-13T10:13:24Z","snapshot_observed_at":"2026-08-07T10:03:56.902190Z","submitted_at":"2024-07-02T15:40:29Z","title":"OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02371","snapshot_observed_at":"2026-08-06T18:39:30.410302Z","title":"Openvid-1m: A large-scale high-quality dataset for text-to-video generation.arXiv preprint arXiv:2407.02371, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:30.410302Z"},"links":{"cited_paper":"/paper/2407.02371","citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:4ec9955afe07f724a61192e1aa0694af7f63b065d253be641c561768dfc6d38c","observation_id":"42a0f179-6c15-4652-8d0a-7daaf41cea4a","resolution":{"observed_at":"2026-08-06T18:39:30.410302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:40.144429Z","title":"Carvekit: Image background remove tool","venue":null,"work_id":"7e6bd04c-59a2-4c8f-a3e2-0c3d401b0cb4","year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:30.480062Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:f1fdfab954d46381a919fee4ccd9df886a9c50df745d2418bddf9b794737ad41","observation_id":"e14ab24b-6e45-41ba-9598-040a6e20fe55","resolution":{"observed_at":"2026-08-06T18:39:40.207550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:39.985958Z","title":"Bridging implicit and explicit geometric transformation for single-image view synthesis.IEEE TPAMI, 2024","venue":null,"work_id":"1a6cbed2-b3ce-434c-bc6e-6b1021816c8a","year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:30.562642Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:ec0e1747738f7cbed14d133605928e646efbca9a92eaa31c7a80e3d5f65638d4","observation_id":"ea532d81-ceda-409d-a327-0015772a5721","resolution":{"observed_at":"2026-08-06T18:39:40.062476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:39.846120Z","title":"Barron, Sofien Bouaziz, Dan B Goldman, Steven M","venue":null,"work_id":"f1c58457-0709-40d5-8745-aaf2996d31c8","year":2021},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:30.640281Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:5bdb787a351b1bd8c28044dc07524d4e431d8ea346bd17d3d70c65ef46a0f659","observation_id":"7e7457d6-64d8-4bb6-a1db-f4fad87223ad","resolution":{"observed_at":"2026-08-06T18:39:39.911562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:30.721102Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:30.721102Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:92a493a7d510366737f7ab71b3b92aaabb677dbcae8c8182b541de66cd78f00e","observation_id":"8442c808-db44-4d7e-b770-dd0fec475cb8","resolution":{"observed_at":"2026-08-06T18:39:30.721102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:39.715710Z","title":"D-nerf: Neural radiance fields for dynamic scenes","venue":null,"work_id":"a31d376b-263e-4911-aac8-d953cbd5fe01","year":2021},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:30.785657Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:166eff0be6b4621ea1eac432fd342deaf231da52f8abe14eaaf7b2bb3eddb3bd","observation_id":"feb2ec6d-3315-4216-a0ea-def88a583fb0","resolution":{"observed_at":"2026-08-06T18:39:39.781278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-06T18:39:30.868075Z","title":"Sam 2: Segment anything in images and videos.arXiv preprint arXiv:2408.00714, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:30.868075Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:657ce865e8a1e405a665519bbe286613de94dade921de613201d86a88674c5fa","observation_id":"c4f282a9-0b37-4334-91c8-b31142020280","resolution":{"observed_at":"2026-08-06T18:39:30.868075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:39.586642Z","title":"Common objects in 3d: Large-scale learning and evaluation of real-life 3d category reconstruction","venue":null,"work_id":"86f7c327-66b4-44c2-9235-b164594e19ba","year":2021},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:30.950795Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:38ed5169c5f0431ce8e2c3e4cc63d31c2e46075d0326b74a1983911369f9d6cb","observation_id":"bbeac3e7-74c6-4c29-a40a-ddf5e8c531c9","resolution":{"observed_at":"2026-08-06T18:39:39.648751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:39.431499Z","title":"Gen3c: 3d-informed world-consistent video generation with precise camera control","venue":null,"work_id":"50130bf2-5ab4-491b-adde-a4a25579da88","year":2025},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:31.048960Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:cbe3191a0042f940f580a3300d372e00bb26a99d9dafe84fb32e7d2f432d57f0","observation_id":"4a35d1f9-6542-4280-a6c0-8bfcbb170e11","resolution":{"observed_at":"2026-08-06T18:39:39.511183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:39.318448Z","title":"Pixelsynth: Generating a 3d-consistent experience from a single image","venue":null,"work_id":"de11a620-a00d-4a23-bbbf-3c891b4d340a","year":2021},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:31.164464Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:cdca4ab21e05f45d9cc1e6a46b349aaaf5f0625b62fa55e9c57abe8ce48344e6","observation_id":"42486f41-3f6a-4b39-ae85-6015230db3ce","resolution":{"observed_at":"2026-08-06T18:39:39.371500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:39.209326Z","title":"Geometry-free view synthesis: Transformers and no 3d priors","venue":null,"work_id":"061310d3-2196-409d-a80c-6778251b3fbd","year":2021},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:31.271266Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:4068bad34820a65e4e3401e1995c5a9f6bc5de514b9eae2fdff1af088b7437c9","observation_id":"ca39ca71-b0f8-44cb-926b-73c4aac9dace","resolution":{"observed_at":"2026-08-06T18:39:39.251737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:31.396493Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:31.396493Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:8b640127d6cbb57fefef63fb3221a2bc43f0699a9ca02da5fafca64d241a9d3e","observation_id":"ac180335-7e63-4534-ba1c-b1edb707dbe2","resolution":{"observed_at":"2026-08-06T18:39:31.396493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:39.089337Z","title":"ZeroNVS: Zero-shot 360-degree view synthesis from a single real image","venue":null,"work_id":"b6eb9679-3a64-4c46-a5e0-1d9f1df866d0","year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:31.444560Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:47022e9fa29a52feaa7a8efbbf9d54d569a728b0378ccaca585d8c79b1c7fc0e","observation_id":"94518c4c-15d8-40fa-b881-88ea086f478c","resolution":{"observed_at":"2026-08-06T18:39:39.148856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:38.977314Z","title":"Assembly101: A large-scale multi-view video dataset for understanding procedural activities","venue":null,"work_id":"79b9a4d9-a7ce-4e31-b43e-a910ed24fb71","year":2022},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:31.511295Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:d440a540fe8c6d69fd998171953853ff04b5593e5591399a5a4fb87174d617e0","observation_id":"2433159d-a042-4701-8bae-10f9be7b9c14","resolution":{"observed_at":"2026-08-06T18:39:39.020544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07199","last_updated":"2025-03-11T17:06:18Z","snapshot_observed_at":"2026-08-07T04:05:31.893617Z","submitted_at":"2024-04-10T17:57:41Z","title":"RealmDreamer: Text-Driven 3D Scene Generation with Inpainting and Depth Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07199","snapshot_observed_at":"2026-08-06T18:39:31.563419Z","title":"Realmdreamer: Text-driven 3d scene generation with inpainting and depth diffusion.arXiv preprint arXiv:2404.07199, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:31.563419Z"},"links":{"cited_paper":"/paper/2404.07199","citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:d7a1b3881f1d7cc73100d1a3239681e0a79631ff6f0ffa085e352e48837fdc24","observation_id":"9cb29a50-6b55-4c01-a23b-8676093c2838","resolution":{"observed_at":"2026-08-06T18:39:31.563419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:31.646693Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:31.646693Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:884c3f986bdff57417df667edc1470827099beeaaa518eea5597e48bb15c0281","observation_id":"8f6d3d5f-2128-4f2a-8477-5e23fe345789","resolution":{"observed_at":"2026-08-06T18:39:31.646693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:38.819577Z","title":"Nerfplayer: A streamable dynamic scene representation with decomposed neural radiance fields.IEEE TVCG, 2023","venue":null,"work_id":"818970fd-9566-452e-bbfc-9727f78e2550","year":2023},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:31.711019Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:824e5d7054b8a8615a805a36777d71ba200b0323726c40493d7effb8efb730c5","observation_id":"20382936-777c-4be5-8b5f-b43c0f843c52","resolution":{"observed_at":"2026-08-06T18:39:38.877071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:38.662584Z","title":"Dynamic gaussian marbles for novel view synthesis of casual monocular videos","venue":null,"work_id":"ee08e7c2-f4ef-4941-bc76-b3804ee1f3f4","year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:31.793781Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:a814a2e26b99f07051c81bcd1bd907baa5f2a09ba157ad9b2d46d92a521a79f3","observation_id":"0a13f126-ef5b-4111-910d-fa6ef9ae3870","resolution":{"observed_at":"2026-08-06T18:39:38.725859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04928","last_updated":"2024-11-07T18:07:31Z","snapshot_observed_at":"2026-08-06T07:44:13.960536Z","submitted_at":"2024-11-07T18:07:31Z","title":"DimensionX: Create Any 3D and 4D Scenes from a Single Image with Controllable Video Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04928","snapshot_observed_at":"2026-08-06T18:39:31.932292Z","title":"Dimensionx: Create any 3d and 4d scenes from a single image with controllable video diffusion.arXiv preprint arXiv:2411.04928, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:31.932292Z"},"links":{"cited_paper":"/paper/2411.04928","citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:1ee8019a93d50e5e7506bd8185dd28d50b53096906a5e0885f41c953c6769f96","observation_id":"6da1b104-eadc-4a4e-b66f-74ad57cc3554","resolution":{"observed_at":"2026-08-06T18:39:31.932292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:38.505739Z","title":"Non-rigid neural radiance fields: Reconstruction and novel view synthesis of a dynamic scene from monocular video","venue":null,"work_id":"acf7bea4-a060-44c8-a81c-43674155077e","year":2021},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:32.033471Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:7062b7b8fd6e70a7992013267c23a509e626912a418138bd5e445878e8cefda2","observation_id":"d4bf4861-3905-45e3-80fe-254b180a0a7f","resolution":{"observed_at":"2026-08-06T18:39:38.573027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:38.383592Z","title":"Megascenes: Scene-level view synthesis at scale","venue":null,"work_id":"b682f2ca-e109-4c28-8c35-0f012cd539ee","year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:32.143686Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:ef24b056dd79647e391a6f94e3f4cee0cfc80581daa4dbe46b6876785182e6ba","observation_id":"9c78607c-fb80-4bde-a3a7-9b8502b783aa","resolution":{"observed_at":"2026-08-06T18:39:38.444883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:32.254366Z","title":"Generative camera dolly: Extreme monocular dynamic novel view synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:32.254366Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:11efc33e943d4bff883230029aa8b82d994aba14bc73d4a1515a30ca0e9429f5","observation_id":"878e1383-d026-4cfc-899b-e75395707de4","resolution":{"observed_at":"2026-08-06T18:39:32.254366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:38.231306Z","title":"Ref-nerf: Structured view-dependent appearance for neural radiance fields","venue":null,"work_id":"744b054c-4386-4c01-ade5-0bc1f49571a2","year":2022},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:32.326764Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:0ae5383360f2321376cc1f1586cbac138d5360dee7b861f837f6375eca6323ac","observation_id":"310624c9-b6e8-45c4-b2b1-1c4bca5447c4","resolution":{"observed_at":"2026-08-06T18:39:38.297448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-06T18:39:32.420823Z","title":"Wan: Open and advanced large-scale video generative models.arXiv preprint arXiv:2503.20314, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:32.420823Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:6efe011eb3a54d6074eb21df99cf034d54fc314a92b147491ecf9292886bf1ed","observation_id":"25c811b3-865c-470a-929b-1b7a5e1b8344","resolution":{"observed_at":"2026-08-06T18:39:32.420823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:38.099551Z","title":"Vistadream: Sampling multiview consistent images for single-view scene reconstruction","venue":null,"work_id":"dd223281-e317-4621-aa23-8f29233584f9","year":2025},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:32.518945Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:0cab331537760c978a3697dd4f5d8a9582d791d3fde7f9819a92e90ef9349d62","observation_id":"54a68a29-d1f5-4842-b201-de036712bbdf","resolution":{"observed_at":"2026-08-06T18:39:38.160737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:37.959823Z","title":"Videoscene: Distilling video diffusion model to generate 3d scenes in one step","venue":null,"work_id":"4ba613a5-9569-4122-bdae-0420e30f1859","year":2025},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:32.620533Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:79c73a74710d4df14f07e33e773faf5192f8b7afb346064e4f7bd2f23f88cc74","observation_id":"ec1af565-83d8-4062-bd30-3ca606e98cfc","resolution":{"observed_at":"2026-08-06T18:39:38.016938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:32.703246Z","title":"Vggt: Visual geometry grounded transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:32.703246Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:e9c37756b1369b652770c5f10aa06785971aa5afc3a68ba734c7cf554752fae2","observation_id":"ed6e699c-8b3d-40dc-8273-e4cb7455d116","resolution":{"observed_at":"2026-08-06T18:39:32.703246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:32.758157Z","title":"Shape of motion: 4d reconstruction from a single video.arXiv preprint arXiv:2407.13764, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:32.758157Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:3cb085751c78b38aa7f9e429777a90db613d9c8607139a04af83c79ca088e4ca","observation_id":"002ffc1e-7d16-4376-aba4-55eed83c317a","resolution":{"observed_at":"2026-08-06T18:39:32.758157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:37.819701Z","title":"Moge: Unlocking accurate monocular geometry estimation for open-domain images with optimal training supervision","venue":null,"work_id":"a5ae15b6-532a-4137-ac82-e84c58075b17","year":2025},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:32.837122Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:b5681589aac0711531beac84d45f473b40e709b57eb63407a96b07d3158d7746","observation_id":"2cfec30c-8885-4f1e-9795-80022a519882","resolution":{"observed_at":"2026-08-06T18:39:37.873305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:32.893325Z","title":"Dust3r: Geometric 3d vision made easy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:32.893325Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:aa3aeebee946c74031c2b9bb2fcf457d482ebffa8fcebd4814ba7279975e60b2","observation_id":"8fb4c8fc-23f7-4444-bd5c-0a6e6d8664a0","resolution":{"observed_at":"2026-08-06T18:39:32.893325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:37.686243Z","title":"Motionctrl: A unified and flexible motion controller for video generation","venue":null,"work_id":"8968cc00-95f8-45da-9bbe-2fbff1cd858c","year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:32.953301Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:7e7ffee90cad8e71f4987999bceef80b061055be2ec4c5db0fcc98313e9805d9","observation_id":"c59d133f-8754-4a71-ba87-ccecfaafd207","resolution":{"observed_at":"2026-08-06T18:39:37.752001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:37.576788Z","title":"Synsin: End-to-end view synthesis from a single image","venue":null,"work_id":"5278ea03-d917-4970-bb57-6d6d77cc592a","year":2020},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:33.003635Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:775247dd648a59c9590ec6656310fe584ef250e224565a0ac56020a7c1ab02c7","observation_id":"81eb40c6-fe82-4380-a418-25c825292155","resolution":{"observed_at":"2026-08-06T18:39:37.631562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:37.444153Z","title":"4d gaussian splatting for real-time dynamic scene rendering","venue":null,"work_id":"5c9d4927-0cd4-4f3d-a52f-2fb3bfc670be","year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:33.050247Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:7117902d55cd2203b4bc31ad33d2e143b442029c99d5b83a7b7b2e110a0ed60b","observation_id":"388544a4-58ca-4e63-920c-2740ca78c2c9","resolution":{"observed_at":"2026-08-06T18:39:37.518304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18613","last_updated":"2024-12-18T21:21:07Z","snapshot_observed_at":"2026-07-06T19:58:09.591787Z","submitted_at":"2024-11-27T18:57:16Z","title":"CAT4D: Create Anything in 4D with Multi-View Video Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18613","snapshot_observed_at":"2026-08-06T18:39:33.106709Z","title":"Cat4d: Create anything in 4d with multi-view video diffusion models.arXiv preprint arXiv:2411.18613, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:33.106709Z"},"links":{"cited_paper":"/paper/2411.18613","citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:9b56808124c9608bb4525f529f604aad2eec6f20b4ace56ade84629a81f095e7","observation_id":"299962af-bbae-44b6-9d78-830c227f65fa","resolution":{"observed_at":"2026-08-06T18:39:33.106709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:37.337404Z","title":"Reconfusion: 3d reconstruction with diffusion priors","venue":null,"work_id":"ee34808c-d872-4795-8376-dd396fc02787","year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:33.163955Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:93b4c3715c9ee46b2d55dbca66920ad6062f5be0d76a40b27ce78a8e58759532","observation_id":"4aed8aae-d666-438a-bad9-9a7d4618e0f3","resolution":{"observed_at":"2026-08-06T18:39:37.386498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:37.216997Z","title":"Trajectory attention for fine-grained video motion control","venue":null,"work_id":"3511251b-916d-4067-abda-1331eb72a028","year":2025},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:33.206882Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:f33a0b75fed5927311e1a4da04431f6dc6e3b0ec60ecf987b66734475a292e55","observation_id":"712d0dc5-e496-44f1-8268-7226da6a36a3","resolution":{"observed_at":"2026-08-06T18:39:37.266916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12190","last_updated":"2023-11-27T13:36:04Z","snapshot_observed_at":"2026-07-06T16:35:15.777674Z","submitted_at":"2023-10-18T14:42:16Z","title":"DynamiCrafter: Animating Open-domain Images with Video Diffusion Priors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12190","snapshot_observed_at":"2026-08-06T18:39:33.283876Z","title":"Dynamicrafter: Animating open-domain images with video diffusion priors.arXiv preprint arXiv:2310.12190, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:33.283876Z"},"links":{"cited_paper":"/paper/2310.12190","citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:0653cbf60fa2594f69dcb0cb13b590198f32bf5f09820b199f9d9b9499df1212","observation_id":"ab944705-912c-41cb-a689-3907f113dd6c","resolution":{"observed_at":"2026-08-06T18:39:33.283876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02509","last_updated":"2024-06-04T17:27:19Z","snapshot_observed_at":"2026-08-04T13:02:12.217544Z","submitted_at":"2024-06-04T17:27:19Z","title":"CamCo: Camera-Controllable 3D-Consistent Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02509","snapshot_observed_at":"2026-08-06T18:39:33.351341Z","title":"Camco: Camera-controllable 3d-consistent image-to-video generation.arXiv preprint arXiv:2406.02509, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:33.351341Z"},"links":{"cited_paper":"/paper/2406.02509","citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:07b644464e204b1df030a94aa69826975fb179936d3c1cb8eb8702d3e62fac4c","observation_id":"67b4f520-4868-4ab3-9192-88f64021211e","resolution":{"observed_at":"2026-08-06T18:39:33.351341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:33.405744Z","title":"4dgt: Learning a 4d gaussian transformer using real-world monocular videos.arXiv preprint arXiv:2506.08015, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:33.405744Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:84d625ed8d0587086868012324a21fc9f082743a761423d6a0dadbe17813ab3c","observation_id":"e01e58e9-c511-467f-aeae-196e39679f86","resolution":{"observed_at":"2026-08-06T18:39:33.405744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09414","last_updated":"2024-10-20T11:24:09Z","snapshot_observed_at":"2026-07-06T18:30:32.982860Z","submitted_at":"2024-06-13T17:59:56Z","title":"Depth Anything V2","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09414","snapshot_observed_at":"2026-08-06T18:39:33.462649Z","title":"Depth anything v2.arXiv:2406.09414, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:33.462649Z"},"links":{"cited_paper":"/paper/2406.09414","citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:01fcaad04434a46f07461acb4783ffdf901e1a74e9b7b795e1b2b15195fea228","observation_id":"186a31ad-6fa6-41e0-ab33-aced6f7c7dbc","resolution":{"observed_at":"2026-08-06T18:39:33.462649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:37.073065Z","title":"Real-time photorealistic dynamic scene representation and rendering with 4d gaussian splatting","venue":null,"work_id":"c32d2069-fbe7-4bbb-8794-f77f9d2a0b73","year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:33.523972Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:1515cf47473379fe23f27cbde1baf07bf18483427ecaf4156690d8471878e233","observation_id":"c90e8d97-0adc-4b54-8dd1-c1e308933ae4","resolution":{"observed_at":"2026-08-06T18:39:37.144279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T11:50:55.793797Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":76,"verified_exact":0,"verified_fuzzy":24},"total_outbound_references":123},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 100 of 123 outbound references and 0 inbound Pith citation observations for arXiv:2608.04701."}