{"as_of":"2026-08-09T09:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:06e9bafd72808917ec355356eda6038d7db53030b36aae852f6a4b0818937c38","coverage":[{"denominator":95,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":95,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:50:23.911081Z","state":"measured"},{"denominator":98,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":98,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T06:54:11.233650Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T14:48:32.946157Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"cited_work":{"arxiv_id":"2506.18839","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18839","snapshot_observed_at":"2026-07-03T14:48:32.946157Z","title":"4real-video-v2: Fused view-time attention and feedforward reconstruction for 4d scene generation","venue":null,"work_id":"c4544c7c-65a4-4903-8de5-00491cb76f60","year":2025},"citing_paper":{"arxiv_id":"2603.26481","last_updated":"2026-04-07T06:59:09Z","snapshot_observed_at":"2026-07-06T22:50:46.243903Z","submitted_at":"2026-03-27T14:44:52Z","title":"SparseCam4D: Spatio-Temporally Consistent 4D Reconstruction from Sparse Cameras","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-14T23:41:24.423859Z"},"links":{"cited_paper":"/paper/2506.18839","citing_paper":"/paper/2603.26481"},"observation_digest":"sha256:e9857bb19d51f7ee1fcabda253f4a0c1416b6aadc33108678fffeb17bd911058","observation_id":"2988db5a-305d-4c5b-b4af-93b4c7720bee","resolution":{"observed_at":"2026-05-14T23:43:18.002631Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"cited_work":{"arxiv_id":"2506.18839","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18839","snapshot_observed_at":"2026-07-03T14:48:32.946157Z","title":"4real-video-v2: Fused view-time attention and feedforward reconstruction for 4d scene generation","venue":null,"work_id":"c4544c7c-65a4-4903-8de5-00491cb76f60","year":2025},"citing_paper":{"arxiv_id":"2604.14025","last_updated":"2026-04-15T16:07:18Z","snapshot_observed_at":"2026-07-06T23:01:55.698452Z","submitted_at":"2026-04-15T16:07:18Z","title":"Feed-Forward 3D Scene Modeling: A Problem-Driven Perspective","version":1},"reference_index":193,"source":"pdf_text","source_observed_at":"2026-05-10T13:13:42.052386Z"},"links":{"cited_paper":"/paper/2506.18839","citing_paper":"/paper/2604.14025"},"observation_digest":"sha256:2cc87e423a3954ed2596fc492fbbbba9bf2345b43eb3217816145c73a1fadfb0","observation_id":"3d140238-b633-4b88-8df6-c85b0968aa18","resolution":{"observed_at":"2026-05-10T13:20:26.111329Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"cited_work":{"arxiv_id":"2506.18839","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18839","snapshot_observed_at":"2026-07-03T14:48:32.946157Z","title":"4real-video-v2: Fused view-time attention and feedforward reconstruction for 4d scene generation","venue":null,"work_id":"c4544c7c-65a4-4903-8de5-00491cb76f60","year":2025},"citing_paper":{"arxiv_id":"2606.13655","last_updated":"2026-06-11T17:54:05Z","snapshot_observed_at":"2026-08-01T16:23:27.797500Z","submitted_at":"2026-06-11T17:54:05Z","title":"Flex4DHuman: Flexible Multi-view Video Diffusion for 4D Human Reconstruction","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T06:54:11.233650Z"},"links":{"cited_paper":"/paper/2506.18839","citing_paper":"/paper/2606.13655"},"observation_digest":"sha256:7e9a8a3880a3b2d9317c7514195f366753965fabfb5dfac430093f42a1ca5437","observation_id":"f4926fba-b7ec-4a2d-a519-5dad5811ae2c","resolution":{"observed_at":"2026-07-03T14:48:32.947695Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.18839/citation-record","integrity":"/paper/2506.18839/integrity","json":"/paper/2506.18839/citation-record.json","paper":"/paper/2506.18839"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:23.570058Z","title":"Controlling space and time with diffusion models.ICLR, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.570058Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:cbfeb48504e61381aecf0738ab740d38cc587ee1c3a8a8b1aaf4746f7895f977","observation_id":"d83a5d1c-7035-4c75-98fb-5dbf7c4804e2","resolution":{"observed_at":"2026-08-06T23:50:23.570058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:23.574568Z","title":"Barron, and Aleksander Holynski","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.574568Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:dbe2d09051bf3594daaf24950bd7208e66c3501c2bdedd04663e60a065157b8d","observation_id":"ae9424f3-dd9c-4fe7-a767-2a0790e7b326","resolution":{"observed_at":"2026-08-06T23:50:23.574568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:23.579369Z","title":"Genxd: Generating any 3d and 4d scenes.ICLR, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.579369Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:76027f2875f50ca1afb94ed83298341becd113864e8109de28179afccf8e9341","observation_id":"96b5f06b-b1a8-4375-8783-e3eb3d5f9232","resolution":{"observed_at":"2026-08-06T23:50:23.579369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:23.582571Z","title":"Dimensionx: Create any 3d and 4d scenes from a single image with controllable video diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.582571Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:e7b5fbc120c5c91aae87368edcf9847b7a26cffbdc717f879b72eeb5181106ad","observation_id":"39d6a984-e7fe-4b97-aca5-b04bfa74189c","resolution":{"observed_at":"2026-08-06T23:50:23.582571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:23.586936Z","title":"Gen3c: 3d-informed world- consistent video generation with precise camera control","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.586936Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:ea8e3642ad8c26da2706ba9676e0273d207c35b01a94641406fd588d8c923a3f","observation_id":"1035cd84-dff6-4d65-985f-ea81a3c8ec38","resolution":{"observed_at":"2026-08-06T23:50:23.586936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:23.591047Z","title":"Trajectorycrafter: Redirecting camera trajectory for monocular videos via diffusion models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.591047Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:4bd8b3a9a9fd8ba359049b2a1c892812fa21365bdd3cd6aef2cfe4ff529d410a","observation_id":"7d883fac-9313-4588-ae5c-c8928f351cbc","resolution":{"observed_at":"2026-08-06T23:50:23.591047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:23.594988Z","title":"Generative camera dolly: Extreme monocular dynamic novel view synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.594988Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:db168fba83dfaf0068850f09473b9859757a9a8b6cfce7e67c48c45079845e72","observation_id":"48fa30c4-61f5-4f87-b06f-8cbd9a59056f","resolution":{"observed_at":"2026-08-06T23:50:23.594988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:23.598368Z","title":"Recammaster: Camera-controlled generative rendering from a single video, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.598368Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:e660b0bab96b51bf281137d11d98e806046d7a4c2fab57810c6787f66ecde7d8","observation_id":"0520b25a-677a-4c3a-8eb2-95b3b04b1eba","resolution":{"observed_at":"2026-08-06T23:50:23.598368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:23.602196Z","title":"Wetzstein","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.602196Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:6b99e5611cf0e8761f1ae6c3dd5aa4c4f1835fe782c1b2987472217068bf68b9","observation_id":"8f23826f-04f9-4281-8d06-d10d8fbdeaf1","resolution":{"observed_at":"2026-08-06T23:50:23.602196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:23.605505Z","title":"Human4dit: Free-view human video generation with 4d diffusion transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.605505Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:cc0fe8eefe586c9f01cdc0901327b8aca1c0b2cc695b52f1a066cb87c79dc577","observation_id":"9d95e326-df56-433c-be0b-66ea76ac393c","resolution":{"observed_at":"2026-08-06T23:50:23.605505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:23.609218Z","title":"Vivid-zoo: Multi-view video generation with diffusion model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.609218Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:78de95444d54231859cbb0ec1dd9d3b967d0094ae96c8520b3db9868429ee6bc","observation_id":"e5340efa-6d88-419b-a3e4-abe3a4dbb953","resolution":{"observed_at":"2026-08-06T23:50:23.609218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:23.612527Z","title":"4diffusion: Multi-view video diffusion model for 4d generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.612527Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:dac7c585b1ba0e25dd391b18039489aa6f0f781a514624792b1094304fde194b","observation_id":"853c4b84-080c-4854-ae55-3bbbbddf82c5","resolution":{"observed_at":"2026-08-06T23:50:23.612527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:23.615985Z","title":"Sv4d: Dynamic 3d content generation with multi-frame and multi-view consistency","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.615985Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:00eac128d1f526d73ebe8c0854c5de1646b2f0ec8e69989b0f1ee60d37a84c92","observation_id":"10c2b3cd-b206-447f-bc61-4188719b4e9b","resolution":{"observed_at":"2026-08-06T23:50:23.615985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:23.619364Z","title":"Syncammaster: Synchronizing multi-camera video generation from diverse viewpoints, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.619364Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:7bb8c14d6663a2eaceee5ce0770f00a6461be58ffc198a4c2cec1be3d14d500b","observation_id":"27eea4e4-1d4c-4762-b76d-2ab56a3513e6","resolution":{"observed_at":"2026-08-06T23:50:23.619364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:23.623512Z","title":"4real-video: Learning generalizable photo-realistic 4d video diffusion, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.623512Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:18590c97df4f04c23d77033aea5d823221e0d9724f560edb77eb51c85bfbf714","observation_id":"7f98586b-a49e-4e64-8c5e-18d674f52adc","resolution":{"observed_at":"2026-08-06T23:50:23.623512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:24.616581Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":"aa9fe84c-de6c-4182-9f59-059aee281a07","year":2024},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.627236Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:06216346d742c2fa02f36474977918ea6e3662c2156d520b8fbcb5ab7c9dc863","observation_id":"bcc02f03-ce18-4d57-97c3-6e1f2431e067","resolution":{"observed_at":"2026-08-06T23:50:24.620017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:24.605045Z","title":"Wan: Open and advanced large-scale video generative models","venue":null,"work_id":"8e62f796-145c-43d3-8a5a-e4112f1d4e3c","year":2025},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.630596Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:5d17e99c5ab44644352849d669763cb2ba8ad9522f7e714d1f9706a53383409e","observation_id":"45cb1825-5510-46db-8b66-2da8dd573f03","resolution":{"observed_at":"2026-08-06T23:50:24.609459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:24.596018Z","title":"Step-video-ti2v technical report: A state-of-the-art text-driven image-to-video generation model, 2025","venue":null,"work_id":"635ba98f-8983-4a81-932f-c04842244a3e","year":2025},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.634087Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:f4c6740aff70f4a433ea7f8276f1d8d82becaa18c042341c842c649de515edf8","observation_id":"7f01170e-046c-4bd0-931a-de3607e2ba3c","resolution":{"observed_at":"2026-08-06T23:50:24.599456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:24.586611Z","title":"Sampson, Shikai Li, Simone Parmeggiani, Steve Fine, Tara Fowler, Vladan Petrovic, and Yuming Du","venue":null,"work_id":"df2a6c1c-5f46-4c42-9caa-a54c7859e95a","year":2024},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.637656Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:7535ffede52fa2f6306733760b920c93a131e18b3960fc89887d8e72555a5d31","observation_id":"71d157dc-b285-4454-bbba-a5de3571d2ac","resolution":{"observed_at":"2026-08-06T23:50:24.590637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:24.577544Z","title":null,"venue":null,"work_id":"f19cfad0-144c-4256-9d65-b58187205f8b","year":2024},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.641024Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:bb025a6cc4bed8273e68ec8f769ae004b0b420f30d6ea0e3ef1c958fa87456a6","observation_id":"05b83f60-3b6e-4775-9db9-780101cc464c","resolution":{"observed_at":"2026-08-06T23:50:24.580460Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:24.568532Z","title":"Nerf: Representing scenes as neural radiance fields for view synthesis","venue":null,"work_id":"2f5b388c-a0fc-4f16-990a-a074edac7bc2","year":2021},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.644912Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:8cdb6a3cfb62e3f34277554e8acbd4dcee98f05e77f3fe9b58fe5e8a6aabd5b6","observation_id":"e62f7e6a-f2b6-4a6d-9817-aa9a3cd1c0fc","resolution":{"observed_at":"2026-08-06T23:50:24.572170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:24.558175Z","title":"3d gaussian splatting for real-time radiance field rendering.ToG, 2023","venue":null,"work_id":"2c70e56c-3323-4cbc-83b1-8c094a4ad08d","year":2023},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.648964Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:b8a8e88c97b8a131d7de45563969b5669a7503eef37c12fe10666d673101c513","observation_id":"4dee6952-4f20-45e5-a9c9-a798317ffa4a","resolution":{"observed_at":"2026-08-06T23:50:24.562267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:23.652933Z","title":"Vggt: Visual geometry grounded transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.652933Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:bba73db604dcbc5a982f6e13a25bd1590b0e6b9e2b326f5649d148ef9e72976a","observation_id":"1c29e439-43b1-4c70-b636-f1d5cc0ce6d1","resolution":{"observed_at":"2026-08-06T23:50:23.652933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:23.657140Z","title":"Dreamfusion: Text-to-3d using 2d diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.657140Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:6b62d2cc63a3757c7e09c301d26a19ff4ef4d6e1a6313eb0050ff9745a288bf4","observation_id":"cb049e13-3f70-4880-a03f-bcf89e9f1a5b","resolution":{"observed_at":"2026-08-06T23:50:23.657140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:23.661246Z","title":"Pro- lificdreamer: High-fidelity and diverse text-to-3d generation with variational score distillation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.661246Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:c35d75df40b01f52fe144cf46784402363567e7f92f6312ab55bb897fc6e338b","observation_id":"5cb3ad7d-2367-4fad-8a1d-c691c596b3ce","resolution":{"observed_at":"2026-08-06T23:50:23.661246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:23.665412Z","title":"Score jacobian chaining: Lifting pretrained 2d diffusion models for 3d generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.665412Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:f36fc401300ec34a9665c05e0d1ad0636721ff3f979613c79b0376701b3e1c38","observation_id":"938c6441-a563-4c68-9f31-abc77aa45f02","resolution":{"observed_at":"2026-08-06T23:50:23.665412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:23.669068Z","title":"Fantasia3d: Disentangling geometry and appearance for high-quality text-to-3d content creation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.669068Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:4cdfaa1dab52fa126434d4b03bc468d70698547441b0279076477948ba59cf6a","observation_id":"c1473008-793b-4693-bfaa-e70e428d37a0","resolution":{"observed_at":"2026-08-06T23:50:23.669068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:23.672950Z","title":"Magic3d: High-resolution text-to-3d content creation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.672950Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:e68c45664717dceab5bbf18f12754fe21fb7babece95ba69e8030237af1b3574","observation_id":"8783decc-7a9d-49c6-b26d-f6d16f3b8524","resolution":{"observed_at":"2026-08-06T23:50:23.672950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:24.519409Z","title":"Hifa: High-fidelity text-to-3d with advanced diffusion guidance","venue":null,"work_id":"a53111e3-129e-427c-b697-0d8a78099f55","year":2023},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.676972Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:45ae67bdde2d81c04d72a76efe9d0a18b80aa882c75c18bfe4310b74008e0d6d","observation_id":"40e0bad9-e968-4204-acf2-7bd07d9a100f","resolution":{"observed_at":"2026-08-06T23:50:24.522558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:23.681360Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.681360Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:4e14f6cd695eebac3eea66d904ed24e54ec117fedad25be56db2b9cfe181f148","observation_id":"a5e1badd-d05b-4a3d-bd67-a716b092bc83","resolution":{"observed_at":"2026-08-06T23:50:23.681360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:23.684804Z","title":"Photorealistic text-to-image diffusion models with deep language understanding.NeurIPS, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.684804Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:067f4a7421043944195166d7a37765aa157296eda48b22e25b35de7d08a71e0a","observation_id":"d91a71d9-94a8-4db4-96e8-fc012c271e90","resolution":{"observed_at":"2026-08-06T23:50:23.684804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:23.688142Z","title":"Zero-1-to-3: Zero-shot one image to 3d object","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.688142Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:9f762d02114478430561fe11ffd3ef7a71f2930931dd430c1fbf3c8d93571bbc","observation_id":"5a1cb132-5d9b-40da-8347-1ea55b9348f7","resolution":{"observed_at":"2026-08-06T23:50:23.688142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:24.495500Z","title":"Mvdream: Multi- view diffusion for 3d generation","venue":null,"work_id":"e1b613c9-efb9-4c91-8e35-36d2ef5f30f1","year":2024},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.691396Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:cd318c0bb6c37e01aacca23de331b85faebbc99c7b41907da9da170b6324200f","observation_id":"b2b945ad-7f0c-4395-9d8b-88996b2bf591","resolution":{"observed_at":"2026-08-06T23:50:24.499067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:24.486729Z","title":"4d-fy: Text-to-4d generation using hybrid score distillation sampling","venue":null,"work_id":"4c3b36cf-c28a-4fbf-a294-073a6cf6b55b","year":2024},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.694956Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:c19371a63173c7a34edcd515a05e6362e1c16f6dc5a387f1b9cf484f6fa46cd5","observation_id":"4f031122-fcea-43c3-ac72-a77dc54ae1e1","resolution":{"observed_at":"2026-08-06T23:50:24.490096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:24.476851Z","title":"Align your gaussians: Text-to-4d with dynamic 3d gaussians and composed diffusion models","venue":null,"work_id":"d48d48e3-da9a-41a3-8aa1-8d7a9292f0f0","year":2024},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.698796Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:6a5c13e798bb9846b1a10481aca72c5d66bb49ded7a06cc64c85d1a8517cc550","observation_id":"ca3b555c-09e9-4939-b7bf-5f7af8bc7b4d","resolution":{"observed_at":"2026-08-06T23:50:24.480993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:24.468060Z","title":"Consistent4d: Consistent 360 {\\deg}dynamic object generation from monocular video","venue":null,"work_id":"6fe4b6be-f62b-4812-a508-d4137b1a3a91","year":2023},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.703148Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:da16d4c7d9dc70ac5337d489889cd708e56e88247f8faa6938ac708c10181e4a","observation_id":"c015f36a-976b-473b-ab03-17f6bb246565","resolution":{"observed_at":"2026-08-06T23:50:24.471590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:24.459320Z","title":"Dreamgaussian4d: Generative 4d gaussian splatting","venue":null,"work_id":"65797cfe-cd68-4c63-902c-b79199cecd9d","year":2023},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.706973Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:5d737844cad0b21818103fb583266979bbb1b870a26230e6bd7add0f3a22c56e","observation_id":"b0ffa42d-cb11-4a4c-b529-75396b367e1d","resolution":{"observed_at":"2026-08-06T23:50:24.462541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:23.711037Z","title":"4dgen: Grounded 4d content generation with spatial-temporal consistency","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.711037Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:2e5fa92679879a9eb003b1a329fafc09081cab67ef471761e43d56d059f332e9","observation_id":"807c601c-3ec9-4e15-86d1-7ce2d53f424e","resolution":{"observed_at":"2026-08-06T23:50:23.711037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:24.444009Z","title":"Ani- mate124: Animating one image to 4d dynamic scene","venue":null,"work_id":"31ae7d56-bb18-4689-a6a8-3322c0e4ac84","year":2023},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.714639Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:4fb34300507316406d8e124770ef46f93d8be1d0369d87af66091f493aba7494","observation_id":"f580c5d4-d82d-4260-a7c2-20e592ae8f51","resolution":{"observed_at":"2026-08-06T23:50:24.448324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:24.433544Z","title":"Text-to-4d dynamic scene generation","venue":null,"work_id":"64e94869-35ee-4d93-bec9-ee45e0c52c15","year":2023},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.718436Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:a7e6b4574f364c34dbb5d5331a08409c18a78589083a90e274662aee5e6f5bf1","observation_id":"c72ccb59-d113-402d-8d20-c8b10e4dd2d7","resolution":{"observed_at":"2026-08-06T23:50:24.437607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:24.423876Z","title":"4real: Towards photorealistic 4d scene generation via video diffusion models","venue":null,"work_id":"e95fa7a4-6751-4279-bee8-d0c24d256843","year":2024},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.721479Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:856b09c5efd259c247e9e88badb12592e6de9d856c4b34d0fb820d1a8726aea8","observation_id":"ad48c7f8-51f0-4eb9-88d9-0f4373148984","resolution":{"observed_at":"2026-08-06T23:50:24.427298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:24.414606Z","title":"Animatediff: Animate your personalized text-to-image diffusion models without specific tuning","venue":null,"work_id":"9a26fa0c-caf6-4f78-9fbd-49f180e3c1da","year":2023},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.725224Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:1c384693977a119098301ef7103e9f76ddaaba35d7b2862a9dfe529ac55b74cb","observation_id":"844cb7b2-df56-4310-bfc6-97d3e4fc143a","resolution":{"observed_at":"2026-08-06T23:50:24.418408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:24.405570Z","title":"Imagen video: High definition video generation with diffusion models","venue":null,"work_id":"c0f1eb8c-11f0-43d6-9812-37e29bdadd81","year":2022},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.728387Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:1bc6c89a63794a36b368b018022d04bd4c3df295e6af59630cb9d09efc2766ec","observation_id":"2d5b7943-81f4-4b80-afd2-5297ce19e875","resolution":{"observed_at":"2026-08-06T23:50:24.409426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:24.396718Z","title":"Videocrafter1: Open diffusion models for high-quality video generation","venue":null,"work_id":"a3bd0fee-3ed1-4622-8023-313370a65b5a","year":2023},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.732250Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:02d28ff5025f823a09d6856590fe7c88057be325021c96198089848ef6e65708","observation_id":"8e41b232-7088-4e89-946a-caa024cdcf53","resolution":{"observed_at":"2026-08-06T23:50:24.400272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:23.735576Z","title":"Objaverse: A universe of annotated 3d objects","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.735576Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:285e0ab45d9125f9b3bf5293434c852a0f82084f9de57297f40adfc4f6f15d6b","observation_id":"7f18dc49-9abb-4733-a927-348c0d3e2f7b","resolution":{"observed_at":"2026-08-06T23:50:23.735576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:23.738569Z","title":"Video generation models as world simulators, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.738569Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:fbc8454fa4c8073ad36790b4783f61698e6425c4912f23b6c44b016b701e561d","observation_id":"5edbd2aa-2825-4420-96b0-32875371e2bc","resolution":{"observed_at":"2026-08-06T23:50:23.738569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:24.378028Z","title":"Snap video: Scaled spatiotemporal transformers for text-to-video synthesis","venue":null,"work_id":"eb626076-4119-41fe-b087-1dfdd12edf62","year":2024},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.741499Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:cd332f124991061a3417dd0dcea874f033ee823fe58223c71f5fa9552011cbf7","observation_id":"3ba617db-3f6d-4817-9149-f8c92381408d","resolution":{"observed_at":"2026-08-06T23:50:24.381186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:24.368572Z","title":"Vd3d: Taming large video diffusion transformers for 3d camera control","venue":null,"work_id":"767b0d31-e00c-41ae-9099-7806e59c46bf","year":2024},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.744383Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:91d142abefce3821bfa80940cb3beef08ce91a41b2dd407bf05ec281c46ee38a","observation_id":"7f3351a3-900a-4256-8d3e-862b9cfa8b50","resolution":{"observed_at":"2026-08-06T23:50:24.372220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:24.359588Z","title":"Motionctrl: A unified and flexible motion controller for video generation","venue":null,"work_id":"c7e20f89-3834-4f6c-ae7d-bde1baecbd10","year":2024},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.748477Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:94cac15a78a1440e6c52855ea7afcccab87fe81b5d9c5630ab2e4609e7f11f27","observation_id":"b365e525-4771-4899-8ee2-eeaffad7bda8","resolution":{"observed_at":"2026-08-06T23:50:24.362670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:24.350913Z","title":"Cameractrl: Enabling camera control for text-to-video generation","venue":null,"work_id":"6925f709-4633-41af-bf30-682f179982c8","year":2024},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.751759Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:ef33c8975b3f3692bdfaa6dd83465a7e235d3f43afb6d6efce949f4810d084c8","observation_id":"671fb44e-c1fe-43e8-9293-ff2ccb613427","resolution":{"observed_at":"2026-08-06T23:50:24.354139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:24.341723Z","title":"Direct-a-video: Customized video generation with user-directed camera movement and object motion","venue":null,"work_id":"be433231-7fff-4dec-96f3-1baced3546e6","year":2024},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.755463Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:25fedd499ed3314a4c25d9977a202eaacd7469e3854a68f786fd71265e856f26","observation_id":"ff44c7b2-3b0a-4bf5-8216-159eb39a8e47","resolution":{"observed_at":"2026-08-06T23:50:24.345593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:24.332757Z","title":"Camco: Camera-controllable 3d-consistent image-to-video generation","venue":null,"work_id":"1f2fd982-4cd8-460e-a342-86664aa86791","year":2024},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.758985Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:f89121f4c99623a9fbd9b1c9a0bba475920fe25dacfb444cae5b7d2e0afe77fc","observation_id":"ccfd719a-a69d-498b-afd0-1f2a115c2dd1","resolution":{"observed_at":"2026-08-06T23:50:24.335918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:24.324287Z","title":"Freevs: Generative view synthesis on free driving trajectory","venue":null,"work_id":"7df51d72-ebd1-46aa-9940-1f21c023a524","year":2024},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.762933Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:de0be1d02adc0067c71034f381219bec2844dd942e778b57724019a8fd823e78","observation_id":"f757fea2-5703-4e1b-a5df-3370b917cc6f","resolution":{"observed_at":"2026-08-06T23:50:24.327304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:23.766509Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.766509Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:ed31a53e3e135b4d9e4fcbe9ec366e7814856f6a4fbf1f6f4a8b2b97eaefdcac","observation_id":"3bd9309a-2eff-42e0-bf00-27b54ffc2154","resolution":{"observed_at":"2026-08-06T23:50:23.766509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:24.309682Z","title":"Stereo magnification: Learning view synthesis using multiplane images","venue":null,"work_id":"2bfc5ae1-1518-45b2-a5a0-d636f268762d","year":2018},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.770040Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:a2ab9ec7df9f58d34af691ad468c4e20d75f1d8cd8a192b20f2a3a970e3ed8f4","observation_id":"6685641e-fb72-4e78-a55c-01d1db995f8f","resolution":{"observed_at":"2026-08-06T23:50:24.313751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:24.299822Z","title":"Instantsplat: Sparse-view gaussian splatting in seconds, 2024","venue":null,"work_id":"f9c61f9a-2833-471c-89d0-657bd469d367","year":2024},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.774059Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:f21a50beff3e31fad0739c7f8cce044b4fd9f780184ab3b17fa010aa92228e3e","observation_id":"04634c8b-86a5-42af-b5c7-63ecf2845064","resolution":{"observed_at":"2026-08-06T23:50:24.303502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:24.289801Z","title":"Putting nerf on a diet: Semantically consistent few-shot view synthesis","venue":null,"work_id":"c039dd03-b0df-45cd-924b-610a8a95a17e","year":2021},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.777563Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:9d7fadb1497731b8663f18a680656a5054666970a7649d0325c7aa24f9af9eb3","observation_id":"e1ca18a6-3eac-415a-be4e-11a7f6c1164a","resolution":{"observed_at":"2026-08-06T23:50:24.293134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:24.280050Z","title":"G3r: Gradient guided generalizable reconstruction","venue":null,"work_id":"6a1852d4-8415-4cbf-ae0f-ab36a6936c0f","year":2024},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.781352Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:bda8f8a28081dae00b8e39077d3a73db06dd566354ec7f9724fb9a6a4dc31e8b","observation_id":"59d5383c-86d3-489a-8354-7b963f800b0e","resolution":{"observed_at":"2026-08-06T23:50:24.283957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:24.271412Z","title":"MonoNeRF: Learning a generalizable dynamic radiance field from monocular videos","venue":null,"work_id":"90f6f8ed-94b9-4199-8805-aa5d75eefbcc","year":2023},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.785199Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:8603bbeb62713ce4518e0c20f33a0a34ae519e894677eb1f583aacb14b1d7139","observation_id":"0d516c04-0831-4067-8eac-c50b173e8dbe","resolution":{"observed_at":"2026-08-06T23:50:24.274579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:24.261712Z","title":"Enhancing neRF akin to enhancing LLMs: Generalizable neRF transformer with mixture-of-view-experts","venue":null,"work_id":"26454194-f26e-4e3a-8219-c7d93bba69d9","year":2023},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.789136Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:383c580d4df2e807d9b8d9908e2b751abfa7c740396a9ef76274e07cc2f94e45","observation_id":"393a2ed3-5194-4013-8639-538cf5e8d523","resolution":{"observed_at":"2026-08-06T23:50:24.265358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:24.251854Z","title":"Is attention all that neRF needs? InICLR, 2023","venue":null,"work_id":"6108ce6e-32c4-4cf3-aaa1-8415af22ab2e","year":2023},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.792598Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:608842f06029b656b2ad015ee317acb9958ae50aff57b39335c531a0d6238f49","observation_id":"ba2cb804-be68-4957-b800-c9adadf5a64e","resolution":{"observed_at":"2026-08-06T23:50:24.256083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:24.241850Z","title":"Lrm: Large reconstruction model for single image to 3d","venue":null,"work_id":"8394def7-245c-4df9-868f-be683a879c50","year":2024},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.796652Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:9ab3f19322efd74a92fc32a4cfc303c29624e53d44987e852caad4d39db7dbf6","observation_id":"e788f295-de1b-4187-a96f-d660d1556101","resolution":{"observed_at":"2026-08-06T23:50:24.245531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:23.800523Z","title":"pixelsplat: 3d gaussian splats from image pairs for scalable generalizable 3d reconstruction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.800523Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:794ebb986bd5ec16b9e22c49037026b16a24ee2059350a925452f410a4d6c326","observation_id":"396fceb1-b23a-4680-83a8-670d5aa223e1","resolution":{"observed_at":"2026-08-06T23:50:23.800523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:24.226052Z","title":"Mvsplat: Efficient 3d gaussian splatting from sparse multi-view images.ECCV, 2024","venue":null,"work_id":"a3ced253-f958-4d3c-96de-5f6674c53a20","year":2024},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.803999Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:049a2c528712cb435c2ded468a03f1e1793a17012b0427f137f05909064d459e","observation_id":"0891cf3f-1f9d-4bdf-b3a2-b27c98d91e18","resolution":{"observed_at":"2026-08-06T23:50:24.230300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:23.807113Z","title":"Mvsplat360: Feed-forward 360 scene synthesis from sparse views","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.807113Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:1b1a864f96d9dc070715608586a96a735fd66307d96260b5ac5dc8a95057649e","observation_id":"6701339f-c233-47ca-9d27-5dc0b2805224","resolution":{"observed_at":"2026-08-06T23:50:23.807113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:24.211969Z","title":"Gs-lrm: Large reconstruction model for 3d gaussian splatting.ECCV, 2024","venue":null,"work_id":"4ce0980e-5e8e-4e6c-be36-0516c34e7112","year":2024},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.810632Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:2995483d2cb112bbba7e9ec7dc4e07bc74934500cd06e1d5f6be4efda1eecacf","observation_id":"f264ddc9-bcd9-4f8e-996d-24121164bf99","resolution":{"observed_at":"2026-08-06T23:50:24.215140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:24.202674Z","title":"Scube: Instant large-scale scene reconstruction using voxsplats","venue":null,"work_id":"4e928d1f-7d2d-429e-9a5d-09608e688fa4","year":2024},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.814457Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:a6157c7d695b2478b99cf7d01a54b403bc38a42c4fba4d64b89c389a4e84773a","observation_id":"d78589ec-b1e4-4d3a-8266-3991496a7271","resolution":{"observed_at":"2026-08-06T23:50:24.206565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:24.193219Z","title":"Lvsm: A large view synthesis model with minimal 3d inductive bias","venue":null,"work_id":"ac2ad290-97d9-4f4c-9ab9-72d60ce86376","year":2025},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.817822Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:b40535fd3aa09f9e809284e23c377a91daf39bc6108b01eb5c23cc8a9d02083a","observation_id":"9a120bfa-962a-47b6-a71a-e6ef6f4923d0","resolution":{"observed_at":"2026-08-06T23:50:24.196276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:24.184391Z","title":"Rayzer: A self-supervised large view synthesis model","venue":null,"work_id":"f7799168-113e-49ef-9c25-d4fe0a595f16","year":2025},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.821231Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:a00cd11068741503e74b58606666065d52bdbb50cfea121e791c54e477d525f3","observation_id":"f09b4afb-a913-4566-8e56-141ba62157c6","resolution":{"observed_at":"2026-08-06T23:50:24.188005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:24.174600Z","title":"Splatt3r: Zero-shot gaussian splatting from uncalibrated image pairs","venue":null,"work_id":"d2a47607-0b67-4b8d-9983-1d2b6dfd5963","year":2024},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.824569Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:6f2ace51200b621b33878b019967dee0d2db67d0ce03cb06def6dadbe56fcc0a","observation_id":"282faeee-b9c7-4633-93ca-9f696fb98b5d","resolution":{"observed_at":"2026-08-06T23:50:24.178642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:24.164140Z","title":"Flare: Feed-forward geometry, appearance and camera estimation from uncalibrated sparse views.CVPR, 2025","venue":null,"work_id":"594ac729-6d72-4e6c-b5a6-45062d7cffd6","year":2025},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.828387Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:5d443b579ac80401bd6b9d9ee8034681626ece39e422d0de1b9db9060009187e","observation_id":"286d7cca-fe03-456d-a60f-38ee63287c63","resolution":{"observed_at":"2026-08-06T23:50:24.168548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:24.155162Z","title":"No pose, no problem: Surprisingly simple 3d gaussian splats from sparse unposed images.ICLR, 2025","venue":null,"work_id":"b98daa83-7c39-42f4-8a73-1269f46327e4","year":2025},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.831420Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:0b9e1d7bf51210b851204e8d131a50f0681e6a0292a527911521f770f7bbac16","observation_id":"7b44d003-86be-4a92-9832-f3fe78bd9189","resolution":{"observed_at":"2026-08-06T23:50:24.158491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:24.144394Z","title":"Pf3plat: Pose-free feed-forward 3d gaussian splatting.ICML, 2025","venue":null,"work_id":"fccd287b-5f5a-4627-9ad0-f5bc9ba28854","year":2025},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.834350Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:e0525cc795d99fd8ab666c984d19647fb0780ecca7a22617989e3313f7f1799e","observation_id":"292d743f-ca24-4e8f-9d70-bc5f88f55df8","resolution":{"observed_at":"2026-08-06T23:50:24.148307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:24.135162Z","title":"Susskind, and Alexander G","venue":null,"work_id":"7b066ba5-5e0d-46c4-b9f0-72b811ad9cac","year":2024},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.837357Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:bfb714112d6e3fb93962cc3739ac9f5cbf7c7bccaabc588000f8f76823d5ed6f","observation_id":"5fc49928-cb37-4c43-8a39-00ed473718e0","resolution":{"observed_at":"2026-08-06T23:50:24.138385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:24.125621Z","title":"Monst3r: A simple approach for estimating geometry in the presence of motion.ICLR, 2025","venue":null,"work_id":"4d2676ca-8958-4651-af32-1f1cd30bc466","year":2025},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.840169Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:5b8d32db959fa600ad8593146b95031349929b68460e6626810aa5899721ced6","observation_id":"7677d66f-752d-4a87-81cf-0a6fb2c3e3e3","resolution":{"observed_at":"2026-08-06T23:50:24.129088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:23.843011Z","title":"Dust3r: Geometric 3d vision made easy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.843011Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:6c3b51b944ad80715960fff3c2f08a74c489ce30c74e652087d3218fb83ca35c","observation_id":"dd87c8b4-6514-44e2-8d9a-2586c0a325ef","resolution":{"observed_at":"2026-08-06T23:50:23.843011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:23.846627Z","title":"Grounding image matching in 3d with mast3r, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.846627Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:7a8ea8385a93bc01c6aad1150e817e00e7a6d71c0b18a037035c4b72c6f91727","observation_id":"a03f0d00-bdec-4e85-83b8-b91682087dd5","resolution":{"observed_at":"2026-08-06T23:50:23.846627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:24.103340Z","title":"L4gm: Large 4d gaussian reconstruction model","venue":null,"work_id":"5db6fdc5-0ad1-4a36-98c8-ef30667323d1","year":2024},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.849817Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:bf9950a0943cc1f5a208a9f6391b61882cef39592a98d6b11c8cc82daf4f82e6","observation_id":"139fdb88-0697-4c5c-8ae8-2d22a7e2dd38","resolution":{"observed_at":"2026-08-06T23:50:24.107515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:24.094323Z","title":"Feed-forward bullet- time reconstruction of dynamic scenes from monocular videos","venue":null,"work_id":"87abba45-2a3d-410e-9d38-dfcf264f50e1","year":2024},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.852934Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:f349b65cd05b0591d84d9d0154125c2e8ad308c4b2a7596447853b849c0b7c19","observation_id":"d008ac3b-befa-430a-ac3c-e8b1c5ebf8e7","resolution":{"observed_at":"2026-08-06T23:50:24.097579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:24.085170Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":"9afff731-2dd9-47ce-a128-4aa78dc83b98","year":2022},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.856515Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:69c9026af497f63abc28f592d90dbb8ef9ace9cd7d92363b8edcc1f490a0e551","observation_id":"66ba1738-44de-49a9-bae0-ee1cb7752108","resolution":{"observed_at":"2026-08-06T23:50:24.088506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:24.076030Z","title":"Cosmos world foundation model platform for physical ai, 2025","venue":null,"work_id":"3aab7e92-918c-4c28-aaec-3e24fbea5893","year":2025},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.859564Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:b14a79fa053494ac76f15d2b1ac13f9c116d5d4bf701768c4ec2505a4522d90a","observation_id":"616dbc40-57ec-47aa-ae62-60e55a1da6b9","resolution":{"observed_at":"2026-08-06T23:50:24.079666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:24.065266Z","title":"Sv4d 2.0: Enhancing spatio-temporal consistency in multi-view video diffusion for high-quality 4d gener- ation, 2025","venue":null,"work_id":"72d4796f-fcd9-4627-a4eb-018394df6f36","year":2025},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.862630Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:3f99c60821f43df1bf79f648c98e940852c2acb56c6c55fb984e6c87bfc09069","observation_id":"665d75be-f46c-479a-95b9-6f034c843508","resolution":{"observed_at":"2026-08-06T23:50:24.069200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:23.866147Z","title":"Flex attention: A programming model for generating optimized attention kernels, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.866147Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:abb25d5bad8401734ed0e10111d72e723a1df49736987c52fd85c047bdfa730e","observation_id":"f651e6f6-0bbe-4800-818c-ec068ae5af5b","resolution":{"observed_at":"2026-08-06T23:50:23.866147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:24.049548Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":"eb14edea-6b1b-4a8c-83f3-5863f7de3098","year":2022},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.869966Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:732b24681039ebc05ed1f68afba71f63fd9d759d93f179e4e0a7223514de94d4","observation_id":"c33a9a83-d002-4aaf-8586-8311feeb9050","resolution":{"observed_at":"2026-08-06T23:50:24.052940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:24.039495Z","title":null,"venue":null,"work_id":"9274959a-e1ba-47c1-b85f-91b33122fda4","year":2022},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.874407Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:ded99cd2936c8070948480a40517b718362af64430d7e9a0635ed868015149d0","observation_id":"c81b07fc-eb6e-40d9-a5f4-1ae72b828243","resolution":{"observed_at":"2026-08-06T23:50:24.042911Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:23.877689Z","title":"Novel view synthesis of dynamic scenes with globally coherent depths from a monocular camera","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.877689Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:35567d719098a49d7146faab3ab34da5fa0d5ad23e2d91ee57737e576c813a0e","observation_id":"9e6d9a1e-b6ce-4997-8df1-62ee68f1a52c","resolution":{"observed_at":"2026-08-06T23:50:23.877689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:23.881503Z","title":"The unreason- able effectiveness of deep features as a perceptual metric","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.881503Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:b98377711f3032b2aac177d41cc69752543424e65fb15a2954272dd536f93600","observation_id":"7d589cd8-80db-4734-a193-ef5d931e1fc2","resolution":{"observed_at":"2026-08-06T23:50:23.881503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:24.013847Z","title":"Dl3dv-10k: A large-scale scene dataset for deep learning-based 3d vision","venue":null,"work_id":"d578e515-2519-4cb9-a5fa-f9bedb0aa1d4","year":2024},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.885477Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:7437158539c2c43c0ba74974a3cdd882ecdd4aedca9623c728b982e057eb6cfb","observation_id":"c03e6d85-9d73-433a-98ae-1070b2da8744","resolution":{"observed_at":"2026-08-06T23:50:24.018348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:24.002604Z","title":"Mvimgnet: A large-scale dataset of multi-view images","venue":null,"work_id":"b2e28f32-5ff3-48b9-9735-3ef5e3c7a821","year":2023},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.889573Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:db2cd7cad5a5906dacfc6c8d02d2209c37184b3fd321027eff638bc79a0e957c","observation_id":"cb319de6-14e3-4966-b3d6-3493797bd69b","resolution":{"observed_at":"2026-08-06T23:50:24.006724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:23.991317Z","title":"Infinite nature: Perpetual view generation of natural scenes from a single image","venue":null,"work_id":"d7c323d9-38c1-43c8-aad3-ad162b6674c8","year":2021},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.893578Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:e68c8baa048ebbdee1986bd0bd0d395d19fbabe7fd18e48183fd9956b4b117fe","observation_id":"55b52fa2-3894-41fc-84fb-fdc31089851c","resolution":{"observed_at":"2026-08-06T23:50:23.995769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:23.981158Z","title":"Vbench++: Comprehensive and versatile benchmark suite for video generative models","venue":null,"work_id":"cf8dc644-8216-423d-b806-fa27fdd321ee","year":2024},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.897609Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:b95f9da67487f9f53f4368e6b6991f12923e92798311ddc93015301ea289552b","observation_id":"1a23ae38-515b-4a11-a353-dfe323cde999","resolution":{"observed_at":"2026-08-06T23:50:23.984476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:23.971385Z","title":"Met3r: Measuring multi-view consistency in generated images","venue":null,"work_id":"02916413-e6d0-4bb1-b288-45f69454e688","year":2024},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.901370Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:6811da11537878b5e8356ddd9eb97c1f6d002f116a848f2d1f46d7ade3f80beb","observation_id":"080817de-0c0b-4f07-836f-00a72ddd011f","resolution":{"observed_at":"2026-08-06T23:50:23.974625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:23.961720Z","title":"Tanks and temples: Bench- marking large-scale scene reconstruction.ToG, 2017","venue":null,"work_id":"2997e298-c7c1-4a9f-82ef-03da469d89ed","year":2017},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.904561Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:21ecbf13b07ef2a08f2bd6a37ed6af8ff3ccb5d7e8b5180a54be703775e2bbc0","observation_id":"5d41ebdd-d15f-4fb3-aca5-b4c79007aa84","resolution":{"observed_at":"2026-08-06T23:50:23.965374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:23.952240Z","title":"Srinivasan, Rodrigo Ortiz-Cayon, Nima Khademi Kalantari, Ravi Ramamoorthi, Ren Ng, and Abhishek Kar","venue":null,"work_id":"be5975d3-70a8-47ff-a25b-94f82b666f14","year":2019},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.907620Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:77b6b24c2aceb45f016de40a4a8d86eec4fbe7cf0bcaac9fb8b1e5cf0a91a5f2","observation_id":"3eec1823-de78-46f3-895e-64ba1e5b460b","resolution":{"observed_at":"2026-08-06T23:50:23.955740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:50:23.940331Z","title":"Neural 3d video synthesis from multi-view video","venue":null,"work_id":"64c1444f-3c7b-4722-8f5a-c3273f13290a","year":2022},"citing_paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T23:50:23.911081Z"},"links":{"citing_paper":"/paper/2506.18839"},"observation_digest":"sha256:8db34d48b0dfcc67b37c13d35e28eedbad7f4cc4e8ac8869fb2d140d3b9a5cb4","observation_id":"19ec201f-06d1-43ee-93fa-d61da4095288","resolution":{"observed_at":"2026-08-06T23:50:23.945498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.18839","last_updated":"2025-06-18T23:44:59Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T23:42:32.454767Z","submitted_at":"2025-06-18T23:44:59Z","title":"4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation"},"reference_resolution":{"displayed":95,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":0,"verified_fuzzy":58},"total_outbound_references":95},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 95 of 95 outbound references and 3 inbound Pith citation observations for arXiv:2506.18839."}