{"as_of":"2026-08-12T15:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6cd5e92f2ba5c0eab52c78ef093cd0fb569012d720c92a3e6e4e5b91492811ae","coverage":[{"denominator":107,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T23:07:40.965870Z","state":"measured"},{"denominator":105,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":105,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T13:11:04.986747Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T05:43:58.887100Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21117","snapshot_observed_at":"2026-08-12T13:11:04.986747Z","title":"Prometheus: 3d-aware latent diffusion models for feed-forward text-to-3d scene genera- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16443","last_updated":"2025-04-16T12:21:59Z","snapshot_observed_at":"2026-08-12T13:03:50.648330Z","submitted_at":"2024-11-25T14:46:17Z","title":"SplatFlow: Multi-View Rectified Flow Model for 3D Gaussian Splatting Synthesis","version":3},"reference_index":121,"source":"pdf_text","source_observed_at":"2026-08-12T13:11:04.986747Z"},"links":{"cited_paper":"/paper/2412.21117","citing_paper":"/paper/2411.16443"},"observation_digest":"sha256:78f20d853d761dad231955abc0382917188d268099a1a327ded09a3e853d145b","observation_id":"97ddc78a-dac5-430d-a4d9-ea6e8b6a97cb","resolution":{"observed_at":"2026-08-12T13:11:04.986747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21117","snapshot_observed_at":"2026-08-06T15:14:16.609986Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16535","last_updated":"2025-07-23T01:59:09Z","snapshot_observed_at":"2026-08-08T06:18:41.187183Z","submitted_at":"2025-07-22T12:46:48Z","title":"EarthCrafter: Scalable 3D Earth Generation via Dual-Sparse Latent Diffusion","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:16.609986Z"},"links":{"cited_paper":"/paper/2412.21117","citing_paper":"/paper/2507.16535"},"observation_digest":"sha256:f5f346fae06330c52c08a598ff91d8e14ee8dc812e29f09d259c4d8f427be9fa","observation_id":"0ead250d-3c72-4f6b-a728-65779983135c","resolution":{"observed_at":"2026-08-06T15:14:16.609986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"cited_work":{"arxiv_id":"2412.21117","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.21117","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Prometheus: 3d-aware latent diffusion models for feed-forward text-to-3d scene generation","venue":null,"work_id":"8aa8a6bb-7ea2-4b55-ada4-21d72130a88b","year":2024},"citing_paper":{"arxiv_id":"2605.20910","last_updated":"2026-05-20T08:55:37Z","snapshot_observed_at":"2026-08-02T06:22:21.581112Z","submitted_at":"2026-05-20T08:55:37Z","title":"FlowLong: Inference-time Long Video Generation via Manifold-constrained Tweedie Matching","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-21T05:42:38.377132Z"},"links":{"cited_paper":"/paper/2412.21117","citing_paper":"/paper/2605.20910"},"observation_digest":"sha256:d1de992b1fcc711205bfb941f4603dfae93c493e25dee69c99b5cc2383867894","observation_id":"780d0016-36ec-4a4c-96b0-64c620016160","resolution":{"observed_at":"2026-05-21T05:43:58.888621Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21117","snapshot_observed_at":"2026-07-11T23:44:51.203896Z","title":"Prometheus: 3d-aware latent diffusion models for feed-forward text-to-3d scene generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03819","last_updated":"2026-07-23T08:11:10Z","snapshot_observed_at":"2026-08-11T16:54:49.990412Z","submitted_at":"2026-07-04T11:06:41Z","title":"CGGS: Consistency-Augmented Geometric Gaussian Splatting for Ego-Centric 3D Scene Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-11T23:44:51.203896Z"},"links":{"cited_paper":"/paper/2412.21117","citing_paper":"/paper/2607.03819"},"observation_digest":"sha256:d48d27e7fd33a97c985b2c9f5778944f2dedbf132dc1e6d1744f8fc4be089d1b","observation_id":"cbc1233c-22db-4c6d-bc99-712d204882ff","resolution":{"observed_at":"2026-07-11T23:44:51.203896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21117","snapshot_observed_at":"2026-08-02T08:49:18.643545Z","title":"Prometheus: 3d-aware latent diffusion models for feed-forward text-to-3d scene generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03819","last_updated":"2026-07-23T08:11:10Z","snapshot_observed_at":"2026-08-11T16:54:49.990412Z","submitted_at":"2026-07-04T11:06:41Z","title":"CGGS: Consistency-Augmented Geometric Gaussian Splatting for Ego-Centric 3D Scene Generation","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T08:49:18.643545Z"},"links":{"cited_paper":"/paper/2412.21117","citing_paper":"/paper/2607.03819"},"observation_digest":"sha256:72114e216d45cdf9a46825bb4a9a76a43207010200ef51c8dc84bf8b9c0d2f6b","observation_id":"d12411fd-ab25-47ad-9180-c0926c633d4d","resolution":{"observed_at":"2026-08-02T08:49:18.643545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.21117/citation-record","integrity":"/paper/2412.21117/integrity","json":"/paper/2412.21117/citation-record.json","paper":"/paper/2412.21117"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:40.565732Z","title":"Guibas, and Andrea Tagliasacchi","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.565732Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:42d1183aaa0d40c1f26ef234eebb222f398322726711e85f57980b3713639fff","observation_id":"839c98d9-8255-45ee-9d67-3d72211b013b","resolution":{"observed_at":"2026-08-10T23:07:40.565732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-10T23:07:40.570542Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv.2311.15127,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.570542Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:202a9d7f943c2619f8d239a3e3f754e1b6b1efccf5f44462bbc86f241fe8f253","observation_id":"738c6c18-b6ae-46f4-a916-4284cb3a4aa8","resolution":{"observed_at":"2026-08-10T23:07:40.570542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:40.574987Z","title":"Video generation models as world simulators,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.574987Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:01d1e068f649a3184aec7baf4ad9666ffbe5245b30fe65d036b80a085eb3c928","observation_id":"8bdfccbc-6b7a-4b8a-83b8-e982f127c9f1","resolution":{"observed_at":"2026-08-10T23:07:40.574987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:40.579018Z","title":"nuscenes: A multimodal dataset for autonomous driving","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.579018Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:bea2f98eaac757ce2fee3a1dd9657d0fe5076e99e999a94726b088d598f07b72","observation_id":"dab290f5-2900-4640-b471-9c8aa28207e0","resolution":{"observed_at":"2026-08-10T23:07:40.579018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:40.583123Z","title":"Chan, Connor Z","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.583123Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:2d5956d75f7553ed7f848f14b7f3c3719dc7737322ffdf6a1e93a90609444a64","observation_id":"4f558089-a39d-4363-b945-1113167d8827","resolution":{"observed_at":"2026-08-10T23:07:40.583123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:40.587249Z","title":"Chan, Koki Nagano, Matthew A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.587249Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:d8a20e364c418a6e71d62c4a7f4fed362849690122759518f4c0dfa631eba036","observation_id":"d7694227-3662-4129-983b-a8e75f40ccd5","resolution":{"observed_at":"2026-08-10T23:07:40.587249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:40.591544Z","title":"pixelsplat: 3d gaussian splats from image pairs for scalable generalizable 3d reconstruction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.591544Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:9b6ec9a53256a8ac5a5566144b8aaedb3e54046bddd8188adbd59ea7d3465af0","observation_id":"44cb3b2e-18ec-41e8-8d28-0ce64cf055b3","resolution":{"observed_at":"2026-08-10T23:07:40.591544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:40.595432Z","title":"Lara: Efficient large-baseline radi- ance fields","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.595432Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:ddbd7d047864cb82f33cdba4e841009bd0455d4895af3307bdf9b9cab33d0fe8","observation_id":"f28c9c5e-1b54-41b3-8b8b-af16fe7a3c6f","resolution":{"observed_at":"2026-08-10T23:07:40.595432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-10T23:07:40.599974Z","title":"Pixart- α: Fast train- ing of diffusion transformer for photorealistic text-to-image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.599974Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:bd4cfae3523a5071e2ea38bab9fefb4db3b150fbe3d4acff9eba1f0f99921f1c","observation_id":"a01a8151-9b0a-4083-bcbd-ef33f0dfc7db","resolution":{"observed_at":"2026-08-10T23:07:40.599974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19525","last_updated":"2024-10-18T13:13:44Z","snapshot_observed_at":"2026-08-09T09:38:15.132731Z","submitted_at":"2024-04-30T12:56:14Z","title":"MicroDreamer: Efficient 3D Generation in $\\sim$20 Seconds by Score-based Iterative Reconstruction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19525","snapshot_observed_at":"2026-08-10T23:07:40.604817Z","title":"Microdreamer: Zero-shot 3d generation in ∼20 seconds by score-based it- erative reconstruction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.604817Z"},"links":{"cited_paper":"/paper/2404.19525","citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:380f6c3c9b2e401d0a1b2788352b4d22a539cfd2459760adb8919507f44a8292","observation_id":"0d89d918-53c7-447b-9cb8-76fcc07e6f69","resolution":{"observed_at":"2026-08-10T23:07:40.604817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14627","last_updated":"2024-07-18T13:10:22Z","snapshot_observed_at":"2026-08-11T10:05:55.171630Z","submitted_at":"2024-03-21T17:59:58Z","title":"MVSplat: Efficient 3D Gaussian Splatting from Sparse Multi-View Images","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14627","snapshot_observed_at":"2026-08-10T23:07:40.609943Z","title":"Mvsplat: Efficient 3d gaussian splat- ting from sparse multi-view images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.609943Z"},"links":{"cited_paper":"/paper/2403.14627","citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:78bad5bb47c0c438883495f92fab97dece5521cf94914747e32a93b7cb5808c5","observation_id":"82f33605-3458-42b0-82e8-d5258fcd83e7","resolution":{"observed_at":"2026-08-10T23:07:40.609943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:40.614328Z","title":"Mvsplat360: Feed-forward 360 scene synthesis from sparse views","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.614328Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:d397574e698ee419a1ea2efcff36d3ee57de7c772d93523d53852d25810d4163","observation_id":"ac2ca09e-1993-480c-a95d-d78404ede14c","resolution":{"observed_at":"2026-08-10T23:07:40.614328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06738","last_updated":"2024-03-11T14:03:36Z","snapshot_observed_at":"2026-08-12T13:45:34.173836Z","submitted_at":"2024-03-11T14:03:36Z","title":"V3D: Video Diffusion Models are Effective 3D Generators","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06738","snapshot_observed_at":"2026-08-10T23:07:40.618589Z","title":"V3d: Video diffusion models are effective 3d generators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.618589Z"},"links":{"cited_paper":"/paper/2403.06738","citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:f1576b84db60dee3d9ec3aa1a72cffd8809d50f6da7aaa384d2d2feb4c11b169","observation_id":"4849c634-adb5-4c20-b24b-7b1085eaa341","resolution":{"observed_at":"2026-08-10T23:07:40.618589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13384","last_updated":"2023-11-23T11:40:16Z","snapshot_observed_at":"2026-08-09T05:30:44.065605Z","submitted_at":"2023-11-22T13:27:34Z","title":"LucidDreamer: Domain-free Generation of 3D Gaussian Splatting Scenes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.13384","snapshot_observed_at":"2026-08-10T23:07:40.622926Z","title":"Luciddreamer: Domain-free generation of 3d gaussian splatting scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.622926Z"},"links":{"cited_paper":"/paper/2311.13384","citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:791920a42f3142dd9a5abce64c4b96bd42a222366babc1f9bd1f1beaf4a957fe","observation_id":"c2f9cbdb-e98a-4b88-a8ff-b9e6142b0a82","resolution":{"observed_at":"2026-08-10T23:07:40.622926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05663","last_updated":"2023-07-11T17:57:40Z","snapshot_observed_at":"2026-07-06T15:52:52.180267Z","submitted_at":"2023-07-11T17:57:40Z","title":"Objaverse-XL: A Universe of 10M+ 3D Objects","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05663","snapshot_observed_at":"2026-08-10T23:07:40.627484Z","title":"Objaverse-xl: A universe of 10m+ 3d objects","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.627484Z"},"links":{"cited_paper":"/paper/2307.05663","citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:7dc0a9f27096cfb5a6dadc3f1d2c6bbe823e6b819d6d3453a3ba47cc82bd06fd","observation_id":"7d01de8f-9bcb-4317-9554-23fb4551dca8","resolution":{"observed_at":"2026-08-10T23:07:40.627484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:40.631772Z","title":"CARLA: An open ur- ban driving simulator","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.631772Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:8535ed00ff9023a51518676ba372284ad0f3444cefc5870af02c165e8bf73c02","observation_id":"9443ae14-f9b9-4a37-8d3f-8e392471b76a","resolution":{"observed_at":"2026-08-10T23:07:40.631772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01133","last_updated":"2023-05-30T08:52:45Z","snapshot_observed_at":"2026-08-10T23:21:09.839694Z","submitted_at":"2023-02-02T14:47:19Z","title":"SceneScape: Text-Driven Consistent Scene Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.01133","snapshot_observed_at":"2026-08-10T23:07:40.635762Z","title":"Scenescape: Text-driven consistent scene genera- tion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.635762Z"},"links":{"cited_paper":"/paper/2302.01133","citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:e3d1da7be8bcf321b4a85000ddfc4229ab7500b0c5ce94e419b0bd801df6543f","observation_id":"4eebe91e-1b48-4929-b9ba-c0c7119a158c","resolution":{"observed_at":"2026-08-10T23:07:40.635762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:40.639835Z","title":"Srini- vasan, Jonathan T","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.639835Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:97dfb5b7303546a4641349ccb706c72fd037b76c9aa5c11292f1f1c25a688279","observation_id":"8b2a3980-5e20-4de7-b66a-698a9b992dee","resolution":{"observed_at":"2026-08-10T23:07:40.639835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:40.643985Z","title":"Are we ready for autonomous driving? the kitti vision benchmark suite","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.643985Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:d90a524740fae13cb29f9d3b8b4e3b8e86b3b9e7e7ccdf29d145fee354f50669","observation_id":"b9c340e8-8f6f-4b70-af18-57c0c5e1b6a8","resolution":{"observed_at":"2026-08-10T23:07:40.643985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02101","last_updated":"2025-03-13T18:35:06Z","snapshot_observed_at":"2026-08-12T01:27:32.593496Z","submitted_at":"2024-04-02T16:52:41Z","title":"CameraCtrl: Enabling Camera Control for Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02101","snapshot_observed_at":"2026-08-10T23:07:40.647835Z","title":"Camerac- trl: Enabling camera control for text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.647835Z"},"links":{"cited_paper":"/paper/2404.02101","citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:57e14c4c633aaa486fe20162fcb4b47323bbce383bcbdfeea497ba4617d2e86a","observation_id":"b7ce17ba-8dbb-4bf0-b1db-db329d5f61dd","resolution":{"observed_at":"2026-08-10T23:07:40.647835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:40.652062Z","title":"Gvgen: Text-to-3d generation with volumetric representation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.652062Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:0ffe7bad80baa9206a4df1a3f7b1309deb860ef04138528905c5990509aaae31","observation_id":"5cc77eba-69cf-4303-86c7-23a4d7daa6b2","resolution":{"observed_at":"2026-08-10T23:07:40.652062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02977","last_updated":"2024-04-17T09:09:17Z","snapshot_observed_at":"2026-07-06T16:27:47.445841Z","submitted_at":"2023-10-04T17:12:18Z","title":"T$^3$Bench: Benchmarking Current Progress in Text-to-3D Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02977","snapshot_observed_at":"2026-08-10T23:07:40.656437Z","title":"T 3 bench: Benchmarking current progress in text-to-3d gener- ation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.656437Z"},"links":{"cited_paper":"/paper/2310.02977","citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:96c11d13311c991b4b22f192851f5359466419710b4634363a3ab29c53f40389","observation_id":"6e681858-644e-47ab-8513-7dc66698b35e","resolution":{"observed_at":"2026-08-10T23:07:40.656437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13099","last_updated":"2024-06-18T23:14:29Z","snapshot_observed_at":"2026-07-06T18:33:19.806199Z","submitted_at":"2024-06-18T23:14:29Z","title":"Sampling 3D Gaussian Scenes in Seconds with Latent Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13099","snapshot_observed_at":"2026-08-10T23:07:40.660985Z","title":"Sampling 3d gaussian scenes in seconds with latent diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.660985Z"},"links":{"cited_paper":"/paper/2406.13099","citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:756b21f20a2a34eac359534a3edbca38f21c3b7311160ea7051a3ec6b13136cd","observation_id":"d2aa14de-8f11-46ae-8a77-e58a8f03a347","resolution":{"observed_at":"2026-08-10T23:07:40.660985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-10T23:07:40.665146Z","title":"Clipscore: A reference-free evaluation metric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.665146Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:30045be955c295bfab515d34660024051a2715ca09a9257e80a417b749b813fe","observation_id":"85b31173-2b77-4b1a-ba5b-757bb3aafe4a","resolution":{"observed_at":"2026-08-10T23:07:40.665146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-10T23:07:40.669482Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.669482Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:9211e700fd3fddfe1e4568d8a2eea02d2054c981a27716894e07fccd4961e233","observation_id":"86063a03-e1a7-4ccd-bd8e-5c4cb1c3c53e","resolution":{"observed_at":"2026-08-10T23:07:40.669482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04400","last_updated":"2024-03-09T10:47:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-08T00:03:52Z","title":"LRM: Large Reconstruction Model for Single Image to 3D","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04400","snapshot_observed_at":"2026-08-10T23:07:40.673368Z","title":"LRM: large reconstruction model for single image to 3d","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.673368Z"},"links":{"cited_paper":"/paper/2311.04400","citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:f5ea862f4d192b2812d2e152a651a11dbe36a4ceb1ca8d5063dd74992fe20acf","observation_id":"35c0ea1b-53c0-41c8-a999-3afcfa0c23a1","resolution":{"observed_at":"2026-08-10T23:07:40.673368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02095","last_updated":"2024-11-27T07:59:25Z","snapshot_observed_at":"2026-08-10T14:47:55.222701Z","submitted_at":"2024-09-03T17:52:03Z","title":"DepthCrafter: Generating Consistent Long Depth Sequences for Open-world Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02095","snapshot_observed_at":"2026-08-10T23:07:40.677422Z","title":"Depthcrafter: Generating consistent long depth sequences for open-world videos","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.677422Z"},"links":{"cited_paper":"/paper/2409.02095","citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:71747ad0ecc5481d465bd1fecdb1c4172ae32f37abeb82ee716953dc8656c3b8","observation_id":"e5f921ea-cc75-4575-ab00-9b9273598009","resolution":{"observed_at":"2026-08-10T23:07:40.677422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:40.681897Z","title":"Perceptual losses for real-time style transfer and super-resolution","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.681897Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:f377fff64ad1b3db191ffa3c5d64e857e9a6785feab56f53d90f2bfae81afa2c","observation_id":"ebe5795e-9cf7-4a15-af8a-857fef0173da","resolution":{"observed_at":"2026-08-10T23:07:40.681897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:40.685902Z","title":"A style- based generator architecture for generative adversarial net- works","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.685902Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:0fe2d82f4de8d1a8f6e807ffad5389efe1cdc42a7853de040a9ff2991b0ee78d","observation_id":"8f913946-4de9-44c5-8531-06a056aa8444","resolution":{"observed_at":"2026-08-10T23:07:40.685902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:40.689722Z","title":"Elucidating the design space of diffusion-based generative models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.689722Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:b30279e25f1cfb43a2047cba3a8f2b3463330446afda7caf87bf1eaa4cd2f1a8","observation_id":"0f743934-3eca-4659-8af4-7f6f65541327","resolution":{"observed_at":"2026-08-10T23:07:40.689722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:40.693615Z","title":"Re- purposing diffusion-based image generators for monocular depth estimation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.693615Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:4fb07f9e94d0c7ce289b52b23a5a77d62002fba711e60eb3f8037f5019e25601","observation_id":"072c3379-6e23-42a8-8ea2-ef3048d50dc0","resolution":{"observed_at":"2026-08-10T23:07:40.693615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:40.697417Z","title":"3d gaussian splatting for real-time radiance field rendering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.697417Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:bb7109f6160ea77ae517f7abd29501a17666028919fdb92b25ad51d7be4020ae","observation_id":"6d90044c-0e55-4812-9f15-63def103460f","resolution":{"observed_at":"2026-08-10T23:07:40.697417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-08-08T05:14:59.435033Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-10T23:07:40.702456Z","title":"Berg, Wan-Yen Lo, Piotr Doll´ar, and Ross Girshick","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.702456Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:c338801572c526462cad9dd79f62e5d96772e6e67b7855c05043731cbd3b314a","observation_id":"38e1d454-1112-4379-87cf-c671fa4f8191","resolution":{"observed_at":"2026-08-10T23:07:40.702456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:40.706697Z","title":"Vivid-1-to-3: Novel view synthesis with video diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.706697Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:2c01b6eb5dab4d616c943dee2b0d4dc782c02ee64b602c0ac3d62cad0b8aa219","observation_id":"2e4f4abf-5951-4bc3-a381-81384dc5a1d4","resolution":{"observed_at":"2026-08-10T23:07:40.706697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:40.710665Z","title":"Ln3diff: Scalable latent neural fields diffusion for speedy 3d generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.710665Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:9fcadb0093e1534574aea2948c8684c92db64f27848e043139a2d9653acdeb3c","observation_id":"4227781f-6896-4760-879f-18f2234fb037","resolution":{"observed_at":"2026-08-10T23:07:40.710665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:40.714613Z","title":"Rgbd2: Generative scene synthesis via incremental view inpainting using rgbd diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.714613Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:e4422fbb920c7d46f5fedd8faf41621fa02786515375a9fb30a993b3a07aa3fb","observation_id":"f757ab87-7ba8-4c2e-a800-51a01ef36c3b","resolution":{"observed_at":"2026-08-10T23:07:40.714613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09874","last_updated":"2024-05-16T07:50:02Z","snapshot_observed_at":"2026-07-06T18:15:07.457767Z","submitted_at":"2024-05-16T07:50:02Z","title":"Dual3D: Efficient and Consistent Text-to-3D Generation with Dual-mode Multi-view Latent Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09874","snapshot_observed_at":"2026-08-10T23:07:40.718436Z","title":"Dual3d: Efficient and consistent text-to-3d generation with dual-mode multi-view latent diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.718436Z"},"links":{"cited_paper":"/paper/2405.09874","citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:806f5eac9da0f85a955ec0e31cddf0000866e51acb6535ae70fbc8dc0127edde","observation_id":"b6fe1ad9-6079-4286-9137-bca88a4c0401","resolution":{"observed_at":"2026-08-10T23:07:40.718436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17601","last_updated":"2024-06-25T14:42:51Z","snapshot_observed_at":"2026-08-12T12:25:04.537621Z","submitted_at":"2024-06-25T14:42:51Z","title":"Director3D: Real-world Camera Trajectory and 3D Scene Generation from Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17601","snapshot_observed_at":"2026-08-10T23:07:40.722751Z","title":"Di- rector3d: Real-world camera trajectory and 3d scene gen- eration from text","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.722751Z"},"links":{"cited_paper":"/paper/2406.17601","citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:c818fe8b86d0d557e1b9ec028b0e7de626cc41f0c4fc7293a2b43486d6bd0db9","observation_id":"1b86cde1-bca6-4a3f-805e-4c1f2e4505ca","resolution":{"observed_at":"2026-08-10T23:07:40.722751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:40.727030Z","title":"Kitti-360: A novel dataset and benchmarks for urban scene understanding in 2d and 3d","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.727030Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:1de42075bc200f549011098098afdf3c317f44d61bb24324d807a00429a0116f","observation_id":"eefa4f85-bda3-4a58-8ba6-d4230fffd30c","resolution":{"observed_at":"2026-08-10T23:07:40.727030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:40.730908Z","title":"Magic3d: High- resolution text-to-3d content creation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.730908Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:f7f641adeeb106a45c9d8c096b36f8cdeebc013224356bb3e7453a8be0e90c49","observation_id":"1c6dfc6e-2fd6-40db-b4a7-872802770e8c","resolution":{"observed_at":"2026-08-10T23:07:40.730908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:40.734932Z","title":"Common diffusion noise schedules and sample steps are flawed","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.734932Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:a84097891be8fabccf37ae419f1695358a7eed9b7e4fc7b282170172ccf36a3e","observation_id":"681cfe83-874f-489b-a3bf-6af8f8b3d4d3","resolution":{"observed_at":"2026-08-10T23:07:40.734932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:40.738886Z","title":"Dl3dv-10k: A large-scale scene dataset for deep learning-based 3d vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.738886Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:2cba1fe6202a7df019db5bb8e3c05f5310a27de7f5726476d3811c55ad4964fd","observation_id":"d4c6eb06-66c1-49f6-81a1-ca5a2c44e776","resolution":{"observed_at":"2026-08-10T23:07:40.738886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:40.742815Z","title":"Infinite nature: Perpetual view generation of natural scenes from a single image","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.742815Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:f1386c0ba356a08d2ec071de43d86effbccafb4aa50486b0c08ca7f6ad75ba2a","observation_id":"069da49e-764b-44f0-a4be-6e6568a081bb","resolution":{"observed_at":"2026-08-10T23:07:40.742815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16767","last_updated":"2025-06-25T07:19:44Z","snapshot_observed_at":"2026-08-01T22:53:31.767507Z","submitted_at":"2024-08-29T17:59:40Z","title":"ReconX: Reconstruct Any Scene from Sparse Views with Video Diffusion Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16767","snapshot_observed_at":"2026-08-10T23:07:40.746522Z","title":"Re- conx: Reconstruct any scene from sparse views with video diffusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.746522Z"},"links":{"cited_paper":"/paper/2408.16767","citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:e1b55990d9b44ef205c530ba200ae97c42dd9b8e1a1a6211a77866ccce02a4ab","observation_id":"5c2f6834-0b05-4b6b-94ce-281ec8f4fb92","resolution":{"observed_at":"2026-08-10T23:07:40.746522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:40.750585Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.750585Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:d24252a7eb4dfd5d4d3f7bab1421484743b9873bcced7df8f5e349f5302cf4ed","observation_id":"4c194b8d-3a9f-47c9-8dc4-e34f637f6d85","resolution":{"observed_at":"2026-08-10T23:07:40.750585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11328","last_updated":"2023-03-20T17:59:50Z","snapshot_observed_at":"2026-08-04T00:53:58.181083Z","submitted_at":"2023-03-20T17:59:50Z","title":"Zero-1-to-3: Zero-shot One Image to 3D Object","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11328","snapshot_observed_at":"2026-08-10T23:07:40.754368Z","title":"Zero-1-to-3: Zero-shot one image to 3d object","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.754368Z"},"links":{"cited_paper":"/paper/2303.11328","citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:9c66aba924fb2a60f593ad08c83c288fcb1b524764c9d4cde8af81db4b2cf807","observation_id":"3ef1d42a-f932-4022-8775-42404ed600d6","resolution":{"observed_at":"2026-08-10T23:07:40.754368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03453","last_updated":"2024-04-15T10:28:44Z","snapshot_observed_at":"2026-07-06T16:15:31.848927Z","submitted_at":"2023-09-07T02:28:04Z","title":"SyncDreamer: Generating Multiview-consistent Images from a Single-view Image","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.03453","snapshot_observed_at":"2026-08-10T23:07:40.758425Z","title":"Syncdreamer: Generating multiview-consistent images from a single-view image","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.758425Z"},"links":{"cited_paper":"/paper/2309.03453","citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:3d7f8ee2171c73c8bb7b13f07e10a1723bcd5961e3424d580ec84566e67e3b67","observation_id":"9072879c-d0df-45b6-a523-0a740a579450","resolution":{"observed_at":"2026-08-10T23:07:40.758425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:40.762387Z","title":"Srinivasan, Matthew Tancik, Jonathan T","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.762387Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:14319cfc6b533353792d9e14e06c2e6f9c3c6710d2b615df20f1b1b2ef082d91","observation_id":"5f9ced5f-2e94-4c6e-9a25-8e232ff8cbd5","resolution":{"observed_at":"2026-08-10T23:07:40.762387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:41.890445Z","title":"No-reference image quality assessment in the spatial domain","venue":null,"work_id":"bd7e62b1-d40d-47dd-a1c9-ba21e57293c9","year":2012},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.766322Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:91d3f388275fda0cc6e15841784925cc162848a107e86b71e103d4da31d764e8","observation_id":"f0718040-1637-404f-b5d5-2fbf4d647d29","resolution":{"observed_at":"2026-08-10T23:07:41.894606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:41.879372Z","title":"completely blind","venue":null,"work_id":"f085a671-d31b-47c3-bbf8-25ec5ba3fcea","year":2012},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.769812Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:6da4e0932652f6c2928849d8b352526080e9aea2f09748558ac3e80ec167851d","observation_id":"4af2d5b7-d076-4382-9abb-6eb9e828a232","resolution":{"observed_at":"2026-08-10T23:07:41.883190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:41.867489Z","title":"Diffrf: Rendering-guided 3d radiance field diffusion","venue":null,"work_id":"16175c8f-5ec8-4e66-b76c-dc7d0fd2b87d","year":2023},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.773519Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:d7aaaae827538eecbd03c68e97fd793ebf0bebc9265d0e330965e54d7a379569","observation_id":"b65821a4-e32f-4f5e-bb94-59ec75294f49","resolution":{"observed_at":"2026-08-10T23:07:41.871531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:41.855388Z","title":"Multidiff: Consistent novel view synthesis from a single image","venue":null,"work_id":"0bb509e0-e923-455e-bb62-aa70ef1d5317","year":2024},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.776958Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:412c8e1f743170bf07c689ae1ae70661264fe9805c802f4c8b83b520b7474245","observation_id":"f2d841f6-7fa6-49dd-a839-537faf9fd4cb","resolution":{"observed_at":"2026-08-10T23:07:41.859481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:41.844073Z","title":"GIRAFFE: rep- resenting scenes as compositional generative neural feature fields","venue":null,"work_id":"c6ddb359-95ea-4972-a119-47579cdccdd0","year":2021},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.780450Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:f8dc6d7af9170f1cf48cf2ef1f2599e63df79b903c1afc8e96710163c563c736","observation_id":"e74cf8b7-44af-4e8e-ab31-865564b41f8a","resolution":{"observed_at":"2026-08-10T23:07:41.848009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:40.783834Z","title":"Barron, and Ben Milden- hall","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.783834Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:06cdf540f7436bc0c9c82fe7909dcbf9c9e60b29aeed79e8ab0e372a1edf2bbb","observation_id":"1930a323-ca35-4591-82f7-9f827daf8b35","resolution":{"observed_at":"2026-08-10T23:07:40.783834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:41.823929Z","title":"Towards robust monocu- lar depth estimation: Mixing datasets for zero-shot cross- dataset transfer","venue":null,"work_id":"4ba0e102-1c72-4abc-a3c6-ae80bdb65cee","year":2022},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.787359Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:0647e7316a6a00a5d1785352f5358d542ff849c1eb0d0664112b5f9142753ffd","observation_id":"c6e6dabe-f102-4b37-b619-23e145dcfb1e","resolution":{"observed_at":"2026-08-10T23:07:41.828342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:41.812167Z","title":"L3dg: Latent 3d gaussian diffusion","venue":null,"work_id":"59855fab-573d-4ce5-9a03-a6cc7e169bfc","year":2024},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.791062Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:39f555cb201849c86dc0a037c7f950da1f54815c39fbc57fd1da27d24016e6a2","observation_id":"a2eaefc3-4d6a-492f-ab2c-1382474a01f2","resolution":{"observed_at":"2026-08-10T23:07:41.815975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:41.800198Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"cefcb505-59df-4801-a126-3fb7dc1b65b7","year":2022},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.795046Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:ec9446bcc6742fca089b634bfa5b2ad9d61f947c1d80ad9f3b699c03b622ca01","observation_id":"494d4267-6c47-46cb-8dcd-2a2b28bff4f0","resolution":{"observed_at":"2026-08-10T23:07:41.804006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17994","last_updated":"2024-04-24T01:08:12Z","snapshot_observed_at":"2026-07-06T16:39:24.839340Z","submitted_at":"2023-10-27T09:06:43Z","title":"ZeroNVS: Zero-Shot 360-Degree View Synthesis from a Single Image","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17994","snapshot_observed_at":"2026-08-10T23:07:40.799151Z","title":"Ze- roNVS: Zero-shot 360-degree view synthesis from a single real image","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.799151Z"},"links":{"cited_paper":"/paper/2310.17994","citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:3939151f5b7e6fb8bc8937329ce472df57bd46bf75396504e725ede31d3916f8","observation_id":"5bed64a5-d45e-4b6b-8fef-1766646cd06f","resolution":{"observed_at":"2026-08-10T23:07:40.799151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:41.789978Z","title":"Graf: Generative radiance fields for 3d-aware im- age synthesis","venue":null,"work_id":"6a5987bb-1ea9-4cc9-9fcb-4886ab1281cd","year":2020},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.803378Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:f5fe755c8e4e08f56458862050cca1b8e3a2e6db06bb85ff34035eddf10fcb75","observation_id":"a4cdfa1c-4bba-4ae3-b392-3898a2f6630d","resolution":{"observed_at":"2026-08-10T23:07:41.793338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:41.779025Z","title":"Wildfusion: Learn- ing 3d-aware latent diffusion models in view space","venue":null,"work_id":"70710156-8bae-4953-8352-78ceb5a18897","year":2024},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.807556Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:2d22a5ddcf2fe75189782ebb4440af950d6f2b681120d6124020068d874c90f0","observation_id":"8b7759b6-7e62-4fa1-bada-bb5a1b357faa","resolution":{"observed_at":"2026-08-10T23:07:41.782884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01493","last_updated":"2025-06-07T07:24:16Z","snapshot_observed_at":"2026-08-11T14:35:29.432173Z","submitted_at":"2024-06-03T16:20:24Z","title":"Learning Temporally Consistent Video Depth from Video Diffusion Priors","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01493","snapshot_observed_at":"2026-08-10T23:07:40.811860Z","title":"Learning tem- porally consistent video depth from video diffusion priors","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.811860Z"},"links":{"cited_paper":"/paper/2406.01493","citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:a07a1bae9b1910415b92c93e3052553c7c04d47fd9cccf6942a698308e6389fd","observation_id":"fbc1eb73-e63e-4fe0-acf4-4bd6ccbff26a","resolution":{"observed_at":"2026-08-10T23:07:40.811860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15110","last_updated":"2023-10-23T17:18:59Z","snapshot_observed_at":"2026-08-11T13:07:00.745167Z","submitted_at":"2023-10-23T17:18:59Z","title":"Zero123++: a Single Image to Consistent Multi-view Diffusion Base Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15110","snapshot_observed_at":"2026-08-10T23:07:40.816018Z","title":"Zero123++: a single image to consis- tent multi-view diffusion base model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.816018Z"},"links":{"cited_paper":"/paper/2310.15110","citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:2d8e485984ca51ca03da1906227b890239ac1ee85499add20bf60d4f02ffe117","observation_id":"fdda738f-c077-4e0a-8c0a-1924fafc1f78","resolution":{"observed_at":"2026-08-10T23:07:40.816018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16512","last_updated":"2024-04-18T04:12:32Z","snapshot_observed_at":"2026-07-06T16:12:38.269310Z","submitted_at":"2023-08-31T07:49:06Z","title":"MVDream: Multi-view Diffusion for 3D Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16512","snapshot_observed_at":"2026-08-10T23:07:40.820754Z","title":"Mvdream: Multi-view diffusion for 3d generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.820754Z"},"links":{"cited_paper":"/paper/2308.16512","citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:1380779b2687bf46e98286679a1ef3c5cd9c3f42969dbbe968365cbb5f2d03fd","observation_id":"bf98ec61-5149-4a42-89fe-fbb1ef482f53","resolution":{"observed_at":"2026-08-10T23:07:40.820754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:41.767508Z","title":"Realmdreamer: Text-driven 3d scene genera- tion with inpainting and depth diffusion","venue":null,"work_id":"30083f78-b91e-4077-bb64-2d40c95ac300","year":2024},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.824978Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:ac6169eab258418195399c876274a454897256b13f915db2a9ea5e15aa8dfcd4","observation_id":"a850e494-9b64-48ba-b735-028e612ebca8","resolution":{"observed_at":"2026-08-10T23:07:41.771427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:40.829125Z","title":"Light field networks: Neu- ral scene representations with single-evaluation rendering","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.829125Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:d175b7c60ddf37747f97743fdf768a78931c3717c13fc4fb6834ed87dca43cc8","observation_id":"2551fb8f-6635-46e1-babd-de82719cb08d","resolution":{"observed_at":"2026-08-10T23:07:40.829125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-10T23:07:40.833031Z","title":"Score- based generative modeling through stochastic differential equations","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.833031Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:c5471a8158957b06126e003c228983d61ceed5604b2f20dbb1f60d2b4dd4beeb","observation_id":"9235d14b-cc87-4bff-bd0d-941054c69405","resolution":{"observed_at":"2026-08-10T23:07:40.833031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:41.749132Z","title":"Scalability in perception for autonomous driv- ing: Waymo open dataset","venue":null,"work_id":"1c6a220a-043f-4130-b717-8fd17ffbf100","year":2020},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.837342Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:c80d2c020214eea3e8d180d2d55872cb53b738fb3dc5875b005b718ced2d5c2c","observation_id":"b74bc85b-0f27-41f1-b572-a6acebd8d636","resolution":{"observed_at":"2026-08-10T23:07:41.752988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04928","last_updated":"2024-11-07T18:07:31Z","snapshot_observed_at":"2026-08-06T07:44:13.960536Z","submitted_at":"2024-11-07T18:07:31Z","title":"DimensionX: Create Any 3D and 4D Scenes from a Single Image with Controllable Video Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04928","snapshot_observed_at":"2026-08-10T23:07:40.841180Z","title":"Dimensionx: Create any 3d and 4d scenes from a single image with con- trollable video diffusion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.841180Z"},"links":{"cited_paper":"/paper/2411.04928","citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:161b69553502b13df9f0a60a9aa703542454a7932eccb49d6909dfb0c3afdc80","observation_id":"7a2e3620-c47a-400b-ad92-88cef75d2d44","resolution":{"observed_at":"2026-08-10T23:07:40.841180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:40.845552Z","title":"Flash3d: Feed-forward gener- alisable 3d scene reconstruction from a single image.arxiv,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.845552Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:0d02c57cd445cb21be41bf085ddfebab406b9cc3ea8d4bc4796e3ca5533ea529","observation_id":"025e73cc-5476-4d24-8db1-70fbcb1983d2","resolution":{"observed_at":"2026-08-10T23:07:40.845552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16653","last_updated":"2024-03-29T08:39:23Z","snapshot_observed_at":"2026-07-06T16:25:05.493379Z","submitted_at":"2023-09-28T17:55:05Z","title":"DreamGaussian: Generative Gaussian Splatting for Efficient 3D Content Creation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16653","snapshot_observed_at":"2026-08-10T23:07:40.849217Z","title":"Dreamgaussian: Generative gaussian splat- ting for efficient 3d content creation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.849217Z"},"links":{"cited_paper":"/paper/2309.16653","citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:c1de16532265ccc62dc17985c842e8e4fbd2ea0f1798f68386a6eedac8679101","observation_id":"1fb7f174-7d4b-43a0-aa84-b1bed93ad0ff","resolution":{"observed_at":"2026-08-10T23:07:40.849217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05054","last_updated":"2024-02-07T17:57:03Z","snapshot_observed_at":"2026-08-12T02:54:41.241582Z","submitted_at":"2024-02-07T17:57:03Z","title":"LGM: Large Multi-View Gaussian Model for High-Resolution 3D Content Creation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05054","snapshot_observed_at":"2026-08-10T23:07:40.853277Z","title":"Lgm: Large multi- view gaussian model for high-resolution 3d content cre- ation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.853277Z"},"links":{"cited_paper":"/paper/2402.05054","citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:b49c9b6297248bca122457cc2698b1704af91da68ab407ee722ee3bec8a3ccee","observation_id":"86490267-368c-4475-b340-5c2d5a6d01af","resolution":{"observed_at":"2026-08-10T23:07:40.853277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:41.730603Z","title":"A connection between score matching and denoising autoencoders","venue":null,"work_id":"6839f837-cfaa-45c5-865d-aafbda7dc150","year":2011},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.857710Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:ce087b86526771f0f27495c45414dcece22f86b8c0252ae18ed9bf63a6c36917","observation_id":"835b1701-fe41-407d-bed0-1dc4a2426599","resolution":{"observed_at":"2026-08-10T23:07:41.734538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:41.718447Z","title":"Geco: Generative image-to-3d within a sec- ond","venue":null,"work_id":"f8f44bf0-9d64-4619-b0d5-b23e88e97a75","year":2024},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.862658Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:fa4f6720abf62325f8fba5a1416997900842b91491af7fd862b5bc4e31b97950","observation_id":"0a491062-f72e-4dce-bfc4-996136ad2be1","resolution":{"observed_at":"2026-08-10T23:07:41.723013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.00774","last_updated":"2022-12-01T18:56:37Z","snapshot_observed_at":"2026-08-04T08:57:29.660087Z","submitted_at":"2022-12-01T18:56:37Z","title":"Score Jacobian Chaining: Lifting Pretrained 2D Diffusion Models for 3D Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.00774","snapshot_observed_at":"2026-08-10T23:07:40.866687Z","title":"Yeh, and Greg Shakhnarovich","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.866687Z"},"links":{"cited_paper":"/paper/2212.00774","citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:b6a2dda6b5797b417366fe4b442f26f14e031cbe63434f398d7af26ac81450b7","observation_id":"6ca50ff0-78ca-47a1-87dc-fa85091a29ae","resolution":{"observed_at":"2026-08-10T23:07:40.866687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16892","last_updated":"2024-10-22T10:55:59Z","snapshot_observed_at":"2026-08-01T14:31:01.419126Z","submitted_at":"2024-10-22T10:55:59Z","title":"VistaDream: Sampling multiview consistent images for single-view scene reconstruction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16892","snapshot_observed_at":"2026-08-10T23:07:40.870837Z","title":"Vistadream: Sampling multi- view consistent images for single-view scene reconstruc- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.870837Z"},"links":{"cited_paper":"/paper/2410.16892","citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:a91aa7286d42b7e50ba61c983fefc8f392515f96e45c843cc6aba6c23c1357c1","observation_id":"b8d87086-ce29-4a3a-813e-b866c303e52b","resolution":{"observed_at":"2026-08-10T23:07:40.870837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:41.705882Z","title":"Barron, Ricardo Martin-Brualla, Noah Snavely, and Thomas Funkhouser","venue":null,"work_id":"fd6e2f47-8b7b-4280-8eef-eb5216c0464e","year":2021},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.874753Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:f934d679ca7fb60e08eb5ebb626d1e7993977a133cff2ee1c5a3ad15b1ff1422","observation_id":"2cc65b1c-3b31-4007-a957-d7f54bbba5f7","resolution":{"observed_at":"2026-08-10T23:07:41.710261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:41.693356Z","title":"Dust3r: Geometric 3d vision made easy","venue":null,"work_id":"2818ab6e-b714-4c62-92d7-65ab24c43858","year":2024},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.878926Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:da306c996453014eac25e8ccef1ea27f1ecb0c69be63706dac763d26dd4530be","observation_id":"de9b8270-2553-41c0-b0b2-c8395d6fddac","resolution":{"observed_at":"2026-08-10T23:07:41.697897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:41.681035Z","title":"Tartanair: A dataset to push the limits of visual slam","venue":null,"work_id":"147c0988-fa6b-402a-91a9-723a9e92a5eb","year":2020},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.882610Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:8e33392b6fe317b29b8b74abafcadbfb33957adb56e0bf5cd1b53f545a927683","observation_id":"dc5bc55c-fc1a-4555-b65b-ac360d460056","resolution":{"observed_at":"2026-08-10T23:07:41.685194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:41.667790Z","title":"Image quality assessment: from error visibility to structural similarity","venue":null,"work_id":"63065d54-8fa6-417d-97aa-7ac4f0cd4cc8","year":2004},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.886290Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:2f6fed02f152476185f65c1bc2c7ab746dd8dd41b5e405681bb029a56a0f1f7b","observation_id":"5ba4bcb2-29fd-4c0f-877d-50dae4b0f234","resolution":{"observed_at":"2026-08-10T23:07:41.672637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:41.654419Z","title":"Prolificdreamer: High- fidelity and diverse text-to-3d generation with variational score distillation","venue":null,"work_id":"13bb06ce-5fd5-4480-b8d3-bd1a0d461116","year":2023},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.889963Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:4016dbf120edd6e7b3c1e4c3595e79882f0fd9d7b1e21e8e689dea6f77fa0644","observation_id":"b25c8a43-8ae9-4b68-979d-95642a315304","resolution":{"observed_at":"2026-08-10T23:07:41.659697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:40.893794Z","title":"Motionctrl: A unified and flexible motion controller for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.893794Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:4b23c38847076b40a1fe215af7e882f6b2cbf7a37e6ed0ab4ee34ce9b9ed8077","observation_id":"1574fb3d-41f8-4b03-a27d-3c52cf0ee710","resolution":{"observed_at":"2026-08-10T23:07:40.893794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:41.634589Z","title":"latentsplat: Autoencoding variational gaussians for fast generalizable 3d reconstruction","venue":null,"work_id":"3e09af98-d4f5-4029-8227-1f9d125a4a4f","year":null},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.897331Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:daccf19d17cc82f637537f5136788eaba9874960a01a014028c90ad1955d99bd","observation_id":"e1463fa8-62d8-458b-9173-043933034363","resolution":{"observed_at":"2026-08-10T23:07:41.638864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15980","last_updated":"2023-12-26T10:15:28Z","snapshot_observed_at":"2026-08-12T08:49:44.063108Z","submitted_at":"2023-12-26T10:15:28Z","title":"HarmonyView: Harmonizing Consistency and Diversity in One-Image-to-3D","version":1},"cited_work":{"arxiv_id":"2312.15980","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.15980","snapshot_observed_at":"2026-08-10T23:07:41.133662Z","title":"HarmonyView: Harmonizing Consistency and Diversity in One-Image-to-3D","venue":"cs.CV","work_id":"35a198e7-a831-4412-8a1d-de7268887f30","year":2023},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.901067Z"},"links":{"cited_paper":"/paper/2312.15980","citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:3c562160e21ec59f5942337dfe088d11cce311a775d27ff82e3e6d7713b4a325","observation_id":"3de8071b-d936-4372-8edc-91c8d4a7f6b7","resolution":{"observed_at":"2026-08-10T23:07:41.139917Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:41.622406Z","title":"Srinivasan, Dor Verbin, Jonathan T","venue":null,"work_id":"d4a0114b-5295-4fb3-93e5-178710c1b662","year":2023},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.905276Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:692ee54a8ad2caaf9752eb941256c9a00cb3f71a715d7de4b17670504c00d14f","observation_id":"77084c1a-7cbe-420e-bb04-990003082f70","resolution":{"observed_at":"2026-08-10T23:07:41.626845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14832","last_updated":"2024-06-01T16:18:53Z","snapshot_observed_at":"2026-08-11T20:40:42.530282Z","submitted_at":"2024-05-23T17:49:37Z","title":"Direct3D: Scalable Image-to-3D Generation via 3D Latent Diffusion Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14832","snapshot_observed_at":"2026-08-10T23:07:40.908957Z","title":"Direct3d: Scalable image-to-3d generation via 3d latent diffusion transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.908957Z"},"links":{"cited_paper":"/paper/2405.14832","citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:8fd0c6bfb6eb6ced557082739aa5f58a9739ababa23618fe995eb2cb57b44b9d","observation_id":"98e7e99e-ac5e-4c4b-bed5-1659d0ee937a","resolution":{"observed_at":"2026-08-10T23:07:40.908957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:41.610750Z","title":"Lrm-zero: Training large reconstruction models with syn- thesized data","venue":null,"work_id":"7203df17-ebfa-464f-81c4-72043674db66","year":2024},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.912795Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:e458cad567d0564364d1b08547296514e61ea444c36e35b3d5ae949e382bae9f","observation_id":"9e8b5439-10c6-4cf7-954d-87b28a31fd03","resolution":{"observed_at":"2026-08-10T23:07:41.614887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13862","last_updated":"2025-03-25T15:20:52Z","snapshot_observed_at":"2026-08-12T06:04:19.205401Z","submitted_at":"2024-10-17T17:59:58Z","title":"DepthSplat: Connecting Gaussian Splatting and Depth","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13862","snapshot_observed_at":"2026-08-10T23:07:40.916253Z","title":"Depthsplat: Connecting gaussian splatting and depth","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.916253Z"},"links":{"cited_paper":"/paper/2410.13862","citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:883f9a00bbcb46c531177abbbbdd7312c7e0d805bcdf374643ed8c38c0218c27","observation_id":"94666a81-3226-4edd-aae1-68beabc12efe","resolution":{"observed_at":"2026-08-10T23:07:40.916253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:41.599870Z","title":"Discoscene: Spatially disentangled generative radiance fields for controllable 3d-aware scene synthesis","venue":null,"work_id":"f89cefc9-2c7f-48c1-8975-0cf7d6c60c15","year":2023},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.920043Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:fe137681e9158450d5085dbdece552cdbf88f1ced95a27bf79d53df1aa0fce7d","observation_id":"e0ce6dda-7252-461a-b92b-55ac94635eb3","resolution":{"observed_at":"2026-08-10T23:07:41.603339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09217","last_updated":"2023-11-15T18:58:41Z","snapshot_observed_at":"2026-08-10T13:40:04.596103Z","submitted_at":"2023-11-15T18:58:41Z","title":"DMV3D: Denoising Multi-View Diffusion using 3D Large Reconstruction Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09217","snapshot_observed_at":"2026-08-10T23:07:40.923682Z","title":"Dmv3d: Denoising multi-view diffusion using 3d large reconstruction model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.923682Z"},"links":{"cited_paper":"/paper/2311.09217","citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:0d49a7817786372c034a497c0fd10acee4f0e20fc5cb2237f7c922313d9f6f4a","observation_id":"693e80e9-dd4a-452b-9c38-812be7131ea6","resolution":{"observed_at":"2026-08-10T23:07:40.923682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09414","last_updated":"2024-10-20T11:24:09Z","snapshot_observed_at":"2026-07-06T18:30:32.982860Z","submitted_at":"2024-06-13T17:59:56Z","title":"Depth Anything V2","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09414","snapshot_observed_at":"2026-08-10T23:07:40.927512Z","title":"Depth any- thing v2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.927512Z"},"links":{"cited_paper":"/paper/2406.09414","citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:63fc076bf075717f0323cb9e1d746a174cb18782b590f962e76db75d6296f2f8","observation_id":"819c59ba-a5f8-498d-b405-20a06cefa007","resolution":{"observed_at":"2026-08-10T23:07:40.927512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:41.589837Z","title":"Urbangiraffe: Representing urban scenes as compositional generative neural feature fields","venue":null,"work_id":"932de34e-a8e0-4232-b498-f3845c5ead2b","year":2023},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.931364Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:6366695fcccec002e150c1bfc1f66a49381127096c4ecdf01b5213917f9552bc","observation_id":"73147df8-36aa-4f80-8597-dcd54f7c957c","resolution":{"observed_at":"2026-08-10T23:07:41.593109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:41.579222Z","title":"Mathematical supple- ment for the gsplat library, 2023","venue":null,"work_id":"f56c36ce-51f4-4084-86de-e3bdea99faf9","year":2023},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.935024Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:5cde09960ed9586d84e843e06396e8d62aa0505ae325ee4b3b2c2b4e63a7469f","observation_id":"addbef88-290b-4b51-b028-6bf39d4a15ce","resolution":{"observed_at":"2026-08-10T23:07:41.582902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:41.567913Z","title":"Gaussiandreamer: Fast generation from text to 3d gaussians by bridging 2d and 3d diffusion models","venue":null,"work_id":"114b95b9-8eba-4672-85f9-d01ca1c57601","year":2024},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.938714Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:4f87772fa0972c3acb4ebedf3214ee7a87e30be5e4b2f950ebbbc932b070d394","observation_id":"ef6304e9-0828-498c-9ee7-4aa0c99f5c5d","resolution":{"observed_at":"2026-08-10T23:07:41.571990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14621","last_updated":"2024-03-21T17:59:34Z","snapshot_observed_at":"2026-08-07T23:00:35.209050Z","submitted_at":"2024-03-21T17:59:34Z","title":"GRM: Large Gaussian Reconstruction Model for Efficient 3D Reconstruction and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14621","snapshot_observed_at":"2026-08-10T23:07:40.942427Z","title":"Grm: Large gaussian reconstruction model for efficient 3d reconstruction and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.942427Z"},"links":{"cited_paper":"/paper/2403.14621","citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:9badb3c9f877ef5a197c9d1e7d49cb2e39afaaa8da27f2542675d986fcd6c3eb","observation_id":"3fc4e08b-9fcb-40ef-8a64-6b1dca16774d","resolution":{"observed_at":"2026-08-10T23:07:40.942427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15364","last_updated":"2025-04-02T06:16:43Z","snapshot_observed_at":"2026-08-10T12:11:21.063521Z","submitted_at":"2024-05-24T08:56:19Z","title":"NVS-Solver: Video Diffusion Model as Zero-Shot Novel View Synthesizer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15364","snapshot_observed_at":"2026-08-10T23:07:40.946433Z","title":"Nvs- solver: Video diffusion model as zero-shot novel view syn- thesizer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.946433Z"},"links":{"cited_paper":"/paper/2405.15364","citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:7d87b6b0105fc9ab2def782d78657dfbf64c87c2885bf2201574f44e49f23cbc","observation_id":"a78323ae-5987-4052-af15-7300e17f6a3a","resolution":{"observed_at":"2026-08-10T23:07:40.946433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09394","last_updated":"2025-03-25T01:00:11Z","snapshot_observed_at":"2026-08-10T14:48:01.138258Z","submitted_at":"2024-06-13T17:59:10Z","title":"WonderWorld: Interactive 3D Scene Generation from a Single Image","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09394","snapshot_observed_at":"2026-08-10T23:07:40.950448Z","title":"Freeman, and Jiajun Wu","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.950448Z"},"links":{"cited_paper":"/paper/2406.09394","citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:ee0cafb4045e3418b6990c68d13fcfecb1535525676ad3785be90229e4c49458","observation_id":"5cfbb8a3-47cc-488c-ae56-29c070278258","resolution":{"observed_at":"2026-08-10T23:07:40.950448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:41.555279Z","title":"Freeman, Forrester Cole, Deqing Sun, Noah Snavely, Jiajun Wu, and Charles Her- rmann","venue":null,"work_id":"add20344-0d14-4ebf-bcc8-8e77b66adb5e","year":2024},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.954578Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:fe8c5a81253395c9c656596fcf47c65f3d00f03871a35f69937244db8b47abca","observation_id":"51457611-e767-4556-90b7-6d5d8ec19d2b","resolution":{"observed_at":"2026-08-10T23:07:41.559525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02048","last_updated":"2024-09-03T16:53:19Z","snapshot_observed_at":"2026-07-06T19:09:55.393720Z","submitted_at":"2024-09-03T16:53:19Z","title":"ViewCrafter: Taming Video Diffusion Models for High-fidelity Novel View Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02048","snapshot_observed_at":"2026-08-10T23:07:40.958428Z","title":"Viewcrafter: Taming video diffusion models for high-fidelity novel view synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.958428Z"},"links":{"cited_paper":"/paper/2409.02048","citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:afc924b15004e5597878ee1eda0e21c396f01eeebbfb18e47ce2fd8448fec258","observation_id":"dbea1837-e33a-4c59-974e-561fc90ae4d9","resolution":{"observed_at":"2026-08-10T23:07:40.958428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:07:41.543643Z","title":"Mvimgnet: A large-scale dataset of multi-view images","venue":null,"work_id":"74bf8dd4-01ae-4739-9905-1636eede89a1","year":2023},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.962204Z"},"links":{"citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:de0b7da3d05def59b9e9fd47bfc1200a80c0438610e09467c322b07cb75ffb75","observation_id":"0ec17a31-b049-4ee3-9e55-898a8b6f294b","resolution":{"observed_at":"2026-08-10T23:07:41.547774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19655","last_updated":"2024-10-31T03:33:30Z","snapshot_observed_at":"2026-08-07T01:29:57.643382Z","submitted_at":"2024-03-28T17:59:50Z","title":"GaussianCube: A Structured and Explicit Radiance Representation for 3D Generative Modeling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19655","snapshot_observed_at":"2026-08-10T23:07:40.965870Z","title":"Gaussiancube: Structuring gaussian splatting using op- timal transport for 3d generative modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.965870Z"},"links":{"cited_paper":"/paper/2403.19655","citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:bc9e09fb72bfdd2e586ba08f3f6fb7062bd764aa3cd8261cfe2f2a8e080f5d2c","observation_id":"9dbda924-c67f-4f55-bb54-2299275afdf9","resolution":{"observed_at":"2026-08-10T23:07:40.965870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":71,"verified_exact":1,"verified_fuzzy":28},"total_outbound_references":107},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 100 of 107 outbound references and 5 inbound Pith citation observations for arXiv:2412.21117."}