{"as_of":"2026-08-15T05:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d0500c1592ca99a74c63d7817972087316be4d174df2057eb11afb2d9554afb5","coverage":[{"denominator":74,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":74,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T15:06:09.205961Z","state":"measured"},{"denominator":74,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":74,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.14715/citation-record","integrity":"/paper/2411.14715/integrity","json":"/paper/2411.14715/citation-record.json","paper":"/paper/2411.14715"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.01166","last_updated":"2024-03-19T08:22:42Z","snapshot_observed_at":"2026-08-14T00:53:03.031256Z","submitted_at":"2024-02-02T06:20:44Z","title":"A Comprehensive Survey on 3D Content Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01166","snapshot_observed_at":"2026-08-12T15:06:08.869166Z","title":"A comprehensive survey on 3d content generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:08.869166Z"},"links":{"cited_paper":"/paper/2402.01166","citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:144409647e2d70e7c1bc7715ed091c7f93860b19fb0cc5ac7ad8aa506b4bdc92","observation_id":"58a48177-60ee-4fdc-a9b5-725dc1b10bd4","resolution":{"observed_at":"2026-08-12T15:06:08.869166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16512","last_updated":"2024-04-18T04:12:32Z","snapshot_observed_at":"2026-08-14T19:33:54.756989Z","submitted_at":"2023-08-31T07:49:06Z","title":"MVDream: Multi-view Diffusion for 3D Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16512","snapshot_observed_at":"2026-08-12T15:06:08.874821Z","title":"Mvdream: Multi- view diffusion for 3d generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:08.874821Z"},"links":{"cited_paper":"/paper/2308.16512","citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:69ac3358477798b638a127e78b7bc546c84765537c8d365db60756cc6c9c2137","observation_id":"ab03ce1c-0c6e-4f5b-9e17-ecf0049af528","resolution":{"observed_at":"2026-08-12T15:06:08.874821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16818","last_updated":"2023-10-26T06:54:22Z","snapshot_observed_at":"2026-08-14T11:12:41.791244Z","submitted_at":"2023-10-25T17:50:10Z","title":"DreamCraft3D: Hierarchical 3D Generation with Bootstrapped Diffusion Prior","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16818","snapshot_observed_at":"2026-08-12T15:06:08.879990Z","title":"Dreamcraft3d: Hierarchical 3d generation with bootstrapped diffusion prior,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:08.879990Z"},"links":{"cited_paper":"/paper/2310.16818","citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:c9ab207c3effe18a06fc0c8ae5eb2fec89a7b01fe2d3ac8e35f81d29d761747e","observation_id":"53913581-a70d-492d-ba92-411094513296","resolution":{"observed_at":"2026-08-12T15:06:08.879990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05034","last_updated":"2024-03-08T04:25:29Z","snapshot_observed_at":"2026-08-13T00:59:35.990568Z","submitted_at":"2024-03-08T04:25:29Z","title":"CRM: Single Image to 3D Textured Mesh with Convolutional Reconstruction Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05034","snapshot_observed_at":"2026-08-12T15:06:08.885295Z","title":"Crm: Single image to 3d textured mesh with convolutional reconstruction model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:08.885295Z"},"links":{"cited_paper":"/paper/2403.05034","citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:823c25eb89acb306c37d875eb2314b239dc476cb5c0336778fee44da32e0c359","observation_id":"12200ea4-2b8b-4f1c-a655-ef1cb38aeb84","resolution":{"observed_at":"2026-08-12T15:06:08.885295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:08.890661Z","title":"Scalable diffusion models with transformers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:08.890661Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:abca6ab4838b9123a4b9e892c49185d77cd44a95f9cda5bf917e2051fd452ffd","observation_id":"17bbf6d2-9bdd-4f05-a353-e177767ba10c","resolution":{"observed_at":"2026-08-12T15:06:08.890661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:08.895370Z","title":"U-net: Convolutional networks for biomedical image segmentation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:08.895370Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:0b853e25dffd39b3e50374f66df198f2559505b50349d195313e268e63448b65","observation_id":"61fc271f-8f2d-437c-b16b-4651d3bb08b3","resolution":{"observed_at":"2026-08-12T15:06:08.895370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-12T15:06:08.900106Z","title":"Hierarchical text-conditional image generation with clip latents,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:08.900106Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:de1ea7529471ce20008ffd2744f37daa82c989c03c7b1014bd38f183ac39d6cf","observation_id":"620e5ff1-740d-4c29-9519-64e408ceb3cd","resolution":{"observed_at":"2026-08-12T15:06:08.900106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:08.904651Z","title":"High- resolution image synthesis with latent diffusion models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:08.904651Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:6232abe7cd5570b1e4d01e5cfae9a9cd5d11553a065673bc9db93f89b5a14d15","observation_id":"f76566cb-5053-4abd-a366-4928b4792962","resolution":{"observed_at":"2026-08-12T15:06:08.904651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:10.183031Z","title":"Fantasia3d: Disentangling geometry and appearance for high-quality text-to-3d content creation,","venue":null,"work_id":"e8881e7c-f7c5-4387-b75c-8808f6d09528","year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:08.909154Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:3f885fc3851051e0721d325a02353e5c513fe543b95c0136f4eb5e3a467a41ae","observation_id":"f97915fa-8ab2-4c8c-9415-1a6793b0dd37","resolution":{"observed_at":"2026-08-12T15:06:10.188284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:10.166837Z","title":"Score jacobian chaining: Lifting pretrained 2d diffusion models for 3d generation,","venue":null,"work_id":"a5e57834-72ef-4ff7-b28c-2d2dad8dd2f3","year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:08.913956Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:b8bc7112fe05e88c0c0a2592f10b870fed015cf14dff905e4aa43bde6a028c01","observation_id":"4b764b39-6668-41aa-8e23-6dc37b695d8c","resolution":{"observed_at":"2026-08-12T15:06:10.172404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:10.151693Z","title":"Consistent3d: Towards consistent high-fidelity text-to-3d generation with deterministic sampling prior,","venue":null,"work_id":"a7e85f32-0c33-47a6-aec0-44bf8e3511d2","year":2024},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:08.918983Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:a8704ce38839fc5b0fc8734c13c1980ddc49a2f74f875ea8908e74d4e18202b7","observation_id":"b4f8d8df-8334-450c-98b3-f36758c75bda","resolution":{"observed_at":"2026-08-12T15:06:10.156598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:08.923377Z","title":"Score distillation sampling with learned manifold corrective,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:08.923377Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:cacb149d313e94641dfffef9e6f921777ce663fb403f0c22ab60e8199f9af5a6","observation_id":"0795ee22-0282-4593-956c-5be708aa389c","resolution":{"observed_at":"2026-08-12T15:06:08.923377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00909","last_updated":"2024-03-29T18:04:37Z","snapshot_observed_at":"2026-08-14T06:07:12.938982Z","submitted_at":"2023-12-31T22:47:06Z","title":"Taming Mode Collapse in Score Distillation for Text-to-3D Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00909","snapshot_observed_at":"2026-08-12T15:06:08.927827Z","title":"Taming mode collapse in score distillation for text-to-3d generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:08.927827Z"},"links":{"cited_paper":"/paper/2401.00909","citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:55921ace9e87f29c334b644bfddce0e068d9a79403433b2127be7dcddf0ec04f","observation_id":"ccef9134-5c18-47b1-a5ba-466e9707076e","resolution":{"observed_at":"2026-08-12T15:06:08.927827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:08.932799Z","title":"Prolific- dreamer: High-fidelity and diverse text-to-3d generation with variational score distillation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:08.932799Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:d67eca6a79cd34b947577fcbad27f7bfa25515fa1df91a599e02a256f4108fe6","observation_id":"69cf0a3c-c85f-4c2a-aff1-6f56c6d6075b","resolution":{"observed_at":"2026-08-12T15:06:08.932799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:08.937467Z","title":"Text2mesh: Text-driven neural stylization for meshes,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:08.937467Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:07fac86b9533299b8dca48fd959332f8a00eab3306e20c73e372cbdaf3aad6ea","observation_id":"f8e4a336-e408-42c7-81ad-1da07bd3d4e9","resolution":{"observed_at":"2026-08-12T15:06:08.937467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:10.107329Z","title":"Cad: Photorealistic 3d generation via adversarial dis- tillation,","venue":null,"work_id":"78c59176-6a70-4a31-b46b-03747ca3535d","year":2024},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:08.941969Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:f55dfa18a7eab0a78c431d8a8ac5ff681ddd597c9920926d61a6beb948ba8e01","observation_id":"325a509d-8d1c-4246-9f42-31754ffbae7b","resolution":{"observed_at":"2026-08-12T15:06:10.112681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16653","last_updated":"2024-03-29T08:39:23Z","snapshot_observed_at":"2026-07-06T16:25:05.493379Z","submitted_at":"2023-09-28T17:55:05Z","title":"DreamGaussian: Generative Gaussian Splatting for Efficient 3D Content Creation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16653","snapshot_observed_at":"2026-08-12T15:06:08.946191Z","title":"Dreamgaussian: Generative gaussian splatting for efficient 3d content creation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:08.946191Z"},"links":{"cited_paper":"/paper/2309.16653","citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:5ee255f4e6d79790de64edb477d227eb4c04f62cd65584a66f712f459d00d7fa","observation_id":"25272064-4dff-4f97-8c82-69108bc4d387","resolution":{"observed_at":"2026-08-12T15:06:08.946191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:08.950956Z","title":"Make-it-3d: High-fidelity 3d creation from a single image with diffu- sion prior,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:08.950956Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:4676761b98d8300ed1807720fc173218a0832d3f4c0748688086bb9ddcb3a3cb","observation_id":"c7f2fbb1-06e5-4912-8725-19b4e7dafbb6","resolution":{"observed_at":"2026-08-12T15:06:08.950956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:08.955796Z","title":"Realfusion: 360deg reconstruction of any object from a single image,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:08.955796Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:0191cfa4deaa4136f0b6cd81a98b1ba6cb12752a87db1a0494fd756ec2d41bff","observation_id":"b2bb9bbb-7f2b-4f0e-b993-bdd9af1513a1","resolution":{"observed_at":"2026-08-12T15:06:08.955796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:08.960132Z","title":"Imagebind: One embedding space to bind them all,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:08.960132Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:a68a2d9f14ecf23d8600485bdede029d2a9e785b550a7280aa7e3af1de77bf54","observation_id":"5fdb51db-88ad-4a3e-bb6e-2ea921db3796","resolution":{"observed_at":"2026-08-12T15:06:08.960132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:10.062654Z","title":"Any-to-any generation via composable diffusion,","venue":null,"work_id":"8af14207-01a9-4a9d-b504-cb9ceb30b65d","year":2024},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:08.964619Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:6b951dcd8172d61648347d46b4a5fb52af0df713158cba9f8ad35825eb8287bd","observation_id":"e3e7c479-c0d2-4dae-8828-aafe5bf81840","resolution":{"observed_at":"2026-08-12T15:06:10.067350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:10.046552Z","title":"Dreamfusion: Text- to-3d using 2d diffusion,","venue":null,"work_id":"46570cfc-3c91-4a81-8af0-53f99e4e8343","year":2022},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:08.969465Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:5478a399e163342093eeccdad9f8009f56df17de2b3c0dd9dd6089ed503fdab5","observation_id":"c8402f07-2dc1-4427-b397-75901738a4e1","resolution":{"observed_at":"2026-08-12T15:06:10.051830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:08.973776Z","title":"Zero-1-to-3: Zero-shot one image to 3d object,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:08.973776Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:c08c66d1e8e45802eca2da498e0de572490bfcd3fd5719e4649fefd1329d4410","observation_id":"f1a2d67b-b25a-4a63-90e5-9a02c3543115","resolution":{"observed_at":"2026-08-12T15:06:08.973776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:08.978522Z","title":"Mip-nerf: A multiscale representation for anti- aliasing neural radiance fields,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:08.978522Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:b6b0e53239a21f3810814542866fed4cb95b0853f4b4148b8535435b60920dd1","observation_id":"8dad3f68-d79e-478a-9369-ab314585df38","resolution":{"observed_at":"2026-08-12T15:06:08.978522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:08.982694Z","title":"Instant neural graphics primitives with a multiresolution hash encoding,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:08.982694Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:f1046e6c4f8aef1308ce3dd121ac9aaebf5dc58792c938dbf79dc330d24727aa","observation_id":"1ea507c1-f81b-471a-962c-4a8e3753c7ef","resolution":{"observed_at":"2026-08-12T15:06:08.982694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.999635Z","title":"Deep marching tetrahedra: a hybrid representation for high-resolution 3d shape synthe- sis,","venue":null,"work_id":"ec849efd-6786-448c-b69e-76752f23c0ad","year":2021},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:08.986890Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:24882df76a081972f9bcb9d652ca29d00aec03820d1264c0fb1fe098b2e200c5","observation_id":"8edee7e6-22fa-4a4a-b252-dad2923d0e82","resolution":{"observed_at":"2026-08-12T15:06:10.005037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:08.991441Z","title":"Diffusion models: A comprehensive survey of methods and applications,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:08.991441Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:1077ddf94d6669d8143ad3de4f7890b8ae8f5d5c37872e189ebe8864d36996f7","observation_id":"f7b5b759-ce9c-40ce-a036-366ed4553002","resolution":{"observed_at":"2026-08-12T15:06:08.991441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-12T15:06:08.995743Z","title":"Score-based generative modeling through stochastic differ- ential equations,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:08.995743Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:9ea8a79f76a979e51128d34d7ce6b2b0c61152c3a55ed4dea37d4d1464a15669","observation_id":"26f0b8c1-cdb7-4c16-8e8d-f4470e745cb3","resolution":{"observed_at":"2026-08-12T15:06:08.995743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.000129Z","title":"Denoising diffusion probabilistic models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.000129Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:b3e4c52038ee483b7c7a4b8cc9c48240bb4ffb2198e9aa42ea584745a3457753","observation_id":"d15f644d-4a79-416d-8021-b2b826610ef0","resolution":{"observed_at":"2026-08-12T15:06:09.000129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.004704Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.004704Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:c65197f9a0e835bec7cbe469fc96037a9f835606cf3731cbf8c121c298e4536a","observation_id":"c1627c15-bda4-46ff-af79-dc587a4ce8b7","resolution":{"observed_at":"2026-08-12T15:06:09.004704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.953660Z","title":"Vector quantized diffusion model for text-to-image synthesis,","venue":null,"work_id":"af999670-f8f2-4950-844b-2bd74d3b0586","year":2022},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.008713Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:099bc42ec0893162f78e28989e718bec699b9d8b5965fee9f716fceb7e2db662","observation_id":"c752e858-f635-414a-8e67-cda7edfef26b","resolution":{"observed_at":"2026-08-12T15:06:09.959853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.013153Z","title":"Diffusion models beat gans on image synthesis,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.013153Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:df50f3f3b05024f8f3c2893507be96764cf3661cc550220e133340d78260dc31","observation_id":"7ea2d145-5880-468b-87c6-958f42bd2fde","resolution":{"observed_at":"2026-08-12T15:06:09.013153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.928721Z","title":"Improving diffusion-based image synthesis with context pre- diction,","venue":null,"work_id":"af4f68d1-77b7-4679-a3dd-ef4080b1c250","year":2024},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.017599Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:d6c606ee7f034b73c62745bce47711d5b589977715e133bfa487fc6809c34dbe","observation_id":"b60c36b8-a853-4783-861a-7a0944dabc67","resolution":{"observed_at":"2026-08-12T15:06:09.933664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.913489Z","title":"Shifted diffusion for text-to-image generation,","venue":null,"work_id":"d6e71ac5-89e2-4430-badf-212ea8fab627","year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.022255Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:eb7a58c9a7237abe5016a5f4e3835ca880dc962874b590ca53dc78f848b2bd4c","observation_id":"a0d02342-8316-442f-8a2d-ba0a69d5d526","resolution":{"observed_at":"2026-08-12T15:06:09.918543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.027051Z","title":"Text2video-zero: Text-to-image diffusion models are zero-shot video generators,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.027051Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:506f02feefdab2dfb89e6430ee78fbf21995ac81e7db4f219ede4f2162e0eb47","observation_id":"91f627df-ae0e-4541-a448-a3415e41534e","resolution":{"observed_at":"2026-08-12T15:06:09.027051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.888254Z","title":"Videofusion: Decomposed diffusion models for high-quality video generation,","venue":null,"work_id":"0cea5d64-1d83-4771-831e-1556ed57a3b7","year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.032414Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:a0da09062fff8441bedcf391370338a8e324d587acb89e4df040a3fc13098621","observation_id":"76e529bc-9e94-47fe-9c0b-8ded0e7a27de","resolution":{"observed_at":"2026-08-12T15:06:09.893071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.037210Z","title":"Vidm: Video implicit diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.037210Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:50abd88b41acb06d5f6054b68cc572700f7894e583847d5386902bdb9f377df3","observation_id":"f62fb30d-c7dc-42a7-be9b-2f2feddca30b","resolution":{"observed_at":"2026-08-12T15:06:09.037210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15103","last_updated":"2023-09-27T03:51:52Z","snapshot_observed_at":"2026-08-14T11:04:59.421484Z","submitted_at":"2023-09-26T17:52:03Z","title":"LAVIE: High-Quality Video Generation with Cascaded Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15103","snapshot_observed_at":"2026-08-12T15:06:09.041883Z","title":"Lavie: High-quality video generation with cascaded latent diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.041883Z"},"links":{"cited_paper":"/paper/2309.15103","citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:0fda522aec7856d36db8dc2e184611fafc6fcc5176ed94ee69d83862b5ab16d5","observation_id":"402b17df-3908-41c7-a353-1bbe49809c2c","resolution":{"observed_at":"2026-08-12T15:06:09.041883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.862618Z","title":"Prodiff: Progressive fast diffusion model for high-quality text-to-speech,","venue":null,"work_id":"f32b08df-f4c3-4afb-91d0-b67be00b2666","year":2022},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.046471Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:5b957605aa9f9439f227ed39188e11eca1c1bec57cad724492815369761cd8e5","observation_id":"cbc742d2-1eef-4fd2-b7d4-148dec3d0f0a","resolution":{"observed_at":"2026-08-12T15:06:09.867485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.846763Z","title":"Taming diffusion models for audio-driven co-speech gesture generation,","venue":null,"work_id":"a3252175-02e0-4955-8acb-a6e21667584d","year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.050887Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:5c5bc2cbb6ae23b492abef3ee1e2b29b2bf89d5c5eb32e485369c1339a66da92","observation_id":"f53e03e5-aef3-4931-98b6-8cb45fd5232d","resolution":{"observed_at":"2026-08-12T15:06:09.851715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.055185Z","title":"Speech enhancement and dereverberation with diffusion-based genera- tive models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.055185Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:ebf985f271c58368db567e81bb00ced54e5cd9cfd9f5b1052bf09366e12a7be2","observation_id":"1c8bda65-74c7-4d6c-b79e-174173688c26","resolution":{"observed_at":"2026-08-12T15:06:09.055185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.821620Z","title":"Storm: A diffusion-based stochastic regeneration model for speech enhancement and dereverberation,","venue":null,"work_id":"04e78155-0e28-4f94-b5a2-ea8ea8f837b3","year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.059549Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:275fca5d2581ad36f1178549a336e79b67798b18178aa8f8e7e376105f8c23e4","observation_id":"c1009c3e-ef11-4e4d-a58d-d449c68cef03","resolution":{"observed_at":"2026-08-12T15:06:09.826556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17075","last_updated":"2024-06-13T17:59:14Z","snapshot_observed_at":"2026-08-13T05:40:14.722210Z","submitted_at":"2023-10-26T00:36:03Z","title":"HyperFields: Towards Zero-Shot Generation of NeRFs from Text","version":3},"cited_work":{"arxiv_id":"2310.17075","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.17075","snapshot_observed_at":"2026-08-12T15:06:09.361876Z","title":"HyperFields: Towards Zero-Shot Generation of NeRFs from Text","venue":"cs.CV","work_id":"f7ca0ddd-3316-4af4-bb42-e426dc09480a","year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.064123Z"},"links":{"cited_paper":"/paper/2310.17075","citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:a6bc8ccb8761ea43c3f66bceab322c18a70da98daab5c71a3aeae8e1ff632552","observation_id":"ffa2b3a8-f75f-4826-80b1-5a5436ff3713","resolution":{"observed_at":"2026-08-12T15:06:09.369297Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.805885Z","title":"Texfusion: Synthesiz- ing 3d textures with text-guided image diffusion models,","venue":null,"work_id":"5297f38e-41d9-40ef-a0e1-dd0c5421393d","year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.068827Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:6d86934d145522522398440a33b5433399cf7d462b71f474b6cfb87ec6d02ac5","observation_id":"4046219f-73da-4020-8c5c-9b4648149132","resolution":{"observed_at":"2026-08-12T15:06:09.810996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.072978Z","title":"Luciddreamer: Towards high-fidelity text-to-3d generation via interval score matching,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.072978Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:364116bf6949f63141875771fa3370e98886021a34bb761219e2d7aa26c44b89","observation_id":"96ec87b7-777f-414e-8707-6f16341013e7","resolution":{"observed_at":"2026-08-12T15:06:09.072978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.780947Z","title":"Scenetex: High-quality texture synthesis for indoor scenes via diffusion priors,","venue":null,"work_id":"ff7b15c0-d3e6-4abf-81fc-2aae89ac9e5f","year":2024},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.077126Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:8c3fed6f0c069154d01c13bdc0a25bd3c2707a7938dd7ea5b29b55310d32224d","observation_id":"c969aad8-aa71-4917-aaf1-439b7ece00dc","resolution":{"observed_at":"2026-08-12T15:06:09.785723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.081939Z","title":"High- resolution image synthesis with latent diffusion models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.081939Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:891aaff43ab7ca0173e40783e108a72bf4314543d0999374a7a35313dfa9b63d","observation_id":"152a28b7-d752-4fc1-9678-ea58cfdeb0b9","resolution":{"observed_at":"2026-08-12T15:06:09.081939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03453","last_updated":"2024-04-15T10:28:44Z","snapshot_observed_at":"2026-08-12T22:52:54.817720Z","submitted_at":"2023-09-07T02:28:04Z","title":"SyncDreamer: Generating Multiview-consistent Images from a Single-view Image","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.03453","snapshot_observed_at":"2026-08-12T15:06:09.086742Z","title":"Syncdreamer: Learning to generate multiview-consistent images from a single-view image,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.086742Z"},"links":{"cited_paper":"/paper/2309.03453","citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:2b6071812163ba13d0e7923bd835f9f521f5ae5b5d881680fef9d4b748c0202d","observation_id":"9c6ebb7f-ce0b-4c56-aee1-5138a6bc3ecd","resolution":{"observed_at":"2026-08-12T15:06:09.086742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.755852Z","title":"Objaverse: A universe of annotated 3d objects,","venue":null,"work_id":"984c7fd8-914b-4598-97ff-2ffb575e06bf","year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.091375Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:2a394905b297bc655acf9c95111cfb6dfdcbcf0b57694b407b6ff8bb515c30f8","observation_id":"a1758340-b61d-41f2-8a1f-7a3ab483c63f","resolution":{"observed_at":"2026-08-12T15:06:09.760556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.741359Z","title":"Objaverse-xl: A uni- verse of 10m+ 3d objects,","venue":null,"work_id":"e89f68a3-9000-4d6e-8326-ca048f39176e","year":2024},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.095751Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:519103788701c006af35529411de2cc55aa723b4a3343032b14bdde00b75c5f6","observation_id":"326f62a7-0b69-4885-9f52-31750f438126","resolution":{"observed_at":"2026-08-12T15:06:09.745915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.100545Z","title":"Omnivore: A single model for many visual modalities,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.100545Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:52a1873023af6f2af059f4ca0f58cf758ca15ddc3111726cbb25f83d1a7fbae6","observation_id":"c960da25-e218-4a06-b48b-62718270d6cc","resolution":{"observed_at":"2026-08-12T15:06:09.100545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.12993","last_updated":"2021-11-25T10:01:05Z","snapshot_observed_at":"2026-07-06T12:12:06.958305Z","submitted_at":"2021-11-25T10:01:05Z","title":"PolyViT: Co-training Vision Transformers on Images, Videos and Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.12993","snapshot_observed_at":"2026-08-12T15:06:09.105043Z","title":"Polyvit: Co-training vision transformers on images, videos and audio,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.105043Z"},"links":{"cited_paper":"/paper/2111.12993","citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:a6b5ced3ec7a269e5face8501311235f7038cd48636ae3889af7ac1b62d6d6a4","observation_id":"2ca5aaf4-4b5a-41ac-b0b2-5f6cc8611c7c","resolution":{"observed_at":"2026-08-12T15:06:09.105043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.716854Z","title":"Look, listen and learn,","venue":null,"work_id":"9784578a-0b94-4f5d-bf22-f8013088f21d","year":2017},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.109485Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:69829926d5ef641f9c66eb9411ed0494e106b70f49472d05eb08fcc15a41a5f1","observation_id":"d455fe45-28c2-4493-80df-62d3e04ce503","resolution":{"observed_at":"2026-08-12T15:06:09.721471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.702544Z","title":"Omnimae: Single model masked pretraining on images and videos,","venue":null,"work_id":"062ac418-fd13-4bd6-8113-dd79fb7cb4d6","year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.113934Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:6eaffb8a784cbb9aa02b4f6a85ddeeb4f138a06864e9a2a17b107141fc927fc1","observation_id":"66dd7062-c45f-4416-992a-93c83159a1cc","resolution":{"observed_at":"2026-08-12T15:06:09.707135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.687133Z","title":"Audio-visual instance discrimination with cross-modal agreement,","venue":null,"work_id":"4cc6f8bf-ba79-4e59-ae0a-43cb4353e9cc","year":2021},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.118401Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:40748046b9b434a4cf87f6a439ca82ceb535c22390e7560eb7695d3f8eb702f9","observation_id":"c2ff91f4-95fa-48f7-83a4-1192399cb610","resolution":{"observed_at":"2026-08-12T15:06:09.692449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.122829Z","title":"Contrastive multiview coding,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.122829Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:1a6a23b5c534ccf6a621d9191a00afd02f8d8429774f0bc8a09194fef5a2a254","observation_id":"f68eb4b9-c82a-4258-a31b-a1e0edbbc09b","resolution":{"observed_at":"2026-08-12T15:06:09.122829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.662337Z","title":"Bevt: Bert pretraining of video transformers,","venue":null,"work_id":"56cc21dd-7bdb-4803-8ad6-14f21cb9bb92","year":2022},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.127052Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:4c4af741e0f2814c93319898e8525e1b1f6e566879ebb5769184e28020594b5d","observation_id":"9597dfb0-6242-4426-af2a-9c4b64904947","resolution":{"observed_at":"2026-08-12T15:06:09.667448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T14:19:26.598265Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-12T15:06:09.131536Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.131536Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:caa9ad4ff3f38465c29e9adf684bf982da7596449d9c3630a0ae3fd435dd8fd9","observation_id":"f8a5fd88-b8d2-4d96-b629-78a21a56a2e9","resolution":{"observed_at":"2026-08-12T15:06:09.131536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.136242Z","title":"Flamingo: a visual language model for few-shot learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.136242Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:626cc08cb4a8945e9b01da3c30d42c415d1a5c45ee680c14051c6ebcbe0478f1","observation_id":"ccd53418-b010-4471-988f-95f55e04344f","resolution":{"observed_at":"2026-08-12T15:06:09.136242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.140586Z","title":"Unifying vision-and-language tasks via text generation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.140586Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:68ef29711e2565cc575be2329e282bfb745020c3d6d4234f41add0491475762f","observation_id":"e313d8b7-e60b-4394-84aa-ce78ae8bd06c","resolution":{"observed_at":"2026-08-12T15:06:09.140586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.625492Z","title":"Merlot: Multimodal neural script knowledge models,","venue":null,"work_id":"71da03f4-be69-49c5-863d-4d59ce30bcb6","year":2021},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.145453Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:d7182669cc451906663ab3c864848f3ca3208e81966a62a901a7fbb9c5c3d03e","observation_id":"cbc33707-dc53-4f18-9fd3-00853989f456","resolution":{"observed_at":"2026-08-12T15:06:09.630843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.608983Z","title":"Multimodal few-shot learning with frozen language models,","venue":null,"work_id":"5218e40b-49c8-4fc0-8ee8-9b37d4c7abcd","year":2021},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.150092Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:d1b1f41ebce70e67a1553d6cbe57bd6acd8d044b2310b7f29b819607f8dec1d8","observation_id":"7a20f2a2-126e-4a0b-b512-feebae9509d2","resolution":{"observed_at":"2026-08-12T15:06:09.613813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12327","last_updated":"2024-04-26T01:50:55Z","snapshot_observed_at":"2026-08-13T05:20:45.229059Z","submitted_at":"2023-11-21T03:40:09Z","title":"Enhancing Visual Grounding and Generalization: A Multi-Task Cycle Training Approach for Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12327","snapshot_observed_at":"2026-08-12T15:06:09.154447Z","title":"Vilam: A vision-language model with enhanced visual grounding and generalization capability,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.154447Z"},"links":{"cited_paper":"/paper/2311.12327","citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:3e5f4775a2890d862ee21f942e3e81c70f3c4409649a2ebef333714eee408d27","observation_id":"d1262267-e2dc-430e-81d1-5e465e451c67","resolution":{"observed_at":"2026-08-12T15:06:09.154447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.593704Z","title":"Tvlt: Textless vision- language transformer,","venue":null,"work_id":"7f469d70-1a3c-4fc9-8dd7-9a01023c37af","year":2022},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.159386Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:a7423633fe52793cb3bf3130b7606cbc5f86fdafc17f9b0e40629bac0ac24ab7","observation_id":"91929523-abef-4ee5-bd5f-f24e179c6f8b","resolution":{"observed_at":"2026-08-12T15:06:09.598574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.578205Z","title":"i-code: An integrative and composable multimodal learning framework,","venue":null,"work_id":"8336f4af-4eb6-428f-ad2e-7debe8a24c7b","year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.164581Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:6e535805b8833b57117a898e6a691d9432d74641dba0a8986b955ff86935e86e","observation_id":"24568667-8c93-4b8e-ae8e-e39e705dc7ad","resolution":{"observed_at":"2026-08-12T15:06:09.583209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.561812Z","title":"Merlot reserve: Neural script knowledge through vision and language and sound,","venue":null,"work_id":"44303693-34f2-4180-a552-78b7513e5f1a","year":2022},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.169023Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:e118bf66085671485d82e39c9f641edeaa92b4b2d5e2dab3030d26a491b82a1f","observation_id":"bed8ef28-4106-4293-8a4c-2788d6ce3475","resolution":{"observed_at":"2026-08-12T15:06:09.566661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.546602Z","title":"Codi-2: In-context interleaved and interactive any-to-any generation,","venue":null,"work_id":"7317a12a-0df4-4bcf-af0b-ad9c2db6a4e2","year":2024},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.173948Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:faa76eac9f48f3cb44e1a60f6bc549881001a2ca3516d3c57a004e1c150bb281","observation_id":"278ba3f8-a417-4148-ba47-941a6f9cfa78","resolution":{"observed_at":"2026-08-12T15:06:09.551448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.178506Z","title":"Clap learning audio concepts from natural language supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.178506Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:439909bd7128a7ef8bd0b0ed0def413a30f3fb06172235cdc0ebc17a1375bb82","observation_id":"0d7bda40-a9b7-4578-9fab-bd0def96b275","resolution":{"observed_at":"2026-08-12T15:06:09.178506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-13T12:55:40.566213Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-12T15:06:09.182850Z","title":"Audioldm: Text-to-audio generation with latent diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.182850Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:d9267307938fc8067f1187819e0ff45e49b3ecbd73d441970c61020f5cbac051","observation_id":"14becb8c-e340-404d-b335-eae95a2b7a86","resolution":{"observed_at":"2026-08-12T15:06:09.182850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-08-13T13:33:48.501765Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-12T15:06:09.187306Z","title":"Clipcap: Clip prefix for image captioning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.187306Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:b93d5c2937e6cbd0f06b0e2b5bff721773b3d62f345bf9870900af3208c19c13","observation_id":"165f4ef6-ebb0-441c-b50c-e4cf30ccecd4","resolution":{"observed_at":"2026-08-12T15:06:09.187306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-08-14T18:53:38.574749Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-12T15:06:09.192123Z","title":"Representation learning with contrastive predictive coding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.192123Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:f16e33926a8d48ca8d43694515cc8df7c18e165274d0ea3571405309f096b089","observation_id":"ffde865b-5216-4021-805b-079c3d710f1d","resolution":{"observed_at":"2026-08-12T15:06:09.192123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18766","last_updated":"2024-03-11T06:14:31Z","snapshot_observed_at":"2026-08-15T00:40:07.928584Z","submitted_at":"2023-05-30T05:56:58Z","title":"HiFA: High-fidelity Text-to-3D Generation with Advanced Diffusion Guidance","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18766","snapshot_observed_at":"2026-08-12T15:06:09.196597Z","title":"Hifa: High-fidelity text-to- 3d generation with advanced diffusion guidance,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.196597Z"},"links":{"cited_paper":"/paper/2305.18766","citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:6b71fb27781256ed746ead00cc1f739fd4516d732268f2076baeb22fa411795c","observation_id":"32346f7b-7d32-4e2c-bbde-806ea81e4236","resolution":{"observed_at":"2026-08-12T15:06:09.196597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.201401Z","title":"Magic3d: High-resolution text-to- 3d content creation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.201401Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:b72864700bfbf94b593b920fbb45a63d21e05ce1072c6d78af32d80a03aebf01","observation_id":"93f1e07f-3939-4189-b9d5-5a20c346064f","resolution":{"observed_at":"2026-08-12T15:06:09.201401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:06:09.513387Z","title":"threestudio: A unified framework for 3d content generation,","venue":null,"work_id":"aa09d1f9-e0df-4566-b478-934833e5701d","year":2023},"citing_paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T15:06:09.205961Z"},"links":{"citing_paper":"/paper/2411.14715"},"observation_digest":"sha256:f1644bb3aef8fe2c089845ccf4438fe6b2ab7f25f95a1f0b84aaa8844a15120b","observation_id":"b6c33e85-a032-46af-9e58-f116ec26e3f9","resolution":{"observed_at":"2026-08-12T15:06:09.518344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.14715","last_updated":"2024-11-22T03:52:37Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T11:05:29.698959Z","submitted_at":"2024-11-22T03:52:37Z","title":"Any-to-3D Generation via Hybrid Diffusion Supervision"},"reference_resolution":{"displayed":74,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":1,"verified_fuzzy":29},"total_outbound_references":74},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 74 of 74 outbound references and 0 inbound Pith citation observations for arXiv:2411.14715."}