{"as_of":"2026-08-15T21:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:60889a0094bd1f397fddd51477e01e329a8e17017378328930ec827282bffc95","coverage":[{"denominator":86,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":86,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T22:19:24.924471Z","state":"measured"},{"denominator":90,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":90,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:17:57.655659Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T20:03:57.298307Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03558","snapshot_observed_at":"2026-08-07T10:17:57.655659Z","title":"Midi: Multi-instance diffusion for single image to 3d scene generation.arXiv preprint arXiv:2412.03558, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05573","last_updated":"2025-06-05T20:30:28Z","snapshot_observed_at":"2026-08-12T03:43:47.727674Z","submitted_at":"2025-06-05T20:30:28Z","title":"PartCrafter: Structured 3D Mesh Generation via Compositional Latent Diffusion Transformers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:57.655659Z"},"links":{"cited_paper":"/paper/2412.03558","citing_paper":"/paper/2506.05573"},"observation_digest":"sha256:ba34e05ccd16e958769525dc918b3696f697d4e69452562cd1d1af45cca9c39b","observation_id":"ea8209b2-d077-4e41-8e51-922df5ca57d8","resolution":{"observed_at":"2026-08-07T10:17:57.655659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"cited_work":{"arxiv_id":"2412.03558","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.03558","snapshot_observed_at":"2026-06-29T20:03:57.298307Z","title":"Midi: Multi-instance diffusion for single image to 3d scene generation","venue":null,"work_id":"232b0678-204c-4640-bb29-dbd0353142e4","year":2025},"citing_paper":{"arxiv_id":"2509.10813","last_updated":"2026-04-28T04:11:01Z","snapshot_observed_at":"2026-08-15T00:20:36.277277Z","submitted_at":"2025-09-13T14:25:17Z","title":"InternScenes: A Large-scale Simulatable Indoor Scene Dataset with Realistic Layouts","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-18T17:11:26.524195Z"},"links":{"cited_paper":"/paper/2412.03558","citing_paper":"/paper/2509.10813"},"observation_digest":"sha256:99960223840a7c928de41ea8ffce447b6e627117e0f626f736729f0b8de5acd4","observation_id":"5582339e-cde9-40f7-9916-29b6ffea2854","resolution":{"observed_at":"2026-05-18T17:11:40.108634Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"cited_work":{"arxiv_id":"2412.03558","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.03558","snapshot_observed_at":"2026-06-29T20:03:57.298307Z","title":"Midi: Multi-instance diffusion for single image to 3d scene generation","venue":null,"work_id":"232b0678-204c-4640-bb29-dbd0353142e4","year":2025},"citing_paper":{"arxiv_id":"2605.16137","last_updated":"2026-05-19T15:51:08Z","snapshot_observed_at":"2026-08-15T02:56:05.258916Z","submitted_at":"2026-05-15T16:18:42Z","title":"STABLE: Simulation-Ready Tabletop Layout Generation via a Semantics-Physics Dual System","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-20T19:14:48.069637Z"},"links":{"cited_paper":"/paper/2412.03558","citing_paper":"/paper/2605.16137"},"observation_digest":"sha256:a501961d3e75d1312b284ee087aa14b87ace2363405651fb705a5e04813c6fbd","observation_id":"22391441-1ba5-497e-b491-b8c7d723cbec","resolution":{"observed_at":"2026-05-20T19:18:54.649538Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"cited_work":{"arxiv_id":"2412.03558","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.03558","snapshot_observed_at":"2026-06-29T20:03:57.298307Z","title":"Midi: Multi-instance diffusion for single image to 3d scene generation","venue":null,"work_id":"232b0678-204c-4640-bb29-dbd0353142e4","year":2025},"citing_paper":{"arxiv_id":"2606.28060","last_updated":"2026-06-26T13:08:40Z","snapshot_observed_at":"2026-08-04T13:43:03.773977Z","submitted_at":"2026-06-26T13:08:40Z","title":"ReScene: Structured Indoor Scene Reconstruction from Multi-View Captures","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-29T04:30:56.107507Z"},"links":{"cited_paper":"/paper/2412.03558","citing_paper":"/paper/2606.28060"},"observation_digest":"sha256:73611f10bc4a82f02013b5d089c619a6eb141d3044641b8f972bc0a0c2b0dcb8","observation_id":"4cdd353a-d9dd-482d-86a7-fe77014bcc66","resolution":{"observed_at":"2026-06-29T20:03:57.299791Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.03558/citation-record","integrity":"/paper/2412.03558/integrity","json":"/paper/2412.03558/citation-record.json","paper":"/paper/2412.03558"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:24.470319Z","title":"Neural rgb-d surface reconstruction","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.470319Z"},"links":{"citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:56d3066a51c50acb59bd574b67899b5d1ba907b68489ac8fbba3a010e9de0bd5","observation_id":"e235fb43-7527-4703-8188-ee4147644d52","resolution":{"observed_at":"2026-08-11T22:19:24.470319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-11T22:19:24.477120Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.477120Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:f5619fe95e0782a74cc9c7e98b0daf909f2e18a5526a59805fc76ef572bb2a00","observation_id":"6e2bcb3f-4e3d-4f15-9319-b75e40814483","resolution":{"observed_at":"2026-08-11T22:19:24.477120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1709.06158","last_updated":"2017-09-18T20:34:48Z","snapshot_observed_at":"2026-08-14T20:32:01.406964Z","submitted_at":"2017-09-18T20:34:48Z","title":"Matterport3D: Learning from RGB-D Data in Indoor Environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.06158","snapshot_observed_at":"2026-08-11T22:19:24.483193Z","title":"Matterport3d: Learning from rgb-d data in indoor environments","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.483193Z"},"links":{"cited_paper":"/paper/1709.06158","citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:895df37f2288adbc13902e3e15b37a495ae8304bbad152f2cb97834102c53a9d","observation_id":"a26b3620-e4d2-481e-ae07-4d385608d747","resolution":{"observed_at":"2026-08-11T22:19:24.483193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:24.489199Z","title":"Single-view 3d scene reconstruc- tion with high-fidelity shape and texture","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.489199Z"},"links":{"citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:26320df515ee8332a56915379ccc902367dfe333892e61d71d073a084656bda9","observation_id":"1e37fa38-5f5e-4003-808c-a92f919788e9","resolution":{"observed_at":"2026-08-11T22:19:24.489199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12409","last_updated":"2024-03-19T03:39:43Z","snapshot_observed_at":"2026-08-15T13:54:04.658476Z","submitted_at":"2024-03-19T03:39:43Z","title":"ComboVerse: Compositional 3D Assets Creation Using Spatially-Aware Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12409","snapshot_observed_at":"2026-08-11T22:19:24.494401Z","title":"Comboverse: Compositional 3d as- sets creation using spatially-aware diffusion guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.494401Z"},"links":{"cited_paper":"/paper/2403.12409","citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:6e32b2f4194721ae6c31163b6e1b9ffb905a1852b535cd3cd2c3976671d6ae42","observation_id":"8f6e5658-3c90-42d0-b9d5-457b21d44953","resolution":{"observed_at":"2026-08-11T22:19:24.494401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:24.500289Z","title":"Buol: A bottom-up framework with occupancy-aware lifting for panoptic 3d scene reconstruction from a single image","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.500289Z"},"links":{"citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:6dc2d810c7f39de33fd79e6b539137dce93f366e810ca79af9dd2fbb40b23611","observation_id":"c02f3fd2-ad73-4121-8653-e66339e13dda","resolution":{"observed_at":"2026-08-11T22:19:24.500289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:24.506633Z","title":"Panoptic 3d scene reconstruction from a single rgb image","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.506633Z"},"links":{"citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:e20af54c3ff655ad536f4674a6112bafae19f959fbbc5a32be1a4978664a3679","observation_id":"239bf3cb-c715-4bd7-9433-650664bdb1d0","resolution":{"observed_at":"2026-08-11T22:19:24.506633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:24.512113Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.512113Z"},"links":{"citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:5d15141072b67a7aa77f9072b4477799151142c0a191c98ad07dc806fec48f06","observation_id":"09b903b6-84d8-4024-975f-5276c71ff7d4","resolution":{"observed_at":"2026-08-11T22:19:24.512113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:24.517348Z","title":"Objaverse: A universe of annotated 3d objects","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.517348Z"},"links":{"citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:f29c4923b68c56f826b8fc54d4ec73ec58e395c8b0c8fa0d6b26ca1f7d084e77","observation_id":"94ab5b39-77d7-4abd-aa7f-914bbc3bc830","resolution":{"observed_at":"2026-08-11T22:19:24.517348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:26.252811Z","title":"Objaverse-xl: A universe of 10m+ 3d objects","venue":null,"work_id":"e87debbd-50ec-4c4c-b27d-6004e03abf4a","year":2024},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.523049Z"},"links":{"citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:ce997e8985ec5fd712a5b9bcd18388faad5bff4d46c79662c6d824bf184b88b4","observation_id":"1905d084-a603-4c44-bcba-fe7c466462dc","resolution":{"observed_at":"2026-08-11T22:19:26.257528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03421","last_updated":"2025-03-31T13:42:34Z","snapshot_observed_at":"2026-08-13T00:37:46.079900Z","submitted_at":"2024-04-04T12:58:46Z","title":"Gen3DSR: Generalizable 3D Scene Reconstruction via Divide and Conquer from a Single View","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03421","snapshot_observed_at":"2026-08-11T22:19:24.527729Z","title":"General- izable 3d scene reconstruction via divide and conquer from a single view","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.527729Z"},"links":{"cited_paper":"/paper/2404.03421","citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:371f94c5c548f385d56ad4f4eeb047ef5d108f878a0e64a4b9d9bfe470724e8a","observation_id":"1228f12e-7aaa-4928-a7dd-409e7e3bbfcb","resolution":{"observed_at":"2026-08-11T22:19:24.527729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:24.532509Z","title":"Tela: Text to layer-wise 3d clothed human generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.532509Z"},"links":{"citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:484ba406058bce5e935eab226f0eb4726613fa632abda9c52b40b34a9f733b7c","observation_id":"c68931e9-63d4-46ab-ba3e-2eec7022ddd0","resolution":{"observed_at":"2026-08-11T22:19:24.532509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:24.538986Z","title":"Omnidata: A scalable pipeline for making multi- task mid-level vision datasets from 3d scans","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.538986Z"},"links":{"citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:f6534ef3bacb9adc1cc405f6e26018469b2e32bcf4b61e81744b5eec1c47104b","observation_id":"ba352958-b5c6-444b-a471-1507a2a77061","resolution":{"observed_at":"2026-08-11T22:19:24.538986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:24.544028Z","title":"Scaling recti- fied flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.544028Z"},"links":{"citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:6272094f088ecddcdcd588b339a6abf0ad934c5b97b50e72a17cfa508ede1916","observation_id":"595beabd-0d2e-40fb-8395-fd5b260a82c8","resolution":{"observed_at":"2026-08-11T22:19:24.544028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:24.548492Z","title":"3d-front: 3d furnished rooms with layouts and semantics","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.548492Z"},"links":{"citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:572b5c61c3217da7acf79e676c347fdeebd27bb6d3b5b07ee3a4e6d990a696aa","observation_id":"034999a5-8e4a-43a0-8fb2-22483d787c19","resolution":{"observed_at":"2026-08-11T22:19:24.548492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:26.186897Z","title":"3d-future: 3d fur- niture shape with texture","venue":null,"work_id":"0d0b364b-2ea3-48b3-8a79-a44502d0e1a0","year":2021},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.553425Z"},"links":{"citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:e54302131917ed2a19a2834da156ac8ba2fa46e0e0b472ee85eb260af5039573","observation_id":"5c6d46ed-3de8-4569-956d-101af54ab5ac","resolution":{"observed_at":"2026-08-11T22:19:26.192855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:26.168944Z","title":"Diffcad: Weakly-supervised probabilistic cad model retrieval and alignment from an rgb image","venue":null,"work_id":"0528c927-d46c-4806-8e71-53572147692c","year":2024},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.559147Z"},"links":{"citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:a414e1384aa324f832c9fd6901dd92cefc15ae9fed94df3398728da84036a176","observation_id":"aba27113-874c-4f8d-9746-34ba865c5f5b","resolution":{"observed_at":"2026-08-11T22:19:26.174826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:26.150412Z","title":"Learn- ing 3d object shape and layout without 3d supervision","venue":null,"work_id":"3b778d0c-c1df-4ff6-8977-c722bb9089e9","year":2022},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.565160Z"},"links":{"citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:a7073f896f786df98a1807850599b15b28303ee3edef3351e0b045bab89e412c","observation_id":"a063ab1c-879f-4b75-9296-6f0737c091c9","resolution":{"observed_at":"2026-08-11T22:19:26.156177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:26.130947Z","title":"Roca: Ro- bust cad model retrieval and alignment from a single image","venue":null,"work_id":"0a6029db-7c5c-4fa0-9b9c-a9f8d3725c46","year":2022},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.570414Z"},"links":{"citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:6e083e3752450bbc7155c448ddcb8396b8a73f765afefe952b8b4da5364e88dd","observation_id":"3ad51016-5d78-4210-bcce-c97abcc04d6b","resolution":{"observed_at":"2026-08-11T22:19:26.136435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:26.111656Z","title":"threestudio: A unified framework for 3d content generation, 2023","venue":null,"work_id":"b56d0da7-60a2-4d8b-8c1e-6f367bc2b529","year":2023},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.575723Z"},"links":{"citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:054571cfcb239a8da201349aa09a0cef646cc0a3acf6bad3c1a9e902a0b8f077","observation_id":"7d3f575f-4163-4bcf-adc6-c83283dab3c2","resolution":{"observed_at":"2026-08-11T22:19:26.118486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18525","last_updated":"2025-08-27T08:24:52Z","snapshot_observed_at":"2026-08-15T12:29:58.481767Z","submitted_at":"2024-05-28T18:45:10Z","title":"REPARO: Compositional 3D Assets Generation with Differentiable 3D Layout Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18525","snapshot_observed_at":"2026-08-11T22:19:24.580426Z","title":"Reparo: Compositional 3d assets generation with differentiable 3d layout alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.580426Z"},"links":{"cited_paper":"/paper/2405.18525","citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:4a04f5197f70381f2d1baf881e97f3e7a21d28270a3fbd55dce5b446427ae767","observation_id":"3d281103-59ca-4932-ac68-e7c9aa24e9bd","resolution":{"observed_at":"2026-08-11T22:19:24.580426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-11T22:19:24.585916Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.585916Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:c5d34608d2d338cd86495ac635c663a62f6ad2082377cf74c3cce6cfb9d3027f","observation_id":"5fa7230e-a9e5-43f4-99e9-d81214e9651e","resolution":{"observed_at":"2026-08-11T22:19:24.585916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:24.592499Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.592499Z"},"links":{"citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:ed04fd879872c25bdabbea82f4c0ce81bd31ea440c55ccbb90f781ef1f5a66b6","observation_id":"69933ff9-1972-4ba0-befc-fd8bbbb83f8f","resolution":{"observed_at":"2026-08-11T22:19:24.592499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04400","last_updated":"2024-03-09T10:47:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-08T00:03:52Z","title":"LRM: Large Reconstruction Model for Single Image to 3D","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04400","snapshot_observed_at":"2026-08-11T22:19:24.598267Z","title":"Lrm: Large reconstruction model for single image to 3d","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.598267Z"},"links":{"cited_paper":"/paper/2311.04400","citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:fa62f345c6ec6335baf57296993789b709afcd65cfd22bd7f233155811fd8d6c","observation_id":"5d2bf12b-69e0-4362-b26e-f0b1ed265da8","resolution":{"observed_at":"2026-08-11T22:19:24.598267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-11T22:19:24.603228Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.603228Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:16ad8a4e86babb51da3bf4a7111db0f46b775f57b1d5cdea5bece00d7c93333b","observation_id":"2018dd2e-4c69-4d98-9878-fcb0e982f5fe","resolution":{"observed_at":"2026-08-11T22:19:24.603228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03632","last_updated":"2024-12-04T18:48:20Z","snapshot_observed_at":"2026-08-12T16:39:36.574010Z","submitted_at":"2024-12-04T18:48:20Z","title":"MV-Adapter: Multi-view Consistent Image Generation Made Easy","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03632","snapshot_observed_at":"2026-08-11T22:19:24.608784Z","title":"Mv-adapter: Multi-view consistent image generation made easy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.608784Z"},"links":{"cited_paper":"/paper/2412.03632","citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:18a8baa8f359dd8dbae7b924f1c29fd715ed19cf10cbd4b4413025c8e8c0f028","observation_id":"96c46aaf-8813-4829-8cc1-e09b9da2b740","resolution":{"observed_at":"2026-08-11T22:19:24.608784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:24.613872Z","title":"Epidiff: Enhancing multi-view synthesis via localized epipolar-constrained diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.613872Z"},"links":{"citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:0ceb932c429a08500e5c2cedf20b902a4dc5d6605fb2ee06aeee85ee4a09bbc9","observation_id":"3097edca-607d-4802-b4d4-0549bfba768e","resolution":{"observed_at":"2026-08-11T22:19:24.613872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:26.074069Z","title":null,"venue":null,"work_id":"9a85c620-861c-480e-ac8c-9ee7f807e07c","year":2017},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.618869Z"},"links":{"citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:60b073559bce6d3ef42078feaa2a090d6af139db19f050a76d80a56eb316d2e0","observation_id":"36675878-c973-4ca6-8952-84f4c963f89c","resolution":{"observed_at":"2026-08-11T22:19:26.078879Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02463","last_updated":"2023-05-03T23:59:13Z","snapshot_observed_at":"2026-08-12T18:09:04.196531Z","submitted_at":"2023-05-03T23:59:13Z","title":"Shap-E: Generating Conditional 3D Implicit Functions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02463","snapshot_observed_at":"2026-08-11T22:19:24.624279Z","title":"Shap-e: Generat- ing conditional 3d implicit functions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.624279Z"},"links":{"cited_paper":"/paper/2305.02463","citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:87102578e9c3e28e4fe1c5f745caff535c1dd4ff16e539872be25d44467da879","observation_id":"7109ec4f-ecb9-494d-8c84-0b40e7bc6c64","resolution":{"observed_at":"2026-08-11T22:19:24.624279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-08-14T23:50:45.029465Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-11T22:19:24.629396Z","title":"Auto-encoding variational bayes","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.629396Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:dd19dfa2e1f944c84f3768caebbd7d2aa3464bb0a4483f54604d15354d2e6125","observation_id":"bb96c0ff-5170-430f-9afd-99b179c31daf","resolution":{"observed_at":"2026-08-11T22:19:24.629396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-08-08T05:14:59.435033Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-11T22:19:24.634421Z","title":"Berg, Wan-Yen Lo, Piotr Doll ´ar, and Ross Girshick","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.634421Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:da2cdabc1a1ef3bf12a0c91e2a9064ba1523858f1a9234e211b4db4dafeec322","observation_id":"6c3d10de-360d-47b4-8c78-afe325186f7a","resolution":{"observed_at":"2026-08-11T22:19:24.634421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:26.055347Z","title":"Mask2cad: 3d shape prediction by learning to segment and retrieve","venue":null,"work_id":"459c2f4e-4016-4963-902e-d96b8dc75f43","year":2020},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.639549Z"},"links":{"citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:f2dccf5fe350981c39c9bc1e94d37527098b9348f034ef165b399c78e9d0be44","observation_id":"54f7fe89-3a06-41ea-b913-8f226b7e47b6","resolution":{"observed_at":"2026-08-11T22:19:26.062304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:26.035715Z","title":"Patch2cad: Patchwise embedding learning for in-the- wild shape retrieval from a single image","venue":null,"work_id":"55bef6f8-2b24-461d-afb3-2559871a0eee","year":2021},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.645115Z"},"links":{"citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:81ee3397b64dcf65f21aba24578f123c54c5de2987f48f0b2ed776a26accb6db","observation_id":"6a93a930-8502-4b47-854d-d93ef3fb6723","resolution":{"observed_at":"2026-08-11T22:19:26.040938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.01044","last_updated":"2022-10-03T16:02:10Z","snapshot_observed_at":"2026-08-13T14:14:00.324121Z","submitted_at":"2022-10-03T16:02:10Z","title":"SPARC: Sparse Render-and-Compare for CAD model alignment in a single RGB image","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.01044","snapshot_observed_at":"2026-08-11T22:19:24.651197Z","title":"Sparc: Sparse render-and-compare for cad model alignment in a single rgb image","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.651197Z"},"links":{"cited_paper":"/paper/2210.01044","citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:72083224006cb1284657de7cb00d9e45d432aef6500f32bb2b3c6afa6b4488e1","observation_id":"4f859191-a6a3-40d4-b8d9-8bccf58e4bd8","resolution":{"observed_at":"2026-08-11T22:19:24.651197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14979","last_updated":"2025-05-30T10:22:03Z","snapshot_observed_at":"2026-08-12T23:59:26.256718Z","submitted_at":"2024-05-23T18:30:12Z","title":"CraftsMan3D: High-fidelity Mesh Generation with 3D Native Generation and Interactive Geometry Refiner","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14979","snapshot_observed_at":"2026-08-11T22:19:24.657182Z","title":"Craftsman: High-fidelity mesh generation with 3d native generation and interactive geometry refiner","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.657182Z"},"links":{"cited_paper":"/paper/2405.14979","citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:7da74f4b36be1a0a173fc009a68fd4f85a9a49e7377676a5db97e71888eade61","observation_id":"75e3988e-fddb-49f1-b8ac-d10803d98fcc","resolution":{"observed_at":"2026-08-11T22:19:24.657182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06608","last_updated":"2025-03-27T17:25:50Z","snapshot_observed_at":"2026-07-06T20:34:02.031605Z","submitted_at":"2025-02-10T16:07:54Z","title":"TripoSG: High-Fidelity 3D Shape Synthesis using Large-Scale Rectified Flow Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06608","snapshot_observed_at":"2026-08-11T22:19:24.662780Z","title":"Triposg: High-fidelity 3d shape synthesis using large-scale rectified flow models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.662780Z"},"links":{"cited_paper":"/paper/2502.06608","citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:dffdeb8b4543edf0569f3ab932a9db9ed0d526d797d480f96c93aaefb024d47c","observation_id":"175e174b-e84c-42c9-9015-f4f6c702b2f2","resolution":{"observed_at":"2026-08-11T22:19:24.662780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:26.018348Z","title":"Part123: part-aware 3d reconstruction from a single-view image","venue":null,"work_id":"960e12f2-97ba-400e-9e2a-7620f580b341","year":2024},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.668803Z"},"links":{"citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:bf40877e5685d800a5e9295cce53016d7f4040d77f574a4bf9c0a7478f8380cb","observation_id":"4e14715a-3bd3-4850-a60d-10d45d5eac70","resolution":{"observed_at":"2026-08-11T22:19:26.024483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:26.001221Z","title":"Towards high-fidelity single-view holistic reconstruction of indoor scenes","venue":null,"work_id":"6670c491-03e6-4410-aca0-5a476c71c865","year":2022},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.673792Z"},"links":{"citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:63c2f959f1db288f1a3b3b5c7721422f42051ed769a67fec6d16f84153e3e694","observation_id":"98b75164-459c-48c0-9671-a6fdb90a1060","resolution":{"observed_at":"2026-08-11T22:19:26.006488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:25.984950Z","title":"One-2-3-45++: Fast single im- age to 3d objects with consistent multi-view generation and 3d diffusion","venue":null,"work_id":"c2ad9356-0948-46e5-aaa6-3d4e606c43e9","year":2024},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.678786Z"},"links":{"citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:81f4e326a4eea4cd45ad6117266e300f80ca6cc9b278c2cb16a89d11642eeac8","observation_id":"d0fb7e2a-d33e-4a7b-8772-ac2af0b768ca","resolution":{"observed_at":"2026-08-11T22:19:25.990012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:25.968563Z","title":"One-2-3-45: Any single image to 3d mesh in 45 seconds without per-shape optimiza- tion","venue":null,"work_id":"1099783b-f59b-459e-8575-e661e07bb130","year":2024},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.683680Z"},"links":{"citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:d524709b85a37d68979f3447af770a758c30beebb27d9a801b4c7401c31ecedb","observation_id":"cda20c72-bd78-4aab-a7fe-d0a97c94dbd3","resolution":{"observed_at":"2026-08-11T22:19:25.973929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-11T22:19:24.688612Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.688612Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:246fea518b3896561171ef21b496a0436d191f06c2219b976b9124cb408213a8","observation_id":"47648afb-9b6b-4fc5-8461-efd9a8bac810","resolution":{"observed_at":"2026-08-11T22:19:24.688612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-11T22:19:24.694510Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.694510Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:b7eec6517535f9d43fea0a974d311665664bea9e42bbd0d69a155f6f842cc827","observation_id":"13d820e1-6bc3-44ec-9861-0c422768086e","resolution":{"observed_at":"2026-08-11T22:19:24.694510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03453","last_updated":"2024-04-15T10:28:44Z","snapshot_observed_at":"2026-08-12T22:52:54.817720Z","submitted_at":"2023-09-07T02:28:04Z","title":"SyncDreamer: Generating Multiview-consistent Images from a Single-view Image","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.03453","snapshot_observed_at":"2026-08-11T22:19:24.700568Z","title":"Syncdreamer: Gen- erating multiview-consistent images from a single-view im- age","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.700568Z"},"links":{"cited_paper":"/paper/2309.03453","citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:2e2b1811c53137085243ee00b566d895626bf9f7cdc2317d043e2a300cf5ac6b","observation_id":"e927f0aa-afb3-4d16-a9d1-5d3f42350950","resolution":{"observed_at":"2026-08-11T22:19:24.700568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:24.706386Z","title":"Wonder3d: Sin- gle image to 3d using cross-domain diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.706386Z"},"links":{"citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:1466fc955174acdc0673f6518c7f5a24f3918a91830fe139e12d6f627b85ac8a","observation_id":"ddea7528-a219-40ec-ba4c-d59833c031cc","resolution":{"observed_at":"2026-08-11T22:19:24.706386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:25.941088Z","title":"Marching cubes: A high resolution 3d surface construction algorithm","venue":null,"work_id":"db2a4acb-3a60-4cb5-a6b9-d55cda0469f3","year":1998},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.711368Z"},"links":{"citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:6b89512a57a5fbd3b9652a93a288789291735d032aa35e6940a1eea724e07c11","observation_id":"019a47af-dc24-4573-902e-3ea9154f3954","resolution":{"observed_at":"2026-08-11T22:19:25.946424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.08215","last_updated":"2025-05-01T15:23:06Z","snapshot_observed_at":"2026-08-15T01:30:58.199318Z","submitted_at":"2024-09-12T16:55:51Z","title":"LT3SD: Latent Trees for 3D Scene Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.08215","snapshot_observed_at":"2026-08-11T22:19:24.716309Z","title":"Lt3sd: Latent trees for 3d scene diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.716309Z"},"links":{"cited_paper":"/paper/2409.08215","citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:b3a8f1936c038eef4f63341edc5ff741586b0847d9967947864ad7eed6edf6be","observation_id":"666a8032-ff54-4e60-b1a5-b0abaec7e79d","resolution":{"observed_at":"2026-08-11T22:19:24.716309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:25.922494Z","title":"GLIDE: towards photorealis- tic image generation and editing with text-guided diffusion models","venue":null,"work_id":"d43e48f1-7ebe-4ae3-848c-048ef9078e77","year":2022},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.721777Z"},"links":{"citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:9c4ebfc48175122e7453c1e23b574520bf297d4acbac4a7cdc43d4999d2700ca","observation_id":"e9f1308a-1369-420f-a75d-8593b327dbac","resolution":{"observed_at":"2026-08-11T22:19:25.928013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:25.906268Z","title":"Total3dunderstanding: Joint lay- out, object pose and mesh reconstruction for indoor scenes from a single image","venue":null,"work_id":"0231ad38-a50b-425d-a054-c1a552fead44","year":2020},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.727319Z"},"links":{"citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:251497a9e0e82cb85b0041799a901b2a51b0b0d153edf10b96fd3c19e2f52f53","observation_id":"54ec66ed-b173-448b-b89e-1c23a5b7e666","resolution":{"observed_at":"2026-08-11T22:19:25.910886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-11T22:19:24.731797Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.731797Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:ae3d615dde9a1b3f2c594ee82521aecdcd2283e962d6a06ca12c5d86f88ce33b","observation_id":"0c0282a3-f776-4280-8189-4e258e7b3018","resolution":{"observed_at":"2026-08-11T22:19:24.731797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:24.737191Z","title":"Atiss: Autoregres- sive transformers for indoor scene synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.737191Z"},"links":{"citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:84cbab23fa2b527d36f15b356eb18f2b4a3b96beb4c7e7f905c87600319ae880","observation_id":"e24e5a4d-0044-4f4d-a413-796cca81d393","resolution":{"observed_at":"2026-08-11T22:19:24.737191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:24.742085Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.742085Z"},"links":{"citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:76dc7316ac10953c089214f2d5e2d090608a835fc42fc1e6fb2049b99f5f8870","observation_id":"66b52f76-11e1-42e9-89e2-5415084b1480","resolution":{"observed_at":"2026-08-11T22:19:24.742085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-08-14T22:54:08.184266Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-11T22:19:24.746930Z","title":"Sdxl: Improving latent diffusion mod- els for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.746930Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:f7e102000fd588486f997fe6d55dcfd03f3403ce681ff8fa05fc5ce9de88b324","observation_id":"b8817661-99de-421b-b153-8fd0e05d1cf8","resolution":{"observed_at":"2026-08-11T22:19:24.746930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:24.752142Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.752142Z"},"links":{"citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:35b11fad293da4a2f2bf23ffb9dcb33084b04e4affea483a382f4ba388830681","observation_id":"ea90cd2f-9f21-4682-bce3-cd66911dcd04","resolution":{"observed_at":"2026-08-11T22:19:24.752142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-08-15T12:50:58.405488Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-11T22:19:24.756723Z","title":"Hierarchical text-conditional image gener- ation with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.756723Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:e321fcaff8b1696bd771cee27a7bf3e2595c001258481e0ed2b3d6f417c30ef0","observation_id":"0aee56db-70e7-46d5-986f-f0326180cebe","resolution":{"observed_at":"2026-08-11T22:19:24.756723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:24.761588Z","title":"Grounded sam: Assembling open-world models for diverse visual tasks,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.761588Z"},"links":{"citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:c677ed0022d0919ccb31fbd855ea1702ba65a90efc39379695d2d2f1cb9f4513","observation_id":"5910e255-592b-4ac9-9f78-605d0f2f09c8","resolution":{"observed_at":"2026-08-11T22:19:24.761588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13530","last_updated":"2024-10-17T13:19:32Z","snapshot_observed_at":"2026-08-12T22:20:59.168538Z","submitted_at":"2024-10-17T13:19:32Z","title":"L3DG: Latent 3D Gaussian Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13530","snapshot_observed_at":"2026-08-11T22:19:24.766543Z","title":"L3dg: Latent 3d gaussian diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.766543Z"},"links":{"cited_paper":"/paper/2410.13530","citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:dae52d2bdccc779c8d7f17e6afaa1c4f5a83e271b7f192129af4e53f7d34731b","observation_id":"b1c76509-8895-41e3-b0d9-73ab3a7b02e6","resolution":{"observed_at":"2026-08-11T22:19:24.766543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:24.771589Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.771589Z"},"links":{"citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:cf207460a3fcb35cc93bc94414c1a41390cfbefcfe8fe0bb8f236b5245ebc905","observation_id":"1b3cd6f3-fc8a-4551-9bd2-193a6ce60af8","resolution":{"observed_at":"2026-08-11T22:19:24.771589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:24.776858Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.776858Z"},"links":{"citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:3c42ae11a2b18d318e278f21d7265c832c5c37e877430183c4a80a2360ca1b4b","observation_id":"2efe727b-e8ed-4d56-85b9-9871961d6cf0","resolution":{"observed_at":"2026-08-11T22:19:24.776858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:24.781731Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.781731Z"},"links":{"citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:718f93f66d8e2a7a1960bbea143bfa8d5754b94552aba31bdd0cd39651e8b3ea","observation_id":"c28f9010-5b4c-4dc1-8fbf-5bfff51f1762","resolution":{"observed_at":"2026-08-11T22:19:24.781731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-11T22:19:24.787127Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.787127Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:1646d176bd80073ed7447baf6feb9e2bdea884d29a994cd7bcb7ddce82c90004","observation_id":"b00e9ecb-db77-40ea-ba34-1c2ce12e8eb3","resolution":{"observed_at":"2026-08-11T22:19:24.787127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-11T22:19:24.793007Z","title":"Score-based generative modeling through stochastic differential equa- tions","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.793007Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:de82854b98a7ab199e0fd44f4a4bb1839294c29ec66a575bcd6faa53b20e4da7","observation_id":"2f01a310-0bf5-4fbd-8e7f-fb13c0a66753","resolution":{"observed_at":"2026-08-11T22:19:24.793007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.05797","last_updated":"2019-06-13T16:29:58Z","snapshot_observed_at":"2026-08-01T13:51:16.469557Z","submitted_at":"2019-06-13T16:29:58Z","title":"The Replica Dataset: A Digital Replica of Indoor Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.05797","snapshot_observed_at":"2026-08-11T22:19:24.797905Z","title":"The replica dataset: A digital replica of indoor spaces","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.797905Z"},"links":{"cited_paper":"/paper/1906.05797","citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:4d12c5650bf39eb50f9a444e91c280eac7b7c9f031be889ee326848b68539157","observation_id":"85b091e5-86cd-459a-81a0-68a15fcd8638","resolution":{"observed_at":"2026-08-11T22:19:24.797905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:24.803354Z","title":"Diffuscene: Denoising diffu- sion models for generative indoor scene synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.803354Z"},"links":{"citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:b122ae4574e74a69794726e44f788c72e0d3b22cae40c5eba5aa36ce974e01cc","observation_id":"021566ec-dc81-4c05-aca8-dcac1652e558","resolution":{"observed_at":"2026-08-11T22:19:24.803354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:25.806828Z","title":"Lgm: Large multi-view gaussian model for high-resolution 3d content creation","venue":null,"work_id":"25569477-9763-4f31-99e9-4d8062a5539b","year":2025},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.809546Z"},"links":{"citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:4705116dca059ddafad887ff39773fe31a388f0596ca71cbc7f7f3638441c799","observation_id":"9305c0fb-9476-48f6-a03b-e66c1acd340a","resolution":{"observed_at":"2026-08-11T22:19:25.811998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02151","last_updated":"2024-03-04T16:00:56Z","snapshot_observed_at":"2026-07-06T17:39:16.540553Z","submitted_at":"2024-03-04T16:00:56Z","title":"TripoSR: Fast 3D Object Reconstruction from a Single Image","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02151","snapshot_observed_at":"2026-08-11T22:19:24.814273Z","title":"Triposr: Fast 3d object reconstruction from a single image","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.814273Z"},"links":{"cited_paper":"/paper/2403.02151","citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:5bf67e74db65f2459fef144c1cdb28a5092cbc99567b0fa6ea20cb72cf5d550f","observation_id":"2387520d-6b36-4f6e-9be4-bfe118c6ff55","resolution":{"observed_at":"2026-08-11T22:19:24.814273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:25.787658Z","title":"Sv3d: Novel multi-view syn- thesis and 3d generation from a single image using latent video diffusion","venue":null,"work_id":"33411d89-3594-456e-99b4-347de10b0e63","year":2025},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.819595Z"},"links":{"citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:f1e17dc491c6d5fd664a566dcc623b1171dc09ea6d9f63375ca834a470e3eac4","observation_id":"93544d0d-ed6c-4fc2-b764-d07cf498ddd6","resolution":{"observed_at":"2026-08-11T22:19:25.793990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:25.769780Z","title":"Neus: Learning neural im- plicit surfaces by volume rendering for multi-view recon- struction","venue":null,"work_id":"86cb7518-bee5-40e4-9ede-1ffbb9370e80","year":2021},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.824339Z"},"links":{"citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:3c18d0d758e6ac4d06da59c03a2b9776a39ef3f2618824a7897d8fd123f8a464","observation_id":"62907540-adfa-4392-b6dc-bd2287856f7c","resolution":{"observed_at":"2026-08-11T22:19:25.776076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05034","last_updated":"2024-03-08T04:25:29Z","snapshot_observed_at":"2026-08-15T12:43:44.464197Z","submitted_at":"2024-03-08T04:25:29Z","title":"CRM: Single Image to 3D Textured Mesh with Convolutional Reconstruction Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05034","snapshot_observed_at":"2026-08-11T22:19:24.829216Z","title":"Crm: Single image to 3d textured mesh with convolutional reconstruction model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.829216Z"},"links":{"cited_paper":"/paper/2403.05034","citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:eac055103ea67fc95f7eafe8dcdcb8a2c6b072bdde7d2ac5ce7b348308a82a6f","observation_id":"57786f34-0475-4391-a4cc-3fc6e4136d45","resolution":{"observed_at":"2026-08-11T22:19:24.829216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03184","last_updated":"2025-05-01T10:43:02Z","snapshot_observed_at":"2026-08-15T19:56:16.404993Z","submitted_at":"2024-06-05T12:15:22Z","title":"Ouroboros3D: Image-to-3D Generation via 3D-aware Recursive Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03184","snapshot_observed_at":"2026-08-11T22:19:24.833706Z","title":"Ouroboros3d: Image-to-3d gen- eration via 3d-aware recursive diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.833706Z"},"links":{"cited_paper":"/paper/2406.03184","citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:16c0f8e8600e19f8d735d430d7a9d40f27e1b16ab80758d3fcd7356116c5f1b7","observation_id":"7bd221cb-40b3-47df-bb91-eaf98485e198","resolution":{"observed_at":"2026-08-11T22:19:24.833706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20343","last_updated":"2024-10-28T15:41:12Z","snapshot_observed_at":"2026-08-12T23:53:52.203588Z","submitted_at":"2024-05-30T17:59:54Z","title":"Unique3D: High-Quality and Efficient 3D Mesh Generation from a Single Image","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20343","snapshot_observed_at":"2026-08-11T22:19:24.839041Z","title":"Unique3d: High-quality and efficient 3d mesh generation from a single image","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.839041Z"},"links":{"cited_paper":"/paper/2405.20343","citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:2b8b003ed3ffecdac66072fcc69a7b77933969d7a1444477c2a1ab97a68fc60d","observation_id":"0f8074ca-6a1c-4761-9079-777815bf6a79","resolution":{"observed_at":"2026-08-11T22:19:24.839041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14832","last_updated":"2024-06-01T16:18:53Z","snapshot_observed_at":"2026-08-12T23:59:32.733928Z","submitted_at":"2024-05-23T17:49:37Z","title":"Direct3D: Scalable Image-to-3D Generation via 3D Latent Diffusion Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14832","snapshot_observed_at":"2026-08-11T22:19:24.845335Z","title":"Direct3d: Scalable image-to-3d generation via 3d latent diffusion transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.845335Z"},"links":{"cited_paper":"/paper/2405.14832","citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:af1aa51f6fae0c9aa45958327cfc7703eac6f01145a0357e75fd0abe76932b9e","observation_id":"fa8909cb-667a-4e9d-babe-276b712589e8","resolution":{"observed_at":"2026-08-11T22:19:24.845335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:25.753232Z","title":"Blockfusion: Expandable 3d scene gen- eration using latent tri-plane extrapolation","venue":null,"work_id":"096d6b75-9205-42ad-82f3-b8560a8059d7","year":2024},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.850436Z"},"links":{"citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:e5aa9a1dac03fdfa10f60cfe1a3786f76368db0c24e0d6a067ede87eb71af0e7","observation_id":"fba5c971-0aef-460f-a9ab-59ce9745411b","resolution":{"observed_at":"2026-08-11T22:19:25.758795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07191","last_updated":"2024-04-14T16:54:24Z","snapshot_observed_at":"2026-08-13T18:57:44.379289Z","submitted_at":"2024-04-10T17:48:37Z","title":"InstantMesh: Efficient 3D Mesh Generation from a Single Image with Sparse-view Large Reconstruction Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07191","snapshot_observed_at":"2026-08-11T22:19:24.855123Z","title":"Instantmesh: Efficient 3d mesh generation from a single image with sparse-view large reconstruction models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.855123Z"},"links":{"cited_paper":"/paper/2404.07191","citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:e6717ddc8c361c0bae319abdbe310694fb23d19bc9c5c4ea64119bfd66b102ee","observation_id":"9776c8a8-70a4-4eb2-bb2f-4ef7cc0b03b8","resolution":{"observed_at":"2026-08-11T22:19:24.855123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14621","last_updated":"2024-03-21T17:59:34Z","snapshot_observed_at":"2026-08-13T00:48:26.456093Z","submitted_at":"2024-03-21T17:59:34Z","title":"GRM: Large Gaussian Reconstruction Model for Efficient 3D Reconstruction and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14621","snapshot_observed_at":"2026-08-11T22:19:24.861066Z","title":"Grm: Large gaussian reconstruction model for ef- ficient 3d reconstruction and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.861066Z"},"links":{"cited_paper":"/paper/2403.14621","citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:8c1a1f7bbc4ee4b6cd307ba3f1ead251cab3b07678a5cc5d215ab502dc7d54d0","observation_id":"ba131941-921c-4897-b769-bb2b2e7efed5","resolution":{"observed_at":"2026-08-11T22:19:24.861066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:24.866504Z","title":"Hifi-123: Towards high-fidelity one image to 3d content gen- eration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.866504Z"},"links":{"citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:49149e8ab67f57112c0a9dc1279ce33b7deb258344c6f5ab095d63b64b019bbe","observation_id":"919b44c2-db8c-4e0a-828a-906f139bf3bf","resolution":{"observed_at":"2026-08-11T22:19:24.866504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:24.873513Z","title":"3dshape2vecset: A 3d shape representation for neu- ral fields and generative diffusion models.ACM Transactions On Graphics (TOG), 42(4):1–16, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.873513Z"},"links":{"citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:0f795199b046fc929f21e8f1788a4f0e823db7e62bf13c86012439c13b01d36f","observation_id":"7a460b27-9180-4f30-b0c1-b4ee2e977304","resolution":{"observed_at":"2026-08-11T22:19:24.873513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:25.715021Z","title":"Holistic 3d scene un- derstanding from a single image with implicit representation","venue":null,"work_id":"552aa1a2-d302-4ac8-830b-4c7a649f6989","year":2021},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.878453Z"},"links":{"citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:6baf5ca4c646e60252705b06ba90eb798153d68e76ed57f8682a460f82af11e1","observation_id":"803b17c4-b102-4c33-89ff-fa26962839e1","resolution":{"observed_at":"2026-08-11T22:19:25.720197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:25.697772Z","title":"Clay: A controllable large-scale generative model for creat- ing high-quality 3d assets","venue":null,"work_id":"9f8154fd-26d1-45d9-95f3-d4b80037d54d","year":2024},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.883741Z"},"links":{"citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:6f38b87ba864a119b6e4c69a73add4dc41df656ba065ed2140b00edeb4a11fa6","observation_id":"5e6ee03e-db88-4d40-9444-2807829d1d27","resolution":{"observed_at":"2026-08-11T22:19:25.704010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:25.680060Z","title":"Uni-3d: A universal model for panoptic 3d scene reconstruc- tion","venue":null,"work_id":"059fa0be-810a-455f-9114-9ea074eccb9c","year":2023},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.888271Z"},"links":{"citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:ebb56a324c6f68fd163eebba7e230fdf6b0df8e60480b34e280950b004aa176b","observation_id":"b54915e5-e69d-4a60-9f04-67cacd5c000f","resolution":{"observed_at":"2026-08-11T22:19:25.685715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:25.661860Z","title":"Michelangelo: Conditional 3d shape generation based on shape-image-text aligned latent representation","venue":null,"work_id":"287fec25-7f65-4a4b-89bd-dda2cd1d17f2","year":2024},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.893202Z"},"links":{"citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:2f3cd43845adba60c348bc54f538f6ee8dc5e805f71a1dd26492d42e2ae418f4","observation_id":"e329b9b4-f34f-4268-9b47-398e1a188dc8","resolution":{"observed_at":"2026-08-11T22:19:25.667464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:25.643672Z","title":"Zero-shot scene reconstruction from single images with deep prior as- sembly","venue":null,"work_id":"7b0950d9-6b7c-4491-b4d2-7dc18c16aaf5","year":2024},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.897649Z"},"links":{"citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:e0f5e50e298379c15a24a16977eb26e04ce172f4076ca7ab5667ebbca63ef75e","observation_id":"23183069-f4b1-4e97-bea8-398ee8cea31f","resolution":{"observed_at":"2026-08-11T22:19:25.649304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:25.623813Z","title":"Triplane meets gaussian splatting: Fast and generalizable single-view 3d reconstruction with transformers","venue":null,"work_id":"71011401-f643-4a0a-a434-44b20c4c79e7","year":2024},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.903549Z"},"links":{"citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:7efd18f65831b5239d6f2adfe40202d251c0ae0388e2168a59b4e7051691c255","observation_id":"e4009483-3653-444a-b7f4-ee62d19a5571","resolution":{"observed_at":"2026-08-11T22:19:25.630479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:25.605976Z","title":"Following scalable 3D object generation methods [35, 71, 78, 80], we firstly trains a V AE to com- press 3D geometric representations into a low-dimensional latent space","venue":null,"work_id":"4cff22d5-7f3c-4d9d-8799-64eefa50a536","year":null},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.908649Z"},"links":{"citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:56773c942df431a813e9383ff8e10682de8396a79e8f9a23d20c6dcc14eacfd6","observation_id":"d0bc4880-5eca-48fc-adce-dc3268818d0a","resolution":{"observed_at":"2026-08-11T22:19:25.611579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:25.589525Z","title":"we trained MIDI to simultaneously generate up to N = 7instances","venue":null,"work_id":"ba14fd12-4e7e-4f4b-8de3-33f9ead47ca7","year":null},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.914229Z"},"links":{"citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:dbba77a60d28464602d79faa6b03a08cfaeea3034d5f287206af60f914c698fe","observation_id":"41c32b14-175a-423f-977a-abc73eef6e11","resolution":{"observed_at":"2026-08-11T22:19:25.594995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:25.572532Z","title":"compositional generation methods","venue":null,"work_id":"bf118ba3-362f-44f0-923c-e3c0d9b899b4","year":null},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.919288Z"},"links":{"citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:647312816bb521452cc99b4cbd9ef52aecde306d90bd720fd078c9bea46694e6","observation_id":"c9d72829-63f6-48ce-ac3e-402ab691a560","resolution":{"observed_at":"2026-08-11T22:19:25.577736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:19:25.553918Z","title":null,"venue":null,"work_id":"6bc9209f-6316-482e-a4d1-f1c5852f66c0","year":null},"citing_paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation","version":3},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-11T22:19:24.924471Z"},"links":{"citing_paper":"/paper/2412.03558"},"observation_digest":"sha256:613e7be7795106c53427a8652dd2269d6892a590e4a5c77aa7136f4446197302","observation_id":"f827c2f4-932a-458f-9e23-5d056656da2f","resolution":{"observed_at":"2026-08-11T22:19:25.560639Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.03558","last_updated":"2025-07-17T08:26:21Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T16:39:49.876560Z","submitted_at":"2024-12-04T18:52:40Z","title":"MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation"},"reference_resolution":{"displayed":86,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":58,"verified_exact":0,"verified_fuzzy":28},"total_outbound_references":86},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 86 of 86 outbound references and 4 inbound Pith citation observations for arXiv:2412.03558."}