{"as_of":"2026-08-20T05:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0b8b5e1299b8a0ac949ba566306484a3fb7544978f0b7328784619b71ea337cf","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:46:00.688693Z","state":"measured"},{"denominator":81,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":81,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":25,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T17:13:37.518119Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T06:09:37.256195Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02836","snapshot_observed_at":"2026-08-07T05:21:43.104278Z","title":"Scenethesis: A language and vision agentic framework for 3d scene generation.arXiv preprint arXiv:2505.02836,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08174","last_updated":"2025-06-11T17:04:39Z","snapshot_observed_at":"2026-08-14T12:13:16.567794Z","submitted_at":"2025-06-09T19:39:09Z","title":"LLM-BT-Terms: Back-Translation as a Framework for Terminology Standardization and Dynamic Semantic Embedding","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:21:43.104278Z"},"links":{"cited_paper":"/paper/2505.02836","citing_paper":"/paper/2506.08174"},"observation_digest":"sha256:3a9d687603599f1c952d39e034651b81761173738387aaf766281c02eb767b52","observation_id":"5b32ae89-6483-435b-9982-647d8edc2a7b","resolution":{"observed_at":"2026-08-07T05:21:43.104278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02836","snapshot_observed_at":"2026-08-07T00:13:32.850883Z","title":"Ling, C.-H","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14763","last_updated":"2025-06-17T17:57:37Z","snapshot_observed_at":"2026-08-16T07:38:15.131757Z","submitted_at":"2025-06-17T17:57:37Z","title":"RobotSmith: Generative Robotic Tool Design for Acquisition of Complex Manipulation Skills","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:32.850883Z"},"links":{"cited_paper":"/paper/2505.02836","citing_paper":"/paper/2506.14763"},"observation_digest":"sha256:0c3592c700ab5d23bd476c1c2c377f72a4af91cf9b5baf0eec90c04cee461574","observation_id":"a31b2567-2df7-46dd-ab93-3d480503aff5","resolution":{"observed_at":"2026-08-07T00:13:32.850883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02836","snapshot_observed_at":"2026-08-06T22:48:59.729438Z","title":"Scenethesis: A language and vision agentic framework for 3d scene generation.arXiv preprint arXiv:2505.02836, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:48:59.729438Z"},"links":{"cited_paper":"/paper/2505.02836","citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:888b7fda06f1123b62128b83ca424736d943bad7c4cf27c40a33c12a0da400c9","observation_id":"f97302bc-978c-48e6-a955-c770b23c387b","resolution":{"observed_at":"2026-08-06T22:48:59.729438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02836","snapshot_observed_at":"2026-08-06T05:15:42.305835Z","title":"Scenethesis: A language and vision agentic framework for 3d scene generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02094","last_updated":"2025-08-04T06:05:36Z","snapshot_observed_at":"2026-08-08T15:06:07.047501Z","submitted_at":"2025-08-04T06:05:36Z","title":"\"Harmless to You, Hurtful to Me!\": Investigating the Detection of Toxic Languages Grounded in the Perspective of Youth","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T05:15:42.305835Z"},"links":{"cited_paper":"/paper/2505.02836","citing_paper":"/paper/2508.02094"},"observation_digest":"sha256:611ed99cab90791b5b0f66ed7a94e02ebb1ff7b2be17a326f228f6263b730a5c","observation_id":"a4081951-88c8-47fd-88d2-e67f97dafcec","resolution":{"observed_at":"2026-08-06T05:15:42.305835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02836","snapshot_observed_at":"2026-08-06T05:12:36.368585Z","title":"Scenethesis: A language and vision agentic framework for 3d scene generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:36.368585Z"},"links":{"cited_paper":"/paper/2505.02836","citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:7152ec8d4232b2ca212b68c475bc09ae1523f0960c56489af2bbb283d6f860a2","observation_id":"c0daa79a-4e47-481e-a554-80e5d332ed29","resolution":{"observed_at":"2026-08-06T05:12:36.368585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02836","snapshot_observed_at":"2026-08-03T19:19:20.992326Z","title":"Scenethesis: A language and vision agentic framework for 3d scene generation.arXiv preprint arXiv:2505.02836, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.01204","last_updated":"2026-07-02T09:41:54Z","snapshot_observed_at":"2026-08-14T01:57:03.530270Z","submitted_at":"2025-12-01T02:38:52Z","title":"TabletopGen: Tabletop Scene Generation and Interactive Simulation for Robotic Manipulation","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T19:19:20.992326Z"},"links":{"cited_paper":"/paper/2505.02836","citing_paper":"/paper/2512.01204"},"observation_digest":"sha256:135e93915724f33eea4bb4dc073351dff436e3463d016c0afefb2330931510a5","observation_id":"85383ed5-aad4-4b7c-b011-5beca377713b","resolution":{"observed_at":"2026-08-03T19:19:20.992326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"cited_work":{"arxiv_id":"2505.02836","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02836","snapshot_observed_at":"2026-07-04T06:09:37.256195Z","title":"Scenethesis: A language and vision agentic framework for 3d scene generation","venue":null,"work_id":"30f1cb71-9f42-4e54-bf65-ab62eef4c221","year":2025},"citing_paper":{"arxiv_id":"2601.08454","last_updated":"2026-05-17T09:37:30Z","snapshot_observed_at":"2026-08-17T22:52:13.145681Z","submitted_at":"2026-01-13T11:28:46Z","title":"Real2Sim via Active Perception with Behavior Trees Automatically Generated by VLMs","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-21T15:07:54.930273Z"},"links":{"cited_paper":"/paper/2505.02836","citing_paper":"/paper/2601.08454"},"observation_digest":"sha256:89d17bd0ef8673d9247cdde2f5791397952e7f29522953e7c9419056bfe1d745","observation_id":"36e4d326-5360-4fd9-9be8-22eb11c93a07","resolution":{"observed_at":"2026-05-21T15:10:16.648939Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"cited_work":{"arxiv_id":"2505.02836","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02836","snapshot_observed_at":"2026-07-04T06:09:37.256195Z","title":"Scenethesis: A language and vision agentic framework for 3d scene generation","venue":null,"work_id":"30f1cb71-9f42-4e54-bf65-ab62eef4c221","year":2025},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-19T06:50:20.229655Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"cited_paper":"/paper/2505.02836","citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:9dcbfc7040688228aa9f5a247795af46560d063a165121796e7bdca66d6a346a","observation_id":"26543a02-6378-46d7-9a85-33f1673708c1","resolution":{"observed_at":"2026-05-16T13:51:00.560832Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"cited_work":{"arxiv_id":"2505.02836","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02836","snapshot_observed_at":"2026-07-04T06:09:37.256195Z","title":"Scenethesis: A language and vision agentic framework for 3d scene generation","venue":null,"work_id":"30f1cb71-9f42-4e54-bf65-ab62eef4c221","year":2025},"citing_paper":{"arxiv_id":"2604.10578","last_updated":"2026-04-14T11:24:24Z","snapshot_observed_at":"2026-08-15T14:04:17.388220Z","submitted_at":"2026-04-12T10:55:14Z","title":"Rein3D: Reinforced 3D Indoor Scene Generation with Panoramic Video Diffusion Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T15:34:15.916685Z"},"links":{"cited_paper":"/paper/2505.02836","citing_paper":"/paper/2604.10578"},"observation_digest":"sha256:4dd527ede00c280830d2c44909e081d1cd4ffd40f8b09a4952acc52ef6a20a1e","observation_id":"e1a06504-1b43-4f3b-9a11-30a8982adfca","resolution":{"observed_at":"2026-05-11T10:16:05.932363Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"cited_work":{"arxiv_id":"2505.02836","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02836","snapshot_observed_at":"2026-07-04T06:09:37.256195Z","title":"Scenethesis: A language and vision agentic framework for 3d scene generation","venue":null,"work_id":"30f1cb71-9f42-4e54-bf65-ab62eef4c221","year":2025},"citing_paper":{"arxiv_id":"2604.13035","last_updated":"2026-04-14T17:59:26Z","snapshot_observed_at":"2026-08-02T20:49:07.621096Z","submitted_at":"2026-04-14T17:59:26Z","title":"SceneCritic: A Symbolic Evaluator for 3D Indoor Scene Synthesis","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T15:36:33.149921Z"},"links":{"cited_paper":"/paper/2505.02836","citing_paper":"/paper/2604.13035"},"observation_digest":"sha256:a37e05c12337d545fe39291d06edc13272e1f4d87db0c70dbe260fc3232e8a0b","observation_id":"e693439b-16c8-4d60-83b0-4fc46678f9d3","resolution":{"observed_at":"2026-05-11T10:11:03.657154Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"cited_work":{"arxiv_id":"2505.02836","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02836","snapshot_observed_at":"2026-07-04T06:09:37.256195Z","title":"Scenethesis: A language and vision agentic framework for 3d scene generation","venue":null,"work_id":"30f1cb71-9f42-4e54-bf65-ab62eef4c221","year":2025},"citing_paper":{"arxiv_id":"2604.13800","last_updated":"2026-04-15T12:36:59Z","snapshot_observed_at":"2026-08-02T10:48:28.074347Z","submitted_at":"2026-04-15T12:36:59Z","title":"EmbodiedClaw: Conversational Workflow Execution for Embodied AI Development","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T13:34:58.288245Z"},"links":{"cited_paper":"/paper/2505.02836","citing_paper":"/paper/2604.13800"},"observation_digest":"sha256:3d7f206b30b677c740d4a4ce3b21278f32164cb62c124cc0181dd19210ff7c7e","observation_id":"3d6782b4-b96a-4ba2-bdf7-ad05b5150363","resolution":{"observed_at":"2026-05-10T13:35:26.232494Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"cited_work":{"arxiv_id":"2505.02836","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02836","snapshot_observed_at":"2026-07-04T06:09:37.256195Z","title":"Scenethesis: A language and vision agentic framework for 3d scene generation","venue":null,"work_id":"30f1cb71-9f42-4e54-bf65-ab62eef4c221","year":2025},"citing_paper":{"arxiv_id":"2604.16299","last_updated":"2026-04-17T17:59:50Z","snapshot_observed_at":"2026-08-15T13:59:21.939219Z","submitted_at":"2026-04-17T17:59:50Z","title":"Repurposing 3D Generative Model for Autoregressive Layout Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T08:09:00.779456Z"},"links":{"cited_paper":"/paper/2505.02836","citing_paper":"/paper/2604.16299"},"observation_digest":"sha256:db7c238a0def16b9df89e3b15be5ee1707461eae05ab9e1f91e94a9965717a98","observation_id":"057d08e1-e449-482e-bb80-fe41c9e25c24","resolution":{"observed_at":"2026-05-10T08:12:26.732757Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"cited_work":{"arxiv_id":"2505.02836","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02836","snapshot_observed_at":"2026-07-04T06:09:37.256195Z","title":"Scenethesis: A language and vision agentic framework for 3d scene generation","venue":null,"work_id":"30f1cb71-9f42-4e54-bf65-ab62eef4c221","year":2025},"citing_paper":{"arxiv_id":"2604.16552","last_updated":"2026-04-29T14:25:32Z","snapshot_observed_at":"2026-08-14T16:51:27.062604Z","submitted_at":"2026-04-17T07:28:04Z","title":"Co-generation of Layout and Shape from Text via Autoregressive 3D Diffusion","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T09:22:10.651922Z"},"links":{"cited_paper":"/paper/2505.02836","citing_paper":"/paper/2604.16552"},"observation_digest":"sha256:e94aaf570d7e8f75dfe7419d1700397f0d028e001195e256b73c8a2cd354505d","observation_id":"f5417681-3361-451a-9452-ae11b24206a1","resolution":{"observed_at":"2026-05-10T09:23:36.978937Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"cited_work":{"arxiv_id":"2505.02836","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02836","snapshot_observed_at":"2026-07-04T06:09:37.256195Z","title":"Scenethesis: A language and vision agentic framework for 3d scene generation","venue":null,"work_id":"30f1cb71-9f42-4e54-bf65-ab62eef4c221","year":2025},"citing_paper":{"arxiv_id":"2604.19907","last_updated":"2026-04-21T18:33:15Z","snapshot_observed_at":"2026-08-15T15:52:56.471845Z","submitted_at":"2026-04-21T18:33:15Z","title":"SceneOrchestra: Efficient Agentic 3D Scene Synthesis via Full Tool-Call Trajectory Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T03:22:30.012610Z"},"links":{"cited_paper":"/paper/2505.02836","citing_paper":"/paper/2604.19907"},"observation_digest":"sha256:6d2b3f5b021dd91c5ea53277da339f2ddc6f27a043ba90de10834db1ab8a3140","observation_id":"05f27cc3-095e-4f35-800e-ad8400f5a2e8","resolution":{"observed_at":"2026-05-11T12:31:06.580065Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"cited_work":{"arxiv_id":"2505.02836","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02836","snapshot_observed_at":"2026-07-04T06:09:37.256195Z","title":"Scenethesis: A language and vision agentic framework for 3d scene generation","venue":null,"work_id":"30f1cb71-9f42-4e54-bf65-ab62eef4c221","year":2025},"citing_paper":{"arxiv_id":"2605.20837","last_updated":"2026-05-20T07:27:08Z","snapshot_observed_at":"2026-08-15T05:24:00.779954Z","submitted_at":"2026-05-20T07:27:08Z","title":"ArchSIBench: Benchmarking the Architectural Spatial Intelligence of Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-21T04:55:40.370796Z"},"links":{"cited_paper":"/paper/2505.02836","citing_paper":"/paper/2605.20837"},"observation_digest":"sha256:bcd02a510f3c3c4c9cf408a0a0a4a26be9c0073e13bbbe178d53ed92fded682d","observation_id":"4112b671-dff6-4520-b981-7c75a03eb637","resolution":{"observed_at":"2026-05-21T04:59:36.508177Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"cited_work":{"arxiv_id":"2505.02836","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02836","snapshot_observed_at":"2026-07-04T06:09:37.256195Z","title":"Scenethesis: A language and vision agentic framework for 3d scene generation","venue":null,"work_id":"30f1cb71-9f42-4e54-bf65-ab62eef4c221","year":2025},"citing_paper":{"arxiv_id":"2605.25326","last_updated":"2026-05-25T01:16:19Z","snapshot_observed_at":"2026-08-12T21:19:04.030063Z","submitted_at":"2026-05-25T01:16:19Z","title":"Perceive-then-Plan: Layout-as-Policy for Monocular 3D Scene Layout Estimation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-29T23:11:59.282627Z"},"links":{"cited_paper":"/paper/2505.02836","citing_paper":"/paper/2605.25326"},"observation_digest":"sha256:c93941f585afddce8a1fd373c9969f5824a070fa17dcc92a0248ac19495fc657","observation_id":"d46764da-2d11-4041-85f1-8298ebb0421b","resolution":{"observed_at":"2026-06-29T23:14:01.323641Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"cited_work":{"arxiv_id":"2505.02836","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02836","snapshot_observed_at":"2026-07-04T06:09:37.256195Z","title":"Scenethesis: A language and vision agentic framework for 3d scene generation","venue":null,"work_id":"30f1cb71-9f42-4e54-bf65-ab62eef4c221","year":2025},"citing_paper":{"arxiv_id":"2606.03994","last_updated":"2026-06-02T17:59:59Z","snapshot_observed_at":"2026-08-14T07:43:00.111924Z","submitted_at":"2026-06-02T17:59:59Z","title":"SimuScene: Simulation-Ready Compositional 3D Scene Reconstruction from a Single Image","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T10:59:17.553098Z"},"links":{"cited_paper":"/paper/2505.02836","citing_paper":"/paper/2606.03994"},"observation_digest":"sha256:f3f36c963afd2e61fcd16e2c8aa7c97fc10593cf837b99fb7351bfe0d0d6323f","observation_id":"975ec25c-94f1-4a7a-a71b-d301f9dc1282","resolution":{"observed_at":"2026-07-02T02:26:26.366072Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"cited_work":{"arxiv_id":"2505.02836","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02836","snapshot_observed_at":"2026-07-04T06:09:37.256195Z","title":"Scenethesis: A language and vision agentic framework for 3d scene generation","venue":null,"work_id":"30f1cb71-9f42-4e54-bf65-ab62eef4c221","year":2025},"citing_paper":{"arxiv_id":"2606.08402","last_updated":"2026-06-16T06:24:38Z","snapshot_observed_at":"2026-08-14T06:39:38.137645Z","submitted_at":"2026-06-07T01:38:39Z","title":"SceneConductor: 3D Scene Generation from a Single Image with Multi-Agent Orchestration","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-27T19:08:08.329817Z"},"links":{"cited_paper":"/paper/2505.02836","citing_paper":"/paper/2606.08402"},"observation_digest":"sha256:3c8644bf80b002986669cfcaf14b0f3b8d3deab75ce5fe1cbd7e3fb853d58892","observation_id":"8ffe7006-363f-4c1e-ba7a-92183b4b77d6","resolution":{"observed_at":"2026-07-02T22:07:26.723110Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"cited_work":{"arxiv_id":"2505.02836","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02836","snapshot_observed_at":"2026-07-04T06:09:37.256195Z","title":"Scenethesis: A language and vision agentic framework for 3d scene generation","venue":null,"work_id":"30f1cb71-9f42-4e54-bf65-ab62eef4c221","year":2025},"citing_paper":{"arxiv_id":"2606.21596","last_updated":"2026-06-19T16:50:48Z","snapshot_observed_at":"2026-08-03T18:54:47.903762Z","submitted_at":"2026-06-19T16:50:48Z","title":"$\\phi$-Scene: Physically Grounded Image-to-3D Scene Reconstruction","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-06-26T14:50:16.317301Z"},"links":{"cited_paper":"/paper/2505.02836","citing_paper":"/paper/2606.21596"},"observation_digest":"sha256:71d465315c06fa88795336e1719902e03dcc3046c833edabbf0827c6f3f2601f","observation_id":"ee327f72-b816-4837-b399-d85f8f7a3d3a","resolution":{"observed_at":"2026-07-04T06:09:37.258248Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"cited_work":{"arxiv_id":"2505.02836","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02836","snapshot_observed_at":"2026-07-04T06:09:37.256195Z","title":"Scenethesis: A language and vision agentic framework for 3d scene generation","venue":null,"work_id":"30f1cb71-9f42-4e54-bf65-ab62eef4c221","year":2025},"citing_paper":{"arxiv_id":"2606.29395","last_updated":"2026-08-13T08:27:50Z","snapshot_observed_at":"2026-08-17T08:09:04.572998Z","submitted_at":"2026-06-28T13:33:44Z","title":"NaLA: A 3D Native LLM Layout Agent for High-quality 3D Scene Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T08:12:30.693936Z"},"links":{"cited_paper":"/paper/2505.02836","citing_paper":"/paper/2606.29395"},"observation_digest":"sha256:129867c2b651f3d73aaaa18bfadad85c8ddf344f7cd19fdb76463adb6b9dcd64","observation_id":"d0407fcf-3f38-47fc-a0ff-d6f490c6f095","resolution":{"observed_at":"2026-06-30T08:14:25.460428Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"cited_work":{"arxiv_id":"2505.02836","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02836","snapshot_observed_at":"2026-07-04T06:09:37.256195Z","title":"Scenethesis: A language and vision agentic framework for 3d scene generation","venue":null,"work_id":"30f1cb71-9f42-4e54-bf65-ab62eef4c221","year":2025},"citing_paper":{"arxiv_id":"2606.31388","last_updated":"2026-06-30T09:16:21Z","snapshot_observed_at":"2026-08-02T07:18:38.830324Z","submitted_at":"2026-06-30T09:16:21Z","title":"One Video, One World: Turning Monocular Video into Physical 4D Scenes","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-01T05:38:19.541391Z"},"links":{"cited_paper":"/paper/2505.02836","citing_paper":"/paper/2606.31388"},"observation_digest":"sha256:021e3e31052f692febeb45cedb959803a6606e652119654078b72306e869f9e9","observation_id":"117dbc72-dd2b-4e11-9aad-123f302ebc8f","resolution":{"observed_at":"2026-07-01T10:15:45.028897Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02836","snapshot_observed_at":"2026-07-11T22:29:10.666143Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03990","last_updated":"2026-07-04T19:16:29Z","snapshot_observed_at":"2026-08-13T14:28:39.963025Z","submitted_at":"2026-07-04T19:16:29Z","title":"InSpace: Structure-Aware 3D Indoor Scene Generation from a Single 360{\\deg} Image","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-11T22:29:10.666143Z"},"links":{"cited_paper":"/paper/2505.02836","citing_paper":"/paper/2607.03990"},"observation_digest":"sha256:9ea082e58c3725fa9f1fb7a9161d9d0af095d0c8fa8c06d7200e139bb7e5b905","observation_id":"9b69de31-9219-4245-be32-20415ad32f18","resolution":{"observed_at":"2026-07-11T22:29:10.666143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02836","snapshot_observed_at":"2026-08-01T18:57:31.940710Z","title":"Scenethesis: A language and vision agentic framework for 3d scene generation.arXiv preprint arXiv:2505.02836, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17145","last_updated":"2026-08-07T06:30:56Z","snapshot_observed_at":"2026-08-18T04:04:30.464033Z","submitted_at":"2026-07-19T09:01:20Z","title":"Text2Villa: Hierarchical Generation of 3D Indoor Environments with Physics-Aware Analysis-by-Synthesis","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T18:57:31.940710Z"},"links":{"cited_paper":"/paper/2505.02836","citing_paper":"/paper/2607.17145"},"observation_digest":"sha256:c76b284ba1d1d0374777c684cf65b1fece179d7159fb9c9ae1ae68639fac4973","observation_id":"0973aaf3-5216-40b5-b911-1f59fe8edfde","resolution":{"observed_at":"2026-08-01T18:57:31.940710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02836","snapshot_observed_at":"2026-08-08T01:03:56.584297Z","title":"arXiv preprint arXiv:2505.02836 (2025) 2, 4","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03064","last_updated":"2026-08-04T03:24:09Z","snapshot_observed_at":"2026-08-17T16:36:12.910824Z","submitted_at":"2026-08-04T03:24:09Z","title":"Global Graph-Validated Optimization for VLM-based 3D Indoor Scene Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T01:03:56.584297Z"},"links":{"cited_paper":"/paper/2505.02836","citing_paper":"/paper/2608.03064"},"observation_digest":"sha256:6c76ebc0537ded2f4c9e9579e6163e59a0caac24b83aff37b3f6de72b4f2bc4d","observation_id":"d469ef02-472c-40dc-9508-54510118a5f4","resolution":{"observed_at":"2026-08-08T01:03:56.584297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02836","snapshot_observed_at":"2026-08-08T17:13:37.518119Z","title":"Scenethesis: A language and vision agentic framework for 3d scene generation.arXiv preprint arXiv:2505.02836, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05248","last_updated":"2026-08-05T15:46:38Z","snapshot_observed_at":"2026-08-16T05:56:29.817463Z","submitted_at":"2026-08-05T15:46:38Z","title":"WorldClaw: Agentic 3D Open-World Generation at Scale","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-08T17:13:37.518119Z"},"links":{"cited_paper":"/paper/2505.02836","citing_paper":"/paper/2608.05248"},"observation_digest":"sha256:4fb4a37aa6452fdd4a1f53121b2680831469d17bc510ecbb40d869a8f987328e","observation_id":"59fb88cd-8d6b-4934-a980-eb680a56c41f","resolution":{"observed_at":"2026-08-08T17:13:37.518119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.02836/citation-record","integrity":"/paper/2505.02836/integrity","json":"/paper/2505.02836/citation-record.json","paper":"/paper/2505.02836"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2403.09675","last_updated":"2024-02-05T01:59:31Z","snapshot_observed_at":"2026-08-16T14:21:36.680301Z","submitted_at":"2024-02-05T01:59:31Z","title":"Open-Universe Indoor Scene Generation using LLM Program Synthesis and Uncurated Object Databases","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09675","snapshot_observed_at":"2026-08-16T00:46:00.427918Z","title":"Open-universe indoor scene generation using llm program synthesis and uncurated object databases","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.427918Z"},"links":{"cited_paper":"/paper/2403.09675","citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:735d910f10578a9c3771ac99bcfa140712d8ce24978640d16f93bfae3d23e332","observation_id":"e39183b6-3b5a-4a6c-8aa5-04f986831572","resolution":{"observed_at":"2026-08-16T00:46:00.427918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02073","last_updated":"2025-04-21T12:09:08Z","snapshot_observed_at":"2026-08-02T06:32:26.688405Z","submitted_at":"2024-10-02T22:42:20Z","title":"Depth Pro: Sharp Monocular Metric Depth in Less Than a Second","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02073","snapshot_observed_at":"2026-08-16T00:46:00.433408Z","title":"Depth pro: Sharp monocular metric depth in less than a second","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.433408Z"},"links":{"cited_paper":"/paper/2410.02073","citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:e8fac0c03f3b427559060c088e649859c4990ed69d4a4cce068c072cbeb008e0","observation_id":"8d0f2b66-11e7-4c3a-a52b-71b972135940","resolution":{"observed_at":"2026-08-16T00:46:00.433408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:46:01.529628Z","title":"Learning spatial knowledge for text to 3d scene generation","venue":null,"work_id":"b6da2197-2a28-44d5-b124-df3858c82877","year":2014},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.438498Z"},"links":{"citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:e537017b6d87c5781900439f0e8a696476a52cf6b27ee1dd7cbc7c38406bc46f","observation_id":"686103c4-9afa-4454-9fce-34ad462a010d","resolution":{"observed_at":"2026-08-16T00:46:01.534244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:46:00.443590Z","title":"Secondpose: Se (3)- consistent dual-stream feature fusion for category-level pose estimation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.443590Z"},"links":{"citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:5be79626b06c37e933393b44ed18fdc537feba5ea8736a1c60fa108f62f4624f","observation_id":"cc3a0045-b9c0-467b-aaae-0250f165621b","resolution":{"observed_at":"2026-08-16T00:46:00.443590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18515","last_updated":"2024-11-16T02:54:28Z","snapshot_observed_at":"2026-08-19T15:23:23.369453Z","submitted_at":"2024-05-28T18:33:18Z","title":"Atlas3D: Physically Constrained Self-Supporting Text-to-3D for Simulation and Fabrication","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18515","snapshot_observed_at":"2026-08-16T00:46:00.448345Z","title":"Atlas3d: Physically constrained self-supporting text-to-3d for simula- tion and fabrication","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.448345Z"},"links":{"cited_paper":"/paper/2405.18515","citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:3d7b0c26916548aaa22a45df5e420c587ab1da2a7a14037ae71d8ee1d6458994","observation_id":"c599146d-adb1-4516-9294-a18c944b9b36","resolution":{"observed_at":"2026-08-16T00:46:00.448345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:46:01.503670Z","title":"Procthor: Large-scale embodied ai using procedural generation","venue":null,"work_id":"addf6149-4e1d-4220-ac04-f3e383b398fc","year":2022},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.453471Z"},"links":{"citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:b6eb030c44bd4301c76f7b213643be116ad65a4469f920e332c926c4d3bcb355","observation_id":"734502df-a7e8-4db0-8728-692fe62e92a0","resolution":{"observed_at":"2026-08-16T00:46:01.508644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:46:01.488825Z","title":"Phone2proc: Bringing robust robots into our chaotic world","venue":null,"work_id":"83831bbc-1100-42c4-abb9-2c936ca8c8b2","year":2023},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.458005Z"},"links":{"citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:cc4c3ecbda8f7390e2a96d0c1d81897a79a2040ce5e19b289d9993893fb041a5","observation_id":"f2d12e95-80b9-4685-a289-71b22c9de74b","resolution":{"observed_at":"2026-08-16T00:46:01.493711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:46:01.472732Z","title":"Objaverse: A universe of annotated 3d objects","venue":null,"work_id":"67995f37-7c7c-480a-870d-d45ab346d6fb","year":2023},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.463051Z"},"links":{"citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:a1baf679c48ddaee992c801cd0e187b2141c893793b17cf0efc8678a74b4c84f","observation_id":"3baa9fa7-fcb9-48b5-b40e-4ed0225fcc73","resolution":{"observed_at":"2026-08-16T00:46:01.478193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:46:01.456177Z","title":"Roma: Robust dense feature matching","venue":null,"work_id":"cb03bb8f-8aeb-45b6-b7f4-9eac1069f6f1","year":2024},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.467459Z"},"links":{"citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:6797871b50015f6675e611601c4fabc1c11f618df2b660e386abf14e3a1b5b37","observation_id":"1dbdc5b4-90bc-4513-a474-debb6857b192","resolution":{"observed_at":"2026-08-16T00:46:01.461028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:46:01.440706Z","title":"Layoutgpt: Compositional visual plan- ning and generation with large language models","venue":null,"work_id":"97ee3017-b631-4765-bc0b-5cca749fec2c","year":2024},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.472070Z"},"links":{"citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:4cff2b0ea1238b9445ffafd70a2f616d40d365c0decec20d29c7f5fecb72390c","observation_id":"29b7e13a-c431-42c4-b6a8-10bfe4c66c0e","resolution":{"observed_at":"2026-08-16T00:46:01.445571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:46:01.425080Z","title":"Scenescape: Text-driven consistent scene generation","venue":null,"work_id":"fd2dd1d8-701d-46d0-a381-dab703cf14cd","year":2024},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.476599Z"},"links":{"citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:fa6bc36cd2d95f69dd89f13109a3c79ef8a925714e41ea051ca50d81da265106","observation_id":"0bdf0fae-2176-47be-9e45-fa11483ae749","resolution":{"observed_at":"2026-08-16T00:46:01.430364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:46:01.409756Z","title":"3d-future: 3d furni- ture shape with texture","venue":null,"work_id":"ba232cef-4490-4da9-8e89-0b5d0926718e","year":2021},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.481357Z"},"links":{"citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:5ede88330bab2c2c916c897db9c5b57c586eae717ec626e8ef4bbd45648aaa35","observation_id":"6912fc79-bedf-43a1-89c3-066a6cb85caf","resolution":{"observed_at":"2026-08-16T00:46:01.414634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.04954","last_updated":"2021-12-28T17:03:21Z","snapshot_observed_at":"2026-08-15T19:55:20.506001Z","submitted_at":"2020-07-09T17:33:27Z","title":"ThreeDWorld: A Platform for Interactive Multi-Modal Physical Simulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.04954","snapshot_observed_at":"2026-08-16T00:46:00.485632Z","title":"Threedworld: A platform for interactive multi-modal physical simulation","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.485632Z"},"links":{"cited_paper":"/paper/2007.04954","citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:a002366b12988623d54a85a5e2a145fd04f0899ea75d1457ff40a171b22663c2","observation_id":"884935c8-33d2-46e8-b2dc-472039b342cf","resolution":{"observed_at":"2026-08-16T00:46:00.485632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:46:01.394297Z","title":"Text2room: Extracting textured 3d meshes from 2d text-to-image models","venue":null,"work_id":"ff3b353e-82ec-4470-abc0-2ac0307f4096","year":2023},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.490450Z"},"links":{"citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:947897482eb796c1a00285e90300cda0daea2e66453d8c3a1ead41d8f2707670","observation_id":"5ec0f0c4-eecc-4b16-bacb-b3a3f1dd6cd5","resolution":{"observed_at":"2026-08-16T00:46:01.399192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:46:00.494669Z","title":"Scenecraft: An llm agent for synthesizing 3d scenes as blender code","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.494669Z"},"links":{"citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:df5aad7b01106633dc0a627d0e7ad0c440ff7386fa7141cfaaf0da11b16944cf","observation_id":"a3aec485-98ec-4d27-8753-92b82068fcec","resolution":{"observed_at":"2026-08-16T00:46:00.494669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-16T00:46:00.499364Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.499364Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:477d76ceae1e9750a164d095f7ebab91c30dd38442c2210b9bc390e6c54f75ff","observation_id":"38c1b6d4-d274-41b6-9685-a2ecf388381e","resolution":{"observed_at":"2026-08-16T00:46:00.499364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:46:01.369884Z","title":"Habitat synthetic scenes dataset (hssd-200): An analysis of 3d scene scale and realism tradeoffs for objectgoal navigation","venue":null,"work_id":"dadcc78f-8c87-460e-a5bd-45004908cb49","year":2024},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.504096Z"},"links":{"citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:5711293ec865da16c2a7db23630d30d5a4ad2d3db29f769266c968dcc5c2e8b9","observation_id":"e22eef73-10de-4a20-ac16-f4ff3d092254","resolution":{"observed_at":"2026-08-16T00:46:01.374746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.05474","last_updated":"2022-08-26T17:12:17Z","snapshot_observed_at":"2026-08-14T05:42:22.751765Z","submitted_at":"2017-12-14T23:17:24Z","title":"AI2-THOR: An Interactive 3D Environment for Visual AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.05474","snapshot_observed_at":"2026-08-16T00:46:00.508809Z","title":"Ai2-thor: An interactive 3d environment for visual ai","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.508809Z"},"links":{"cited_paper":"/paper/1712.05474","citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:fd2f8af2ef26a2525033e46baea38ddf2585fee26a896ab463622dc5630a2eeb","observation_id":"bb0d66e1-0446-4196-a93a-3e97cd5a5478","resolution":{"observed_at":"2026-08-16T00:46:00.508809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:46:00.513869Z","title":"Beyond the nav-graph: Vision-and-language navigation in continuous environments","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.513869Z"},"links":{"citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:96c656c7a160c1beac8697743dbf6fd89f7a9aabaa6edb7fb24d31c53cf0286d","observation_id":"1711031c-8e6d-4648-a83f-b689878bc674","resolution":{"observed_at":"2026-08-16T00:46:00.513869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:46:01.345402Z","title":"Scenecraft: Automating interactive narrative scene generation in digital games with large language models","venue":null,"work_id":"c9b49c3a-5049-42fa-8b51-fd5bf3442250","year":2023},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.518657Z"},"links":{"citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:576153f2e0351e42a1dd931e81a7e457e442cf1c552b29fdcd0418ecc6641de7","observation_id":"bea5f99f-8b9b-450e-9a6c-b8ec68cda999","resolution":{"observed_at":"2026-08-16T00:46:01.350361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:46:00.523185Z","title":"Behavior-1k: A benchmark for embodied ai with 1,000 ev- eryday activities and realistic simulation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.523185Z"},"links":{"citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:c304727bfc7c522c263f863f31997d76cb9babf2801185cd2e4c081c200595d6","observation_id":"e127134a-a824-4808-bc7d-64b34f334854","resolution":{"observed_at":"2026-08-16T00:46:00.523185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:46:01.319918Z","title":"Blip- 2: Bootstrapping language-image pre-training with frozen 14 image encoders and large language models","venue":null,"work_id":"c7531dc3-0de8-4601-b902-b5db189ba3f5","year":null},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.527689Z"},"links":{"citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:0400888fff2c0d5f6f8d1dbd82f6ace0b813d165cc5480c391b38aa72716a619","observation_id":"f23b76c8-e24d-46f2-a33f-c9dd7b7eba13","resolution":{"observed_at":"2026-08-16T00:46:01.325201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:46:01.305118Z","title":"Grains: Generative recur- sive autoencoders for indoor scenes","venue":null,"work_id":"1fef5d47-68b6-406e-b032-189e4722d9d1","year":2019},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.532304Z"},"links":{"citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:de20146530ad51488b623f04b7043b5b8a638d8f7a09d8050f782e9636738c26","observation_id":"2ea097fc-9af3-43fc-b2e0-986124f288cc","resolution":{"observed_at":"2026-08-16T00:46:01.309856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:46:01.290351Z","title":"Luciddreamer: Towards high-fidelity text-to-3d generation via interval score matching","venue":null,"work_id":"134411c7-5c70-4f0f-8715-c1f105265a54","year":2024},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.536749Z"},"links":{"citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:f8bde7058bccd3f826ed32e3aecf335af2d662a74a2523fa512d565ea0e0e801","observation_id":"41cf1899-5181-4d00-a72f-790c151566f0","resolution":{"observed_at":"2026-08-16T00:46:01.295297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04717","last_updated":"2024-02-07T10:09:00Z","snapshot_observed_at":"2026-08-16T14:20:41.046988Z","submitted_at":"2024-02-07T10:09:00Z","title":"InstructScene: Instruction-Driven 3D Indoor Scene Synthesis with Semantic Graph Prior","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04717","snapshot_observed_at":"2026-08-16T00:46:00.541434Z","title":"Instructscene: Instruction- driven 3d indoor scene synthesis with semantic graph prior","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.541434Z"},"links":{"cited_paper":"/paper/2402.04717","citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:50c8ceb56cf98e407905cbbeff2dd8b513a05334295161ad481d21402182aa8f","observation_id":"1ca3121f-7f22-4de1-96ee-403841fdfdfe","resolution":{"observed_at":"2026-08-16T00:46:00.541434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:46:01.275559Z","title":"Genusd: 3d scene generation made easy","venue":null,"work_id":"6fa82eaf-f640-4d7c-a0fa-c0325950c762","year":2024},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.546207Z"},"links":{"citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:8399b3b9d8432cd6ee2702f3ecaa23083a08e38c51756ba8cbb71948e1174a7a","observation_id":"a4d22872-d6d0-46fd-a396-79019b37761b","resolution":{"observed_at":"2026-08-16T00:46:01.280210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:46:01.258544Z","title":"Eval- uating text-to-visual generation with image-to-text generation","venue":null,"work_id":"947e2dda-6074-43d4-815c-edec0b663a04","year":2024},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.550596Z"},"links":{"citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:086f0042e3e0d6d4c8f42b69209623f17fd89a188ce7e3f2f2d795b23de90ed3","observation_id":"9520ca1a-b3ac-4df1-b2af-32e2998a1938","resolution":{"observed_at":"2026-08-16T00:46:01.263916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:46:01.241687Z","title":"Eval- uating text-to-visual generation with image-to-text generation","venue":null,"work_id":"6bcbdfce-0ce3-4209-adf7-b4c3c3f4e331","year":2025},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.555303Z"},"links":{"citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:6e3fa34aca10a6d5e3d3b84f4e718f6070a5686f6209dc84d7977b9d7ecb07ff","observation_id":"6b4bd02d-fc9f-4d9f-954c-65aa7dbb715f","resolution":{"observed_at":"2026-08-16T00:46:01.246880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:46:01.226204Z","title":"Dl3dv-10k: A large-scale scene dataset for deep learning- based 3d vision","venue":null,"work_id":"91380399-6262-4ef7-b6e5-97333427f68a","year":2024},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.559737Z"},"links":{"citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:e87de2195c69b7c9ce6c138fdb5880256db9861ec121c982c8ac12f7d5662599","observation_id":"4403f879-94c0-4c53-87d3-046b3fe9f53f","resolution":{"observed_at":"2026-08-16T00:46:01.230960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:46:01.211227Z","title":"End-to-end optimization of scene layout","venue":null,"work_id":"fa392beb-b88c-47f2-8f58-f680141eafb2","year":2020},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.564191Z"},"links":{"citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:477246342789eef19f8f499f715c4a5b2ac60471e8beb77171739db2e82f470e","observation_id":"18b14a8e-3c74-4372-bc8c-6a5aea98cd5c","resolution":{"observed_at":"2026-08-16T00:46:01.215834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:46:01.196082Z","title":"Warp: A high-performance python frame- work for gpu simulation and graphics","venue":null,"work_id":"173848f8-c228-4d89-8868-2d0a70509c05","year":2022},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.568666Z"},"links":{"citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:a4cbcb300880cbe06e39e3fc61fedbbb0dea6aa67a6bb9e942a8b53237f28105","observation_id":"f767d047-803f-419f-92fb-f36f5c59821e","resolution":{"observed_at":"2026-08-16T00:46:01.201150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02523","last_updated":"2024-06-04T17:41:31Z","snapshot_observed_at":"2026-08-16T06:47:25.140028Z","submitted_at":"2024-06-04T17:41:31Z","title":"RoboCasa: Large-Scale Simulation of Everyday Tasks for Generalist Robots","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02523","snapshot_observed_at":"2026-08-16T00:46:00.573094Z","title":"Robocasa: Large-scale simulation of everyday tasks for generalist robots","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.573094Z"},"links":{"cited_paper":"/paper/2406.02523","citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:efdbf6de9efc84235a8b8a7a303935f96684b04c6be7cc6662c26bc0c507c118","observation_id":"5499666d-a9b9-4393-b058-1a35e86065d5","resolution":{"observed_at":"2026-08-16T00:46:00.573094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:46:01.181062Z","title":"Sceneteller: Language-to-3d scene generation","venue":null,"work_id":"8ec0bedf-fa97-46a5-9937-30f8c4466d34","year":2024},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.577945Z"},"links":{"citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:c14450a2cc5dd8be9182c55c157de3b38c358b88c69c14d6f85b0000da69bc1f","observation_id":"d702ca41-f367-4d30-ac7a-e8bb66ed1a0a","resolution":{"observed_at":"2026-08-16T00:46:01.185950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:46:00.582381Z","title":"Atiss: Autoregres- sive transformers for indoor scene synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.582381Z"},"links":{"citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:124bf70e4a3beec14b8705f2122c7ef34aa8dd1129c80d38dadd000f4f30b431","observation_id":"0d8798b5-8f5c-4d45-901c-9e7db6e398fb","resolution":{"observed_at":"2026-08-16T00:46:00.582381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:46:00.587767Z","title":"Pytorch: An imperative style, high-performance deep learning library","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.587767Z"},"links":{"citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:90da1205d6b3274752217cffc4beb5f9721fd8bda8ccdafb425ddbe92d86f8d3","observation_id":"8d7cae58-513b-480f-8ac6-0280cde88938","resolution":{"observed_at":"2026-08-16T00:46:00.587767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:46:00.592392Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.592392Z"},"links":{"citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:adb588bce91d0c2370f25c36db301e6fde17aacd1aa66b1cf3dce0c12bfba852","observation_id":"d88d00f3-c3c8-452c-b8d9-dc85155222c6","resolution":{"observed_at":"2026-08-16T00:46:00.592392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:46:01.135757Z","title":"Infinigen indoors: Photorealistic indoor scenes using procedural gener- ation","venue":null,"work_id":"5a088e23-75dc-474d-aa1d-e116b5a0f7c1","year":null},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.596875Z"},"links":{"citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:0b23387b949c0b646970cd89861f78994c65a081cc837ebda67703efef69ada1","observation_id":"27a30eb3-1573-42a2-bc20-c1ffee7e8827","resolution":{"observed_at":"2026-08-16T00:46:01.140983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.08501","last_updated":"2020-07-16T17:53:02Z","snapshot_observed_at":"2026-08-18T14:53:31.336814Z","submitted_at":"2020-07-16T17:53:02Z","title":"Accelerating 3D Deep Learning with PyTorch3D","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.08501","snapshot_observed_at":"2026-08-16T00:46:00.601729Z","title":"Accelerating 3d deep learning with pytorch3d","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.601729Z"},"links":{"cited_paper":"/paper/2007.08501","citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:f0ed8ca2a6d04b1471925fbaa904531a965dcd1fe598d5dedbfac70f537d29bd","observation_id":"5d5195f3-3016-4302-8371-b5b69dbd24e0","resolution":{"observed_at":"2026-08-16T00:46:00.601729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14159","last_updated":"2024-01-25T13:12:09Z","snapshot_observed_at":"2026-07-06T17:20:25.138890Z","submitted_at":"2024-01-25T13:12:09Z","title":"Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14159","snapshot_observed_at":"2026-08-16T00:46:00.606616Z","title":"Grounded sam: Assembling open-world models for diverse visual tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.606616Z"},"links":{"cited_paper":"/paper/2401.14159","citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:bed3245f1e682d28f0814f0be3aa70518a55caa12622754a3512426a004db9f4","observation_id":"9a7f72a1-2741-40cc-b36e-36058ab1e097","resolution":{"observed_at":"2026-08-16T00:46:00.606616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-19T23:45:08.372528Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02193","snapshot_observed_at":"2026-08-16T00:46:00.612079Z","title":"Layoutvlm: Differentiable optimization of 3d layout via vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.612079Z"},"links":{"cited_paper":"/paper/2412.02193","citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:51ac10347692101f28707b7199de0e3aaf323840ed9488545dcd420ad2feac26","observation_id":"eda677e5-5435-4db7-9840-a55a897ab99a","resolution":{"observed_at":"2026-08-16T00:46:00.612079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:46:01.120299Z","title":"Diffuscene: Denoising diffusion models for generative indoor scene synthesis","venue":null,"work_id":"38420d31-021d-4a05-b418-56165a6e7d73","year":2024},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.616769Z"},"links":{"citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:3dec977b8706f4eb8b86f6ef0302c21c6fa32ab02c1f2e01190569d5a31866b2","observation_id":"f91fcb89-3807-4832-8888-cf720ebc6c16","resolution":{"observed_at":"2026-08-16T00:46:01.125500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:46:01.104287Z","title":"Planit: Planning and in- stantiating indoor scenes with relation graph and spatial prior networks","venue":null,"work_id":"e2c2cebd-4937-49ac-a631-b4ff5821abb2","year":null},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.621850Z"},"links":{"citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:3590af6a719419acf6e067353648827211828515866291b5f7f54e6481d442ff","observation_id":"0226a29a-7dcc-413e-832e-624c5c745b55","resolution":{"observed_at":"2026-08-16T00:46:01.109369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:46:01.088385Z","title":"Sceneformer: Indoor scene generation with transformers","venue":null,"work_id":"e2847cd5-cedd-48e0-9911-c298e56f244d","year":2021},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.626554Z"},"links":{"citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:5c0e6f59021d317acffb928c6f9579e4bde49a8b622a394471f976b9c2a3454e","observation_id":"9f9d1ccd-319f-4036-a8ed-0f817e3767e3","resolution":{"observed_at":"2026-08-16T00:46:01.093355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01455","last_updated":"2024-06-14T21:09:49Z","snapshot_observed_at":"2026-08-19T19:50:01.104627Z","submitted_at":"2023-11-02T17:59:21Z","title":"RoboGen: Towards Unleashing Infinite Data for Automated Robot Learning via Generative Simulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01455","snapshot_observed_at":"2026-08-16T00:46:00.631699Z","title":"Robogen: Towards unleashing infinite data for automated robot learning via generative simulation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.631699Z"},"links":{"cited_paper":"/paper/2311.01455","citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:3e4b36c4787e7c0b44a3c2b9ce850876533ef959d9586056d49b8cabcd53a67c","observation_id":"0bd09022-012e-407a-9c1e-35e9acdd0f89","resolution":{"observed_at":"2026-08-16T00:46:00.631699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:46:01.072571Z","title":"Architect: Generating vivid and interactive 3d 15 scenes with hierarchical 2d inpainting","venue":null,"work_id":"e505fecf-b811-4fab-9f5b-4a1a86ebe477","year":2024},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.636551Z"},"links":{"citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:26b83f17b523f4dac56f879fdaa3267a4aa47ea042e674f742e62356be3bd077","observation_id":"48a97787-726b-4479-8a5c-ea4fb01d055e","resolution":{"observed_at":"2026-08-16T00:46:01.077615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:46:01.055934Z","title":"Reconfusion: 3d re- construction with diffusion priors","venue":null,"work_id":"65c82646-a670-46ae-b95d-e1d0da5d50cf","year":2024},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.641087Z"},"links":{"citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:742d2a6695f341e65958bfefabd17edba8dfc77949e77ca07c11019cc956d068","observation_id":"329e26e4-99eb-4d54-8e0d-ee8e4f0d8219","resolution":{"observed_at":"2026-08-16T00:46:01.061269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:46:01.040736Z","title":"Physcene: Physically interactable 3d scene synthesis for em- bodied ai","venue":null,"work_id":"f8ad6f0d-ad14-46d2-961e-47be821cd812","year":2024},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.645972Z"},"links":{"citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:322d106107c632c57298ccdfc5fdf6b4233f1704863c671402d0590ddc53ce1b","observation_id":"6cb4c01c-6f37-4522-8138-d4db96f93df5","resolution":{"observed_at":"2026-08-16T00:46:01.045517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:46:01.024790Z","title":"Holodeck: Language guided gen- eration of 3d embodied ai environments","venue":null,"work_id":"cff3cf94-86f8-48f1-b963-2de7c2921073","year":2024},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.650570Z"},"links":{"citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:66ef0d5e294389327ea77e59939fddd7b16ba5641cce26cd88325dbdd0f70a11","observation_id":"c269309d-abd9-4e4a-b9d8-a4f926e29e82","resolution":{"observed_at":"2026-08-16T00:46:01.029965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09394","last_updated":"2025-03-25T01:00:11Z","snapshot_observed_at":"2026-08-16T13:43:13.507178Z","submitted_at":"2024-06-13T17:59:10Z","title":"WonderWorld: Interactive 3D Scene Generation from a Single Image","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09394","snapshot_observed_at":"2026-08-16T00:46:00.655062Z","title":"Wonderworld: Interactive 3d scene generation from a single image","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.655062Z"},"links":{"cited_paper":"/paper/2406.09394","citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:eba23657cc181b6524aa7633d380d08f96eb489f9698c77af12d869b5b57c9d2","observation_id":"f1a77a23-8ef8-466c-8c60-8308639681e7","resolution":{"observed_at":"2026-08-16T00:46:00.655062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:46:00.659772Z","title":"Wonderjourney: Going from anywhere to everywhere","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.659772Z"},"links":{"citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:b65eda8486bc37834042f82ce1a691f77d3432ecf7ad753fec3025ea20663b3d","observation_id":"1c83ff4d-58fb-46ab-a5f7-3ec22870a1ab","resolution":{"observed_at":"2026-08-16T00:46:00.659772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:46:00.998178Z","title":"Telling left from right: Identifying geometry-aware semantic corre- spondence","venue":null,"work_id":"cd1a4af6-4dc8-47cb-90eb-257957ee8bd1","year":null},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.664049Z"},"links":{"citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:4e082493613484b27d5e35111bc3d0d3ad1b8f2cef03fca040ad72c8cc828eef","observation_id":"86453762-8db4-49c6-8959-d4e8443694e9","resolution":{"observed_at":"2026-08-16T00:46:01.004290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:46:00.981950Z","title":"Text2nerf: Text-driven 3d scene generation with neu- ral radiance fields","venue":null,"work_id":"02e76394-9a94-486d-a312-16dca42ac514","year":2024},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.669451Z"},"links":{"citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:f0d56576da798bd6c7ae5424f40c93c8f80565f7fe2b2710191ad8770b13e2ad","observation_id":"4bc4cd6f-dc3c-426c-8b19-6ba5a8d203a6","resolution":{"observed_at":"2026-08-16T00:46:00.986549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15971","last_updated":"2024-10-21T12:58:19Z","snapshot_observed_at":"2026-08-18T12:30:08.669763Z","submitted_at":"2024-10-21T12:58:19Z","title":"Zero-Shot Scene Reconstruction from Single Images with Deep Prior Assembly","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15971","snapshot_observed_at":"2026-08-16T00:46:00.674162Z","title":"Zero- shot scene reconstruction from single images with deep prior assembly","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.674162Z"},"links":{"cited_paper":"/paper/2410.15971","citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:ea920c0803dd826a39f1982efb63317d9adad83887a16d458b9ae68f8a27cd55","observation_id":"030a6a4a-9f77-4122-a2f4-64e7f07793c1","resolution":{"observed_at":"2026-08-16T00:46:00.674162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15698","last_updated":"2024-12-17T14:39:07Z","snapshot_observed_at":"2026-08-19T14:20:25.372958Z","submitted_at":"2024-03-23T03:23:29Z","title":"SceneX: Procedural Controllable Large-scale Scene Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15698","snapshot_observed_at":"2026-08-16T00:46:00.679009Z","title":"Scenex: Procedural controllable large-scale scene generation via large-language models.arXiv preprint arXiv:2403.15698, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.679009Z"},"links":{"cited_paper":"/paper/2403.15698","citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:8fca9d1e5903fe7c23025e2ec4a73da7a6ad3beb68ebe11648f2f2b6719dfe80","observation_id":"9b0a44c7-46e4-4a01-9a18-de8412241f5e","resolution":{"observed_at":"2026-08-16T00:46:00.679009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07207","last_updated":"2024-06-11T15:16:37Z","snapshot_observed_at":"2026-08-18T06:36:25.876751Z","submitted_at":"2024-02-11T13:40:08Z","title":"GALA3D: Towards Text-to-3D Complex Scene Generation via Layout-guided Generative Gaussian Splatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07207","snapshot_observed_at":"2026-08-16T00:46:00.683788Z","title":"Gala3d: Towards text-to-3d complex scene generation via layout-guided generative gaussian splatting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.683788Z"},"links":{"cited_paper":"/paper/2402.07207","citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:b8399212d9fde34f8627f2a890d3e581353d6b656a9f1f4b7b6a2315f06790d2","observation_id":"885cbb08-0a9f-4312-b9ab-12a88fd6b039","resolution":{"observed_at":"2026-08-16T00:46:00.683788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:46:00.958335Z","title":"Scenegraphnet: Neural message passing for 3d indoor scene augmentation","venue":null,"work_id":"5ddade49-87e1-45d5-a403-271415359085","year":2019},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.688693Z"},"links":{"citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:27dd5f4a9dfca6bbf64d3da151d609ab7ba854cd5f055f3d6f2b7379c9fef10a","observation_id":"98425961-cc68-497b-a9c7-7ccc4002016e","resolution":{"observed_at":"2026-08-16T00:46:00.971298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":0,"verified_fuzzy":32},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 25 inbound Pith citation observations for arXiv:2505.02836."}