{"as_of":"2026-08-17T20:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:94f1686453e1c3621f93edc3b05712deaccce8c2c3592d5f3d9f5b4c56b264ba","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T23:48:15.371509Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":15,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:38:09.713884Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-07T12:53:50.400526Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02193","snapshot_observed_at":"2026-08-16T11:38:09.713884Z","title":"Layoutvlm: Differentiable optimization of 3d layout via vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.15049","last_updated":"2025-04-21T12:12:43Z","snapshot_observed_at":"2026-08-17T13:45:52.482167Z","submitted_at":"2025-04-21T12:12:43Z","title":"ScanEdit: Hierarchically-Guided Functional 3D Scan Editing","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T11:38:09.713884Z"},"links":{"cited_paper":"/paper/2412.02193","citing_paper":"/paper/2504.15049"},"observation_digest":"sha256:1de339bd850497416c4c462e92b5cd5616b80cb52fd35b2c3e5daa852cb69393","observation_id":"fc7645bf-da88-479f-80c3-f5f96de379e8","resolution":{"observed_at":"2026-08-16T11:38:09.713884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02193","snapshot_observed_at":"2026-08-16T00:46:00.612079Z","title":"Layoutvlm: Differentiable optimization of 3d layout via vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-16T00:37:24.796580Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T00:46:00.612079Z"},"links":{"cited_paper":"/paper/2412.02193","citing_paper":"/paper/2505.02836"},"observation_digest":"sha256:606ea09733eb50ee50913b506b2d713c6c098371d27da14c459f62372ba49dfc","observation_id":"eda677e5-5435-4db7-9840-a55a897ab99a","resolution":{"observed_at":"2026-08-16T00:46:00.612079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02193","snapshot_observed_at":"2026-08-07T11:28:35.387439Z","title":"arXiv preprint arXiv:2412.02193 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02459","last_updated":"2026-06-29T11:06:13Z","snapshot_observed_at":"2026-08-17T13:50:35.422397Z","submitted_at":"2025-06-03T05:22:04Z","title":"ReSpace: Text-Driven Autoregressive 3D Indoor Scene Synthesis and Editing","version":6},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:35.387439Z"},"links":{"cited_paper":"/paper/2412.02193","citing_paper":"/paper/2506.02459"},"observation_digest":"sha256:ddaf598428ab102e10708d91ade3eecc2b2ac3e693e06b75ca9046370bd61f3c","observation_id":"86fe945b-ef27-42b0-aff0-8ed64a02c7fc","resolution":{"observed_at":"2026-08-07T11:28:35.387439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02193","snapshot_observed_at":"2026-08-07T10:44:53.272896Z","title":"Layoutvlm: Differentiable optimization of 3d layout via vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04562","last_updated":"2025-08-20T18:28:36Z","snapshot_observed_at":"2026-08-14T10:50:44.214780Z","submitted_at":"2025-06-05T02:29:42Z","title":"Handle-based Mesh Deformation Guided By Vision Language Model","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T10:44:53.272896Z"},"links":{"cited_paper":"/paper/2412.02193","citing_paper":"/paper/2506.04562"},"observation_digest":"sha256:126d975c32d9851757465e3614415cd25544763cce35d4bf4263716569dd001e","observation_id":"254ee44b-87fe-44e0-9831-d03ce9f537f4","resolution":{"observed_at":"2026-08-07T10:44:53.272896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02193","snapshot_observed_at":"2026-08-06T22:49:02.194039Z","title":"Layoutvlm: Differentiable optimization of 3d layout via vision-language models.arXiv preprint arXiv:2412.02193, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20601","last_updated":"2025-06-25T16:40:17Z","snapshot_observed_at":"2026-08-09T23:30:06.526756Z","submitted_at":"2025-06-25T16:40:17Z","title":"Video Perception Models for 3D Scene Synthesis","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:02.194039Z"},"links":{"cited_paper":"/paper/2412.02193","citing_paper":"/paper/2506.20601"},"observation_digest":"sha256:9f756d22ca3bf0e8d7813a689174f30399f53ed75d96ad5fc72a2e0be4eb2158","observation_id":"ffaa7004-b558-46a1-8dd9-ec650a2b8439","resolution":{"observed_at":"2026-08-06T22:49:02.194039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02193","snapshot_observed_at":"2026-08-06T21:52:17.103306Z","title":"Layoutvlm: Differentiable optimization of 3d layout via vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-13T08:46:09.773891Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:17.103306Z"},"links":{"cited_paper":"/paper/2412.02193","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:17d568dcd21dfb93e5681a0fffeb36d325bcdc9c082499a02bf895bb56699234","observation_id":"56d960d6-db08-4b58-8524-19e5526477d4","resolution":{"observed_at":"2026-08-06T21:52:17.103306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02193","snapshot_observed_at":"2026-08-06T19:55:03.549347Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04451","last_updated":"2025-07-06T16:17:32Z","snapshot_observed_at":"2026-08-17T05:05:00.761342Z","submitted_at":"2025-07-06T16:17:32Z","title":"CoT-lized Diffusion: Let's Reinforce T2I Generation Step-by-step","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.549347Z"},"links":{"cited_paper":"/paper/2412.02193","citing_paper":"/paper/2507.04451"},"observation_digest":"sha256:f63980f734a6d6cfa30b5d3c4c07ae2851249498e198ef621ae73c51331c025c","observation_id":"e5629b80-0571-4fe0-ac2f-9bd72f80e7a7","resolution":{"observed_at":"2026-08-06T19:55:03.549347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02193","snapshot_observed_at":"2026-08-06T19:09:28.680768Z","title":"LayoutVLM: Differentiable optimization of 3D layout via vision-language models.arXiv preprint arXiv:2412.02193,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-13T19:11:35.504924Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T19:09:28.680768Z"},"links":{"cited_paper":"/paper/2412.02193","citing_paper":"/paper/2507.06484"},"observation_digest":"sha256:c6162efbe1f8781d709dd5ba89d6a83af3ffcd0db1a3a7644fabb8e58fa9bd22","observation_id":"189c25ce-7354-44c2-8df8-900b39caf607","resolution":{"observed_at":"2026-08-06T19:09:28.680768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02193","snapshot_observed_at":"2026-08-05T22:23:09.906995Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07135","last_updated":"2025-08-10T01:15:37Z","snapshot_observed_at":"2026-08-16T05:14:57.232941Z","submitted_at":"2025-08-10T01:15:37Z","title":"Canvas3D: Empowering Precise Spatial Control for Image Generation with Constraints from a 3D Virtual Canvas","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-05T22:23:09.906995Z"},"links":{"cited_paper":"/paper/2412.02193","citing_paper":"/paper/2508.07135"},"observation_digest":"sha256:49afc8ef19e90dab3ee55fade197c2177a83a21cd1b4b343aa207de338f9aa6a","observation_id":"f3ffe8f1-c6df-4b91-9845-311658c049dc","resolution":{"observed_at":"2026-08-05T22:23:09.906995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02193","snapshot_observed_at":"2026-08-15T17:00:07.160330Z","title":"LayoutVLM: Differentiable optimization of 3D layout via vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.18597","last_updated":"2025-09-06T19:34:22Z","snapshot_observed_at":"2026-08-17T13:47:50.782888Z","submitted_at":"2025-08-26T02:01:20Z","title":"SemLayoutDiff: Semantic Layout Generation with Diffusion Model for Indoor Scene Synthesis","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T17:00:07.160330Z"},"links":{"cited_paper":"/paper/2412.02193","citing_paper":"/paper/2508.18597"},"observation_digest":"sha256:c40db87e5b35c02c1f4e39d3e6550de6e5df627110490e37d4e0f1bb92a95242","observation_id":"0968b885-b33c-4917-b21f-d5e43dd16988","resolution":{"observed_at":"2026-08-15T17:00:07.160330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"cited_work":{"arxiv_id":"2412.02193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.02193","snapshot_observed_at":"2026-07-07T12:53:50.400526Z","title":"Layoutvlm: Differentiable optimization of 3d layout via vision-language models","venue":"cs.CV","work_id":"c0748cf9-7064-427d-a139-d50eccbe6dbe","year":2024},"citing_paper":{"arxiv_id":"2604.26943","last_updated":"2026-04-29T17:52:17Z","snapshot_observed_at":"2026-07-06T23:12:29.385105Z","submitted_at":"2026-04-29T17:52:17Z","title":"ProcFunc: Function-Oriented Abstractions for Procedural 3D Generation in Python","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-07T08:20:05.847523Z"},"links":{"cited_paper":"/paper/2412.02193","citing_paper":"/paper/2604.26943"},"observation_digest":"sha256:eead1426c9aecb31428b38c876bd857a7dae51c01111d91b835480db9f4ae5fb","observation_id":"e96530ee-f361-49dc-81d0-8573a7ba476e","resolution":{"observed_at":"2026-05-12T10:01:28.850363Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"cited_work":{"arxiv_id":"2412.02193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.02193","snapshot_observed_at":"2026-07-07T12:53:50.400526Z","title":"Layoutvlm: Differentiable optimization of 3d layout via vision-language models","venue":"cs.CV","work_id":"c0748cf9-7064-427d-a139-d50eccbe6dbe","year":2024},"citing_paper":{"arxiv_id":"2605.16137","last_updated":"2026-05-19T15:51:08Z","snapshot_observed_at":"2026-08-15T02:56:05.258916Z","submitted_at":"2026-05-15T16:18:42Z","title":"STABLE: Simulation-Ready Tabletop Layout Generation via a Semantics-Physics Dual System","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-20T19:14:48.069637Z"},"links":{"cited_paper":"/paper/2412.02193","citing_paper":"/paper/2605.16137"},"observation_digest":"sha256:d875815ee438e1975f98fca2ebd8fe1f8b48e79f41fe0d0f7cf03006385354d0","observation_id":"4eb1d6a7-34ae-40f8-b2ad-58f42882f7d5","resolution":{"observed_at":"2026-05-20T19:18:54.675909Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"cited_work":{"arxiv_id":"2412.02193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.02193","snapshot_observed_at":"2026-07-07T12:53:50.400526Z","title":"Layoutvlm: Differentiable optimization of 3d layout via vision-language models","venue":"cs.CV","work_id":"c0748cf9-7064-427d-a139-d50eccbe6dbe","year":2024},"citing_paper":{"arxiv_id":"2605.25326","last_updated":"2026-05-25T01:16:19Z","snapshot_observed_at":"2026-08-12T21:19:04.030063Z","submitted_at":"2026-05-25T01:16:19Z","title":"Perceive-then-Plan: Layout-as-Policy for Monocular 3D Scene Layout Estimation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-29T23:11:59.282627Z"},"links":{"cited_paper":"/paper/2412.02193","citing_paper":"/paper/2605.25326"},"observation_digest":"sha256:718a8ccd8a232e0baaafd14c0cc19be7711c731696b0eb2582d1a13503341840","observation_id":"24a7f4a2-ea31-47fa-8bca-4bae8d2f9f32","resolution":{"observed_at":"2026-06-29T23:14:01.273391Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"cited_work":{"arxiv_id":"2412.02193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.02193","snapshot_observed_at":"2026-07-07T12:53:50.400526Z","title":"Layoutvlm: Differentiable optimization of 3d layout via vision-language models","venue":"cs.CV","work_id":"c0748cf9-7064-427d-a139-d50eccbe6dbe","year":2024},"citing_paper":{"arxiv_id":"2607.02407","last_updated":"2026-07-02T16:40:08Z","snapshot_observed_at":"2026-08-14T16:50:42.382400Z","submitted_at":"2026-07-02T16:40:08Z","title":"Text-Driven 3D Indoor Scene Synthesis in Non-Manhattan Environments","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-07-03T13:21:06.380698Z"},"links":{"cited_paper":"/paper/2412.02193","citing_paper":"/paper/2607.02407"},"observation_digest":"sha256:70d0fb182d49624d9e5a60a86163ac0797eb69cb5766f68eee58326eb28ef47f","observation_id":"0f9fbde0-f7cd-43d1-afdb-1e1ed5342152","resolution":{"observed_at":"2026-07-03T13:28:18.327646Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"cited_work":{"arxiv_id":"2412.02193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.02193","snapshot_observed_at":"2026-07-07T12:53:50.400526Z","title":"Layoutvlm: Differentiable optimization of 3d layout via vision-language models","venue":"cs.CV","work_id":"c0748cf9-7064-427d-a139-d50eccbe6dbe","year":2024},"citing_paper":{"arxiv_id":"2607.05392","last_updated":"2026-07-06T17:59:35Z","snapshot_observed_at":"2026-08-03T16:55:07.344921Z","submitted_at":"2026-07-06T17:59:35Z","title":"SynCity 3000: Bootstrapping Scene-Scale 3D Diffusion","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-07T12:45:05.313584Z"},"links":{"cited_paper":"/paper/2412.02193","citing_paper":"/paper/2607.05392"},"observation_digest":"sha256:2af7fa10531b29875d4638138c737117e772b9e2bc6b5b66ee8ed7876310ef70","observation_id":"69399460-b668-4f77-a536-3f960aa7ea98","resolution":{"observed_at":"2026-07-07T12:53:50.402579Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.02193/citation-record","integrity":"/paper/2412.02193/integrity","json":"/paper/2412.02193/citation-record.json","paper":"/paper/2412.02193"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:48:15.182285Z","title":"Lego-net: Learning regular rearrangements of ob- jects in rooms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T23:48:15.182285Z"},"links":{"citing_paper":"/paper/2412.02193"},"observation_digest":"sha256:29e4e4d82efed10c7c63fc756bb93092f411d89b20ff00bef33cbbff7f6634d3","observation_id":"6d6ddcd9-9b63-45a6-85dd-07989b7eff82","resolution":{"observed_at":"2026-08-11T23:48:15.182285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:48:16.009251Z","title":"House- gan++: Generative adversarial layout refinement network towards intelligent computational agent for professional archi- tects","venue":null,"work_id":"4849172e-4c30-439c-bd6b-c8e3d3c1adfa","year":2021},"citing_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T23:48:15.187003Z"},"links":{"citing_paper":"/paper/2412.02193"},"observation_digest":"sha256:ec5fb2e9a8ae78b37c287f2b5cdb6be1ccf0646a5d4ace42f715922fca044af9","observation_id":"b7dbb07f-49ec-48d8-a1f2-ea6eaffcefb6","resolution":{"observed_at":"2026-08-11T23:48:16.013420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:48:15.190934Z","title":"Atiss: Autoregres- sive transformers for indoor scene synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T23:48:15.190934Z"},"links":{"citing_paper":"/paper/2412.02193"},"observation_digest":"sha256:80dfb748b89bbd98a09225e0c94c3a513ada5d8e76ce61ce69be1a2cb11a958f","observation_id":"51d7a2b4-2741-4856-befc-0f7b2269f093","resolution":{"observed_at":"2026-08-11T23:48:15.190934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:48:15.990952Z","title":"Layoutgpt: Compositional visual plan- ning and generation with large language models","venue":null,"work_id":"839c97b3-a0c8-4e75-bf46-fbe3c102375c","year":2024},"citing_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T23:48:15.195048Z"},"links":{"citing_paper":"/paper/2412.02193"},"observation_digest":"sha256:969c45302eee6d303d3a0ec83cf4acc1d67dac5bfbe1cbfb5843077bea5b7bf3","observation_id":"e29642a8-ecc7-4fca-ab68-285e83185fd0","resolution":{"observed_at":"2026-08-11T23:48:15.994742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:48:15.980425Z","title":"Holodeck: Language guided gen- eration of 3d embodied ai environments","venue":null,"work_id":"48586478-026b-42b7-b6cf-ee5eac5e6e27","year":2024},"citing_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T23:48:15.198795Z"},"links":{"citing_paper":"/paper/2412.02193"},"observation_digest":"sha256:dff6d4f839de91b494a67be8fc5c42fce24b9d66460a7c79b90ba9b20338af87","observation_id":"23ce5c91-3468-467e-9c27-03cc0f999f95","resolution":{"observed_at":"2026-08-11T23:48:15.984130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:48:15.969522Z","title":"Controlroom3d: Room generation using semantic proxy rooms","venue":null,"work_id":"a436614a-c4bc-45c0-abc0-11ca202d3778","year":2024},"citing_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T23:48:15.202240Z"},"links":{"citing_paper":"/paper/2412.02193"},"observation_digest":"sha256:2227e8cd33d72ec55566a7f9682da34423700701ff2e492dcc3bb015363aee96","observation_id":"e10ca49f-b47f-4b15-b57c-353f0ca7dde2","resolution":{"observed_at":"2026-08-11T23:48:15.973341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07207","last_updated":"2024-06-11T15:16:37Z","snapshot_observed_at":"2026-08-16T14:19:33.130505Z","submitted_at":"2024-02-11T13:40:08Z","title":"GALA3D: Towards Text-to-3D Complex Scene Generation via Layout-guided Generative Gaussian Splatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07207","snapshot_observed_at":"2026-08-11T23:48:15.205782Z","title":"Gala3d: Towards text-to-3d complex scene generation via layout-guided generative gaussian splatting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T23:48:15.205782Z"},"links":{"cited_paper":"/paper/2402.07207","citing_paper":"/paper/2412.02193"},"observation_digest":"sha256:2c219166086aba086e0cedb654e04bf3a71580519858fa22b31a1e5ec441d355","observation_id":"a4222826-c1cd-4b82-a1b5-6bb00f437a43","resolution":{"observed_at":"2026-08-11T23:48:15.205782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:48:15.959020Z","title":"Compositional 3d scene generation using locally conditioned diffusion","venue":null,"work_id":"1e87abde-58a1-4ff4-bea2-71277f2e0399","year":2024},"citing_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T23:48:15.210041Z"},"links":{"citing_paper":"/paper/2412.02193"},"observation_digest":"sha256:0d91cd147724ebe39b09fcbe4150ef3efdb6ba422c7a3168522a5ed707e8afdd","observation_id":"23be55f6-ed98-4e59-a814-f3d6829a55c0","resolution":{"observed_at":"2026-08-11T23:48:15.962688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16936","last_updated":"2024-02-26T18:54:15Z","snapshot_observed_at":"2026-08-16T14:15:11.923214Z","submitted_at":"2024-02-26T18:54:15Z","title":"Disentangled 3D Scene Generation with Layout Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16936","snapshot_observed_at":"2026-08-11T23:48:15.213463Z","title":"Disentangled 3d scene generation with layout learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T23:48:15.213463Z"},"links":{"cited_paper":"/paper/2402.16936","citing_paper":"/paper/2412.02193"},"observation_digest":"sha256:10c078c39a09cdcbaea267cf19019747efbef94e64c1554fed054612f2371124","observation_id":"4bf646e7-10c9-475c-978b-25146c521a2e","resolution":{"observed_at":"2026-08-11T23:48:15.213463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00687","last_updated":"2024-06-04T16:19:47Z","snapshot_observed_at":"2026-08-17T14:01:31.462530Z","submitted_at":"2024-06-02T09:48:19Z","title":"Lay-A-Scene: Personalized 3D Object Arrangement Using Text-to-Image Priors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00687","snapshot_observed_at":"2026-08-11T23:48:15.217474Z","title":"Lay-a-scene: Personalized 3d object arrangement using text-to-image priors","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T23:48:15.217474Z"},"links":{"cited_paper":"/paper/2406.00687","citing_paper":"/paper/2412.02193"},"observation_digest":"sha256:131cd454f69e24c074614ed2373c687d5621350c8b417bbf8d8bf72ffb70d2f4","observation_id":"4431e7e0-7cdd-4423-a6f0-20d5e5831367","resolution":{"observed_at":"2026-08-11T23:48:15.217474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:48:15.948342Z","title":"Any- home: Open-vocabulary generation of structured and textured 3d homes","venue":null,"work_id":"326ee7b4-3d24-4111-9d5f-9c6119f58952","year":2025},"citing_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T23:48:15.221486Z"},"links":{"citing_paper":"/paper/2412.02193"},"observation_digest":"sha256:d5996bcb66c08963f3f3078efa6cf35b24ec6a4dcbcb229ad717746dd321e1ae","observation_id":"b42060f2-8b4d-4e2d-8dd6-4860706157bb","resolution":{"observed_at":"2026-08-11T23:48:15.952253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04717","last_updated":"2024-02-07T10:09:00Z","snapshot_observed_at":"2026-08-16T14:20:41.046988Z","submitted_at":"2024-02-07T10:09:00Z","title":"InstructScene: Instruction-Driven 3D Indoor Scene Synthesis with Semantic Graph Prior","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04717","snapshot_observed_at":"2026-08-11T23:48:15.225038Z","title":"Instructscene: Instruction- driven 3d indoor scene synthesis with semantic graph prior","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T23:48:15.225038Z"},"links":{"cited_paper":"/paper/2402.04717","citing_paper":"/paper/2412.02193"},"observation_digest":"sha256:d9b2f6d2b858d1ab8ef6a2f951adbc47f949e398205cc5a984dc2737fdc3cd57","observation_id":"2932abca-4467-43b8-a6ba-b08badf07fe0","resolution":{"observed_at":"2026-08-11T23:48:15.225038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:48:15.228739Z","title":"I-design: Personal- ized llm interior designer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T23:48:15.228739Z"},"links":{"citing_paper":"/paper/2412.02193"},"observation_digest":"sha256:f138724be4a1b149573b63f4efa01632204ee0ba4d701bc4d09657babb026e0f","observation_id":"395a8679-064f-417b-8626-ab0ea59b5ff0","resolution":{"observed_at":"2026-08-11T23:48:15.228739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09675","last_updated":"2024-02-05T01:59:31Z","snapshot_observed_at":"2026-08-16T14:21:36.680301Z","submitted_at":"2024-02-05T01:59:31Z","title":"Open-Universe Indoor Scene Generation using LLM Program Synthesis and Uncurated Object Databases","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09675","snapshot_observed_at":"2026-08-11T23:48:15.232570Z","title":"Open-universe indoor scene generation using llm program synthesis and uncurated object databases","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T23:48:15.232570Z"},"links":{"cited_paper":"/paper/2403.09675","citing_paper":"/paper/2412.02193"},"observation_digest":"sha256:23a37217e1730a7df9fb405429d9b16387870830235372a1e8ccab43baf280a2","observation_id":"c8136846-15eb-4e25-9dde-ac0a732f0a55","resolution":{"observed_at":"2026-08-11T23:48:15.232570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:48:15.236452Z","title":"3d-llm: Injecting the 3d world into large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T23:48:15.236452Z"},"links":{"citing_paper":"/paper/2412.02193"},"observation_digest":"sha256:8d5e72a8ae0f05dced9dbd8b8c96e8d2993c06f1a039616504c0a1969c0ee060","observation_id":"d29277ef-75ff-4214-a4f4-f443bc873c54","resolution":{"observed_at":"2026-08-11T23:48:15.236452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05132","last_updated":"2025-03-20T23:06:14Z","snapshot_observed_at":"2026-08-16T19:30:31.655964Z","submitted_at":"2024-06-07T17:59:59Z","title":"3D-GRAND: A Million-Scale Dataset for 3D-LLMs with Better Grounding and Less Hallucination","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05132","snapshot_observed_at":"2026-08-11T23:48:15.239557Z","title":"3d-grand: A million-scale dataset for 3d-llms with better grounding and less hallucination","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T23:48:15.239557Z"},"links":{"cited_paper":"/paper/2406.05132","citing_paper":"/paper/2412.02193"},"observation_digest":"sha256:ad7cdce58c1d0212e3e43f294e43e7c44778595f3682da8fb07c737164e2f538","observation_id":"4c3d2d28-f487-4537-897c-3bcef10e31c9","resolution":{"observed_at":"2026-08-11T23:48:15.239557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11401","last_updated":"2024-03-22T18:52:51Z","snapshot_observed_at":"2026-08-17T15:42:36.096154Z","submitted_at":"2024-03-18T01:18:48Z","title":"Scene-LLM: Extending Language Model for 3D Visual Understanding and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11401","snapshot_observed_at":"2026-08-11T23:48:15.243345Z","title":"Scene-llm: Extending language model for 3d visual understanding and reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T23:48:15.243345Z"},"links":{"cited_paper":"/paper/2403.11401","citing_paper":"/paper/2412.02193"},"observation_digest":"sha256:85232cba4132a0414a8116d2ea05ff495d2711c8c8192a353dea8dd27699479d","observation_id":"5c733c3f-09c1-494e-80a9-27acd6f49e68","resolution":{"observed_at":"2026-08-11T23:48:15.243345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:48:15.932038Z","title":"Ll3da: Visual interactive instruction tuning for omni-3d understand- ing reasoning and planning","venue":null,"work_id":"069ccefb-9b52-4242-b860-3f468db0a479","year":2024},"citing_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T23:48:15.246877Z"},"links":{"citing_paper":"/paper/2412.02193"},"observation_digest":"sha256:71291a1a782fe026b89c0cfca961d8e9f78abc117d82199a4311fce6e1d3d0d7","observation_id":"22c09669-ef9d-45bd-86b4-c2f77c9c7239","resolution":{"observed_at":"2026-08-11T23:48:15.935699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:48:15.921773Z","title":"Gpt4point: A unified framework for point-language understanding and generation","venue":null,"work_id":"fcb5372f-d5a5-40a3-b133-98f52176b37e","year":2024},"citing_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T23:48:15.249838Z"},"links":{"citing_paper":"/paper/2412.02193"},"observation_digest":"sha256:e5039c32ab90aaa95bcdb47358bdb95a851520a7a87dfe8c7f471650b0df6afe","observation_id":"5b0d31eb-8328-4b88-b4a8-6a0da23fdc75","resolution":{"observed_at":"2026-08-11T23:48:15.925437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:48:15.911503Z","title":"Pointllm: Empowering large language models to understand point clouds","venue":null,"work_id":"0058cd62-00e1-417e-8ed0-2c5cecb062ef","year":2024},"citing_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T23:48:15.253279Z"},"links":{"citing_paper":"/paper/2412.02193"},"observation_digest":"sha256:15182ce94eacebaa27a7bc4676fe9faf26b2e29f80fef7d467670972ee597784","observation_id":"9711f590-b682-4a98-b062-490b481bb930","resolution":{"observed_at":"2026-08-11T23:48:15.915172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:48:15.902853Z","title":"Chat-scene: Bridging 3d scene and large language models with object identifiers","venue":null,"work_id":"34a9dbfc-f547-4389-8e08-ede197e1c93a","year":2024},"citing_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T23:48:15.256402Z"},"links":{"citing_paper":"/paper/2412.02193"},"observation_digest":"sha256:4bef55f9ec6ffe205ff53cc76e3639bceaa38130d031a65e9e98d1c7c23720e2","observation_id":"49a8f54d-1cfb-4ab0-b06e-dcdfd3087ceb","resolution":{"observed_at":"2026-08-11T23:48:15.905805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:48:15.893625Z","title":"Spatialvlm: Endowing vision-language models with spatial reasoning capabilities","venue":null,"work_id":"9a15606c-3926-493d-8269-1b4483974307","year":2024},"citing_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T23:48:15.259466Z"},"links":{"citing_paper":"/paper/2412.02193"},"observation_digest":"sha256:420fd27502dea620786b51e942d1f6fe99eddfbbbbc182454ad9a8ccb7adf20c","observation_id":"8e343bae-1874-4a32-af99-75971b360f05","resolution":{"observed_at":"2026-08-11T23:48:15.897193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01584","last_updated":"2024-10-15T01:16:20Z","snapshot_observed_at":"2026-08-16T13:46:36.421633Z","submitted_at":"2024-06-03T17:59:06Z","title":"SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01584","snapshot_observed_at":"2026-08-11T23:48:15.262522Z","title":"Spatial- rgpt: Grounded spatial reasoning in vision language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T23:48:15.262522Z"},"links":{"cited_paper":"/paper/2406.01584","citing_paper":"/paper/2412.02193"},"observation_digest":"sha256:d4efb056cd3fb6939246bd10b97bc7cdb3c91ce59cca4ac94272871980c7f302","observation_id":"9ada32df-b4a2-4556-8cc0-ffa8e2d7a687","resolution":{"observed_at":"2026-08-11T23:48:15.262522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13064","last_updated":"2024-03-19T18:01:29Z","snapshot_observed_at":"2026-08-16T14:08:17.044200Z","submitted_at":"2024-03-19T18:01:29Z","title":"SceneScript: Reconstructing Scenes With An Autoregressive Structured Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13064","snapshot_observed_at":"2026-08-11T23:48:15.266016Z","title":"Scene- script: Reconstructing scenes with an autoregressive struc- tured language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T23:48:15.266016Z"},"links":{"cited_paper":"/paper/2403.13064","citing_paper":"/paper/2412.02193"},"observation_digest":"sha256:a78462e63538ceb12fc9fe5e109bbd2d29457053dce6feb03588cad746a742d8","observation_id":"967c1500-952a-46ca-adf0-f0d3bb7486a7","resolution":{"observed_at":"2026-08-11T23:48:15.266016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11835","last_updated":"2024-03-18T14:47:03Z","snapshot_observed_at":"2026-08-16T14:08:46.652701Z","submitted_at":"2024-03-18T14:47:03Z","title":"Agent3D-Zero: An Agent for Zero-shot 3D Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11835","snapshot_observed_at":"2026-08-11T23:48:15.269947Z","title":"Agent3d-zero: 10 An agent for zero-shot 3d understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T23:48:15.269947Z"},"links":{"cited_paper":"/paper/2403.11835","citing_paper":"/paper/2412.02193"},"observation_digest":"sha256:396ce70869f07a0f7ae399d165194023cfc57326a495b3b0be1cb661f53e7193","observation_id":"9d0ad26c-a010-45e9-a9ae-d7b3fb6c9efa","resolution":{"observed_at":"2026-08-11T23:48:15.269947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11441","last_updated":"2023-11-06T07:39:49Z","snapshot_observed_at":"2026-08-12T21:25:32.312122Z","submitted_at":"2023-10-17T17:51:31Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11441","snapshot_observed_at":"2026-08-11T23:48:15.273510Z","title":"Set-of-mark prompting unleashes extraordinary visual grounding in gpt-4v","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T23:48:15.273510Z"},"links":{"cited_paper":"/paper/2310.11441","citing_paper":"/paper/2412.02193"},"observation_digest":"sha256:e85926137bdce4d73ac46e5e4e37d6c77373a225851850027190ba675950e469","observation_id":"cf573247-a95a-4d89-ac37-18f59cc6a25d","resolution":{"observed_at":"2026-08-11T23:48:15.273510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:48:15.884957Z","title":"Making large multimodal models understand arbitrary visual prompts","venue":null,"work_id":"33a4785f-6e25-4047-9a68-5fcf00f6290b","year":2024},"citing_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T23:48:15.276963Z"},"links":{"citing_paper":"/paper/2412.02193"},"observation_digest":"sha256:9be13741a5b0bf30449518214db03b5c5f1d45d7b80e0532ac0891ebb842bdc7","observation_id":"b8e90c9a-ebdc-4051-8844-98c479e8168d","resolution":{"observed_at":"2026-08-11T23:48:15.888073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12058","last_updated":"2024-02-19T11:23:53Z","snapshot_observed_at":"2026-08-17T06:16:14.298736Z","submitted_at":"2024-02-19T11:23:53Z","title":"Scaffolding Coordinates to Promote Vision-Language Coordination in Large Multi-Modal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12058","snapshot_observed_at":"2026-08-11T23:48:15.280493Z","title":"Scaffolding coordinates to promote vision-language coordination in large multi-modal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T23:48:15.280493Z"},"links":{"cited_paper":"/paper/2402.12058","citing_paper":"/paper/2412.02193"},"observation_digest":"sha256:ce0a029737c42438fced5b06d4fd10a6fb81763e19afe861d8cadb6f4e030500","observation_id":"b32eace2-2241-4156-86fb-7e8cccf9698e","resolution":{"observed_at":"2026-08-11T23:48:15.280493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T23:48:15.284054Z","title":"GPT-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T23:48:15.284054Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.02193"},"observation_digest":"sha256:5d9295e7967b0ad03a5ec74091b2a6c73092e90e200911c8991b90aa4b770648","observation_id":"20dbff0f-dfc9-401b-9b77-0939d86b169f","resolution":{"observed_at":"2026-08-11T23:48:15.284054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:48:15.875559Z","title":"Self-consistency improves chain of thought reasoning in lan- guage models","venue":null,"work_id":"db27f0cf-dfcd-4d0b-883d-486ebec2034d","year":2023},"citing_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T23:48:15.287557Z"},"links":{"citing_paper":"/paper/2412.02193"},"observation_digest":"sha256:870a3a7190fd1f4ddc05c70243c7b45d08bdf755db9ff4334b0fcb9d61729ab1","observation_id":"16fffcb9-f2e8-4239-938d-8391968d01c7","resolution":{"observed_at":"2026-08-11T23:48:15.879349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:48:15.865775Z","title":"Distance-iou loss: Faster and better learning for bounding box regression","venue":null,"work_id":"8e6e1a21-95c5-4d12-909f-675b8f94ffcc","year":2020},"citing_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T23:48:15.290905Z"},"links":{"citing_paper":"/paper/2412.02193"},"observation_digest":"sha256:cf78c4fb22bd02a60f876605f1a70ccb610a12c3fc797fdf92304af1d5ce8e7c","observation_id":"8c31f780-a1b3-44e7-853b-f45d3f2912de","resolution":{"observed_at":"2026-08-11T23:48:15.869688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:48:15.855249Z","title":"Iou loss for 2d/3d object detection","venue":null,"work_id":"7fbfa0cd-ce12-45c0-92f1-e059a26d6267","year":2019},"citing_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T23:48:15.294363Z"},"links":{"citing_paper":"/paper/2412.02193"},"observation_digest":"sha256:e25c5088b3c1716056039401a555ac5df8edfc4bfaf1eddef12f93cfad6fd1a8","observation_id":"d6380aa2-385d-4c96-9914-232c4ce9d792","resolution":{"observed_at":"2026-08-11T23:48:15.858945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-08-13T00:09:23.835117Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-11T23:48:15.298019Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T23:48:15.298019Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2412.02193"},"observation_digest":"sha256:4fc10b2bbcc4c15e766f299faf127078e0c5e21c62a580b6762116de41d3789c","observation_id":"ab50028a-55f3-4933-87fd-7fcfd6f0284b","resolution":{"observed_at":"2026-08-11T23:48:15.298019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:48:15.843215Z","title":"Objaverse: A universe of annotated 3d objects","venue":null,"work_id":"2c3c909e-bf6b-403f-acdc-098555342af9","year":2023},"citing_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T23:48:15.301981Z"},"links":{"citing_paper":"/paper/2412.02193"},"observation_digest":"sha256:d645a5365cab8134978279b4f6d5e0bd7aaa7106673772c1f73e0cae4d5b8771","observation_id":"00e1d099-1f22-4d88-8566-e30a3ea59b58","resolution":{"observed_at":"2026-08-11T23:48:15.846888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:48:15.833585Z","title":"Gpt-4v (ision) is a human-aligned evaluator for text-to-3d generation","venue":null,"work_id":"5c36a8f6-1389-4da1-8fe1-fd9b24ab628b","year":2024},"citing_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T23:48:15.306105Z"},"links":{"citing_paper":"/paper/2412.02193"},"observation_digest":"sha256:bed58134e3f55c920381717ae4c1a8404800c26670b774e398b29e3067ea2194","observation_id":"7a177637-c3e3-4ea3-b83e-cf8df995c60d","resolution":{"observed_at":"2026-08-11T23:48:15.837367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:48:15.824148Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"055b69d5-229d-459a-a969-1d66a72052b4","year":2021},"citing_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T23:48:15.310608Z"},"links":{"citing_paper":"/paper/2412.02193"},"observation_digest":"sha256:381b4958f3322c3e192c996c484a37172cde3ae5708381adf733492917e63f02","observation_id":"cce554ee-f073-4002-b4da-95908ac86b30","resolution":{"observed_at":"2026-08-11T23:48:15.827749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:48:15.814665Z","title":"Based on the assets, you should describe the general layout of the scene, the types of assets present, and any notable features","venue":null,"work_id":"35fb78e7-7db3-4847-bbea-bc808771340f","year":null},"citing_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T23:48:15.314459Z"},"links":{"citing_paper":"/paper/2412.02193"},"observation_digest":"sha256:257775dc5677d8e96f5c05ea7ab031b727cc92665a07a12c679046cde0b49e8f","observation_id":"0c85c859-f66e-42fb-840a-faffcd21986e","resolution":{"observed_at":"2026-08-11T23:48:15.818267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:48:15.805671Z","title":"You should consider the functional, semantic, and geometric relationships between the assets","venue":null,"work_id":"22d77854-a10f-49fa-b6ac-6b3f65cb46dc","year":null},"citing_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T23:48:15.317866Z"},"links":{"citing_paper":"/paper/2412.02193"},"observation_digest":"sha256:5d5d04437ca8a84816d543a43e8c35bca825e0d7547ba535a591de924c4af413","observation_id":"01ec0038-57dc-476d-a99c-436b2f49f40a","resolution":{"observed_at":"2026-08-11T23:48:15.809190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:48:15.796841Z","title":"You should explain the rationale behind each group and how the assets within each group are related to each other","venue":null,"work_id":"aa9dcb77-b6c9-4c4a-b490-c2d73a695566","year":null},"citing_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T23:48:15.321001Z"},"links":{"citing_paper":"/paper/2412.02193"},"observation_digest":"sha256:83abd350241b0474bce273795200f546700bcd44f4eb8276c86f07c4862cabe0","observation_id":"3bc13331-ae60-4c8d-b6cd-5174fea093cd","resolution":{"observed_at":"2026-08-11T23:48:15.800034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:48:15.788534Z","title":"You should consider the significance of each group and the logical flow of the scene layout","venue":null,"work_id":"30a88e15-65f6-4988-9bb4-c861a8647e3f","year":null},"citing_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T23:48:15.324209Z"},"links":{"citing_paper":"/paper/2412.02193"},"observation_digest":"sha256:15699e10839e36e3a56eaf21ff7a3aad5692a4e2e32c33a9f9fe2df153bf438b","observation_id":"e28ee188-53b3-423c-bc43-563a25c7fc72","resolution":{"observed_at":"2026-08-11T23:48:15.791749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:48:15.779861Z","title":"**Example:** Suppose you are examining a bedroom scene","venue":null,"work_id":"03a42a30-de0b-47b7-97fc-8c940c043a80","year":null},"citing_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T23:48:15.327335Z"},"links":{"citing_paper":"/paper/2412.02193"},"observation_digest":"sha256:47bac875b20fd4da93fa74c4af0c13cb5b07e13acc9c0f2b83a13c07a352c3dc","observation_id":"e8af38f1-ae42-4329-8ad0-6c7548387578","resolution":{"observed_at":"2026-08-11T23:48:15.783030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:48:15.770156Z","title":null,"venue":null,"work_id":"41fb0072-b91b-4c1a-b6a2-cfa4fd2501b3","year":null},"citing_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T23:48:15.330266Z"},"links":{"citing_paper":"/paper/2412.02193"},"observation_digest":"sha256:68b8f5326e8732ab6b833abe9a3c585cddc5e11bd7d23e77561c8106ed7ecc5d","observation_id":"ae6cd132-b61e-4fe6-870e-d02da1724fcd","resolution":{"observed_at":"2026-08-11T23:48:15.773437Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:48:15.760768Z","title":"The bedside table should be close to the bed for easy access","venue":null,"work_id":"aba2de94-f507-479d-a412-8b9f26e06303","year":null},"citing_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T23:48:15.333285Z"},"links":{"citing_paper":"/paper/2412.02193"},"observation_digest":"sha256:059683ed7bc08e091600fe6d0deffd14abf689ac28393372eeb2604a578e3b22","observation_id":"234dce07-c011-46b0-832e-6b02a61c0193","resolution":{"observed_at":"2026-08-11T23:48:15.764413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:48:15.750880Z","title":"The rational is that the bed is the central piece, the nightstand is next to the bed, and the lamp is on the nightstand","venue":null,"work_id":"39f4f080-f16e-46b1-bb8f-5e8901cac827","year":null},"citing_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T23:48:15.336405Z"},"links":{"citing_paper":"/paper/2412.02193"},"observation_digest":"sha256:f95b7d4ee397590cb61f4f0264f576c72cb9392eb978607baf337228d33c02fc","observation_id":"497c45bf-ecbb-4cc2-963c-fcb7a1575a90","resolution":{"observed_at":"2026-08-11T23:48:15.754694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:48:15.740712Z","title":"They should be placed first to establish the sleeping area","venue":null,"work_id":"b4e2a57f-2683-477e-9945-e126dc51821d","year":null},"citing_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T23:48:15.340329Z"},"links":{"citing_paper":"/paper/2412.02193"},"observation_digest":"sha256:3a861035645601f75b68d61de4e6f8e6c8df9f5eb8e2dc5ec66a696fe2655f82","observation_id":"91ae464a-d310-48a2-bbb7-cfdb217b3253","resolution":{"observed_at":"2026-08-11T23:48:15.744210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:48:15.731007Z","title":"list\": [ {","venue":null,"work_id":"7acf8b6a-b104-4e2e-84dc-2c17efe5b294","year":null},"citing_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T23:48:15.343804Z"},"links":{"citing_paper":"/paper/2412.02193"},"observation_digest":"sha256:2e56db0d7a2ec02d0a107da07ef9b7a92efb1fa5f6968a837cd7697c7fe1f744","observation_id":"303474b0-4a4c-4de8-b529-547fcca635d5","resolution":{"observed_at":"2026-08-11T23:48:15.734461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:48:15.720722Z","title":null,"venue":null,"work_id":"f1dcdf6f-4d03-45b8-86c6-46c5cfc869c7","year":null},"citing_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T23:48:15.347846Z"},"links":{"citing_paper":"/paper/2412.02193"},"observation_digest":"sha256:0d4d2a81971280dfded2fcef6fd85565d8898af18e62db25f1bc79d6f1d8b7bc","observation_id":"e7fc0ccc-1438-47ba-80c7-3a9a6b3bdb6e","resolution":{"observed_at":"2026-08-11T23:48:15.724547Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:48:15.710437Z","title":null,"venue":null,"work_id":"05029eb1-8a46-46b5-8d77-4e144604a062","year":null},"citing_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T23:48:15.351385Z"},"links":{"citing_paper":"/paper/2412.02193"},"observation_digest":"sha256:af1970f1aa6944eb69ec1e146320d077932acbab52bf71d0323658cf9109faf0","observation_id":"67b3da58-7adc-41ed-9337-cf696fd92c3e","resolution":{"observed_at":"2026-08-11T23:48:15.714168Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:48:15.699867Z","title":null,"venue":null,"work_id":"5e3dcf4b-f7a1-401b-b223-ef9fa8441929","year":null},"citing_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T23:48:15.354739Z"},"links":{"citing_paper":"/paper/2412.02193"},"observation_digest":"sha256:622365b0fc9d66eec7c39eb5cb64f15c1ed48139765af0f5f7abf403a0597db2","observation_id":"9c617651-d7a3-4cc2-a35c-1117fa7d1286","resolution":{"observed_at":"2026-08-11T23:48:15.703340Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:48:15.688240Z","title":"Walls are also labeled with orientation arrows","venue":null,"work_id":"fb532b6e-bf1f-402d-a02a-e9a335156b14","year":null},"citing_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T23:48:15.357989Z"},"links":{"citing_paper":"/paper/2412.02193"},"observation_digest":"sha256:4ef5c049ccb493f797d1a4d6caff622255d7f59d6ca7051c29e043145dbaa827","observation_id":"cd4739c3-f68d-4cf0-b111-1f10cc718f05","resolution":{"observed_at":"2026-08-11T23:48:15.692093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:48:15.677790Z","title":null,"venue":null,"work_id":"6c4bbd0b-862b-4304-aaed-775d0d87f0ef","year":null},"citing_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T23:48:15.361459Z"},"links":{"citing_paper":"/paper/2412.02193"},"observation_digest":"sha256:49acfcaa005113300030bdf9e26bdaad753c141b27f32f4ca8ede2b5513639ee","observation_id":"8adbdb27-7f26-461e-9aee-000406a4345c","resolution":{"observed_at":"2026-08-11T23:48:15.681188Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:48:15.667740Z","title":"Your task is to write a program that:","venue":null,"work_id":"00da4e63-bbe6-4033-9ed4-1dad433cfd07","year":null},"citing_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T23:48:15.364928Z"},"links":{"citing_paper":"/paper/2412.02193"},"observation_digest":"sha256:e00e9e9ad5ad4e5cf58e721f9e6dcab22aa3bbfb0e3c063af369d0647f7d32da","observation_id":"9d80e8ce-67e5-40d8-8b4e-38b5c7b44180","resolution":{"observed_at":"2026-08-11T23:48:15.671819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:48:15.658391Z","title":null,"venue":null,"work_id":"1e473bf7-5309-463a-b0e9-969393a7a06b","year":null},"citing_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T23:48:15.368167Z"},"links":{"citing_paper":"/paper/2412.02193"},"observation_digest":"sha256:77c657617331161813be72a79284f8452a57be207cbc04ecb122f45540e846b1","observation_id":"a2546d91-7b76-450a-8d9e-dac5a9b5281f","resolution":{"observed_at":"2026-08-11T23:48:15.661343Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:48:15.647482Z","title":"point towards","venue":null,"work_id":"3b5d5b2d-8b3c-4bd8-8f87-dbe4d07f44bf","year":1980},"citing_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T23:48:15.371509Z"},"links":{"citing_paper":"/paper/2412.02193"},"observation_digest":"sha256:3e797155237deb40262d2eaab90b49e47293a7bb786f035d07adf9422048a1d6","observation_id":"d0891190-bf54-41b4-9b5c-75344f43bdf4","resolution":{"observed_at":"2026-08-11T23:48:15.651923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T03:14:47.358032Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":23,"verified_exact":0,"verified_fuzzy":30},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 15 inbound Pith citation observations for arXiv:2412.02193."}