{"as_of":"2026-08-10T07:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cac71b08fc019e97c73997f20f92cf976e9ee54900e28c1fea2f60ffc1911229","coverage":[{"denominator":89,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":89,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:52:19.061479Z","state":"measured"},{"denominator":93,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":93,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:15:42.147646Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T22:46:19.349816Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23329","snapshot_observed_at":"2026-08-07T15:15:42.147646Z","title":"Ir3d-bench: Evaluating vision-language model scene understanding as agentic inverse rendering","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-07T17:07:40.040298Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.147646Z"},"links":{"cited_paper":"/paper/2506.23329","citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:19cbd3e8487c37c3d55a39c9a759f58a7c805cd291be3584a43590b1640e945a","observation_id":"58f1947f-c76c-4444-8630-cb9fb76e6631","resolution":{"observed_at":"2026-08-07T15:15:42.147646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"cited_work":{"arxiv_id":"2506.23329","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23329","snapshot_observed_at":"2026-07-01T22:46:19.349816Z","title":"arXiv preprint arXiv:2506.23329 (2025)","venue":null,"work_id":"accd70ab-d175-47fa-8c5c-3d5215e1b543","year":2025},"citing_paper":{"arxiv_id":"2604.13035","last_updated":"2026-04-14T17:59:26Z","snapshot_observed_at":"2026-08-02T20:49:07.621096Z","submitted_at":"2026-04-14T17:59:26Z","title":"SceneCritic: A Symbolic Evaluator for 3D Indoor Scene Synthesis","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T15:36:33.149921Z"},"links":{"cited_paper":"/paper/2506.23329","citing_paper":"/paper/2604.13035"},"observation_digest":"sha256:9ef314936fd9c70ea70b775b40a9cbc9c293e18f69e34f7e794c02f86362cb0f","observation_id":"2a8e50f9-e90a-41bd-9177-58400071a09e","resolution":{"observed_at":"2026-05-11T10:11:03.448702Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"cited_work":{"arxiv_id":"2506.23329","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23329","snapshot_observed_at":"2026-07-01T22:46:19.349816Z","title":"arXiv preprint arXiv:2506.23329 (2025)","venue":null,"work_id":"accd70ab-d175-47fa-8c5c-3d5215e1b543","year":2025},"citing_paper":{"arxiv_id":"2606.02580","last_updated":"2026-06-01T17:59:53Z","snapshot_observed_at":"2026-08-07T05:56:16.163586Z","submitted_at":"2026-06-01T17:59:53Z","title":"Thinking in Blender: Staged Executable Inverse Graphics with Vision-Language Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-06-28T15:04:01.773923Z"},"links":{"cited_paper":"/paper/2506.23329","citing_paper":"/paper/2606.02580"},"observation_digest":"sha256:aecd2e3e7a12766a8d2f7e8753ff50f7573387088e2c3fd38ef7cf8a79ba4975","observation_id":"d5b28e77-12f4-45cc-8b14-f7dcdfcd832d","resolution":{"observed_at":"2026-07-01T22:46:19.352179Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23329","snapshot_observed_at":"2026-07-12T01:11:59.721089Z","title":"Ir3d-bench: Evaluating vision-language model scene understanding as agentic inverse rendering.arXiv preprint arXiv:2506.23329, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03614","last_updated":"2026-07-03T22:04:42Z","snapshot_observed_at":"2026-08-07T20:42:22.133522Z","submitted_at":"2026-07-03T22:04:42Z","title":"IDEAL-Bench: Indoor Dataset and Evaluation suite for Analyzing 3D Layout reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-12T01:11:59.721089Z"},"links":{"cited_paper":"/paper/2506.23329","citing_paper":"/paper/2607.03614"},"observation_digest":"sha256:c1bda079964cf9afc03d3bf49df23afebc50158c7162e6cdbf35b6b30db1d320","observation_id":"239479b0-2d39-4cf4-b714-2e34cd9b6a29","resolution":{"observed_at":"2026-07-12T01:11:59.721089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.23329/citation-record","integrity":"/paper/2506.23329/integrity","json":"/paper/2506.23329/citation-record.json","paper":"/paper/2506.23329"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-06T21:52:11.055004Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:11.055004Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:74961cd7022ec748ad5ebb5abecbf16c5c404571dce55ca886d009b4ac1feaa4","observation_id":"70399b4d-b6e2-4b73-94bf-bad20488e404","resolution":{"observed_at":"2026-08-06T21:52:11.055004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T21:52:11.097608Z","title":"GPT-4o System Card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:11.097608Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:e7561383c791c23d015064018337d3622738e3899a400da089a8c1899cd4be7a","observation_id":"e399d4ea-d573-4ec4-8742-5321185e750e","resolution":{"observed_at":"2026-08-06T21:52:11.097608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:11.169741Z","title":"The Claude 3 Model Family: Opus, Sonnet, Haiku","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:11.169741Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:7dfc25c6a1f168d67cdcde51b159e9b8878faa2b6c39a8c508a2e0f08498c63c","observation_id":"c1bf531f-f280-4fa3-83ef-1b4ba3d07b95","resolution":{"observed_at":"2026-08-06T21:52:11.169741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T21:52:11.224504Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:11.224504Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:9e994e650b22591a13e8f24d85c4c7e0d71357739988342e4fc310298208aebf","observation_id":"c5f399e7-11ab-498b-a352-6b5424b05bb8","resolution":{"observed_at":"2026-08-06T21:52:11.224504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T21:52:11.285409Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:11.285409Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:9adc03b9340cb56de683e8e6c12f4f31576bcb0afc593f60667c35ff634938d8","observation_id":"b4095e18-2038-4477-a16d-c90e47d0c61d","resolution":{"observed_at":"2026-08-06T21:52:11.285409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:11.354626Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:11.354626Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:c93b0b7be7c1a70fe05110d65e4155e6527885116776f6298bdc4beeb186a309","observation_id":"d393dec2-7886-404f-bd47-c76fdd7b1f14","resolution":{"observed_at":"2026-08-06T21:52:11.354626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:11.396632Z","title":"Perceptions as hypotheses","venue":null,"work_id":null,"year":1980},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:11.396632Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:8955c90d4c47210518fa47991f1817bc51cf7a8eb0907926432070ecb9188502","observation_id":"623e3470-0483-491f-8878-f676cb8fedf9","resolution":{"observed_at":"2026-08-06T21:52:11.396632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:11.441337Z","title":"Yuille and Daniel Kersten","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:11.441337Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:d8bced7ef0ad5f6f5bb6fd39d521230e97534053d91f0b4c6a205e2f95e24cb1","observation_id":"b67c78c0-8f4d-430b-9a8a-c6a05d6a7535","resolution":{"observed_at":"2026-08-06T21:52:11.441337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:11.504617Z","title":"Efficient and robust analysis-by-synthesis in vision: A computational framework, behavioral tests, and modeling neuronal representations","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:11.504617Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:d7e08dd362dc16aa1373e76d42c4b1e2f8131552ee1183a807bf3c39449c7a2e","observation_id":"4ba89f9d-b7fd-48cc-94e5-6035ea2f9f20","resolution":{"observed_at":"2026-08-06T21:52:11.504617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:11.569097Z","title":"Bever and David Poeppel","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:11.569097Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:eb3740a547f1bc5d3ae4526f7ec691e2010b5b46df4cb89dc281157e2ec28717","observation_id":"04895bc9-16e4-42ab-b6cb-fc311ebde2ea","resolution":{"observed_at":"2026-08-06T21:52:11.569097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:11.626028Z","title":"Toolformer: Language models can teach themselves to use tools","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:11.626028Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:84af416fc4e5740d8457a2dedce6b33ea6c066a951ae40ab1148b3569686a046","observation_id":"2bd2439d-548f-4935-b8eb-ebc1323b56a8","resolution":{"observed_at":"2026-08-06T21:52:11.626028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:11.687738Z","title":"Visual programming: Compositional visual reasoning without training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:11.687738Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:5779a57e44073ff91fc78809837dd426a7501acfd8bd01fb59524a000d353d89","observation_id":"41d94738-46fb-42ca-aa07-daad572b27a0","resolution":{"observed_at":"2026-08-06T21:52:11.687738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:11.750586Z","title":"Vipergpt: Visual inference via python execution for reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:11.750586Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:6f1677d73ba6c940a97bd329347e8f436ac8f460bedc68cf94ceac8ae36f5994","observation_id":"2371c8ed-4db0-4785-b740-808dc0eddae7","resolution":{"observed_at":"2026-08-06T21:52:11.750586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:27.420209Z","title":"Gorilla: Large language model connected with massive apis","venue":null,"work_id":"72c8b015-5e79-40f6-96bc-5fdb8c56a1a1","year":2024},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:11.803713Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:d5d533689b8c49d54466a0d8da8b1977fce34eb31f6de6fd090f5c24fb64232a","observation_id":"759e214b-494b-47d0-a7ff-29d41b221fb4","resolution":{"observed_at":"2026-08-06T21:52:27.564130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:27.182881Z","title":"Blender - a 3D modelling and rendering package, 2016","venue":null,"work_id":"686e4cda-e0f7-4c58-96e5-870b96d0bff6","year":2016},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:11.874949Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:401a0125c124c1bdc6d4b1dcc5c5be83fb31258e6b2940d1a2ebbeb32e282e2f","observation_id":"58910aac-d9e8-4948-9f22-a5cf9a3c51dd","resolution":{"observed_at":"2026-08-06T21:52:27.281964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:26.853620Z","title":"https://github.com/modelcontextprotocol, 2024","venue":null,"work_id":"8d50e13f-638a-4e6d-a70d-87540eb6e90c","year":2024},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:11.913246Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:7b9fd3456dd49741f8c349a7f199d4fa81f915bf5dd8e6ebedd07b92176359fa","observation_id":"4f94bb30-7534-47ce-b4a6-8f2c24fe64e2","resolution":{"observed_at":"2026-08-06T21:52:27.013539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:26.372305Z","title":"Blendermcp","venue":null,"work_id":"f0914145-7111-4d6c-8498-4c2c378417bd","year":2025},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:11.977613Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:f1672dc47a339aac21e05cb76b62719128f814a56ded89762f152180d0070251","observation_id":"ecc096df-bc12-4ee8-b717-625b2d4f4528","resolution":{"observed_at":"2026-08-06T21:52:26.613500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:26.010036Z","title":"Embodied question answering","venue":null,"work_id":"22b843b0-238e-46cc-b2f8-443e2c64825b","year":2018},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:12.022798Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:14d9c3035adf4b760f44948464199081fcef9ce5d3b1d07e808f2804df92a2e4","observation_id":"c343af7a-bbde-476a-9168-91e73e1b1192","resolution":{"observed_at":"2026-08-06T21:52:26.204239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:12.083938Z","title":"Multi-target embodied question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:12.083938Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:3576029d28361c85a96460a88a9361c703f7fd691274d55143da48a15293e9f9","observation_id":"24c50811-3954-4c4c-8c9a-3443545a9ca4","resolution":{"observed_at":"2026-08-06T21:52:12.083938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:25.706972Z","title":"3d concept learning and reasoning from multi-view images","venue":null,"work_id":"e6a36527-c4ca-47ca-bc31-61466f8f8175","year":2023},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:12.138262Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:672ddac04264a49a8fd74080b4b0603d2757e4ee43f74e07e33351c3f52fe591","observation_id":"5b4e46d7-ef6f-4292-8bc7-a0adc8407f6b","resolution":{"observed_at":"2026-08-06T21:52:25.777892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:25.622073Z","title":"One step at a time: Long-horizon vision-and-language navigation with milestones","venue":null,"work_id":"32b78266-ca15-4ac8-83d1-0971983841c7","year":2022},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:12.194541Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:65b23c6d058e3784f312081d7df82a3ce9d20b353b5d7de3ee34682aa1d26064","observation_id":"9a512965-3142-40a5-a3af-38bb88cef8f6","resolution":{"observed_at":"2026-08-06T21:52:25.671215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.04927","last_updated":"2021-11-04T17:12:42Z","snapshot_observed_at":"2026-07-06T11:37:18.911471Z","submitted_at":"2021-08-10T21:24:05Z","title":"Embodied BERT: A Transformer Model for Embodied, Language-guided Visual Task Completion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.04927","snapshot_observed_at":"2026-08-06T21:52:12.241831Z","title":"Embodied bert: A transformer model for embodied, language-guided visual task completion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:12.241831Z"},"links":{"cited_paper":"/paper/2108.04927","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:195fb176e97a0d9ff1cf4190d3637673529ed4b22df32fc54b9513f1868e5eeb","observation_id":"c6d80a6f-3acd-410b-b3bb-eb48b0cd720d","resolution":{"observed_at":"2026-08-06T21:52:12.241831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:12.279337Z","title":"Clevr: A diagnostic dataset for compositional language and elementary visual reasoning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:12.279337Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:6bd3d0a898153c904be840290317c52d3b412f015f0ad3c7846397d3db073614","observation_id":"de9ccc8a-466a-4a37-afa9-fe5ffb61f905","resolution":{"observed_at":"2026-08-06T21:52:12.279337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:25.484473Z","title":"Barrow and Jay M","venue":null,"work_id":"738f2696-44d3-4756-a043-f3653054321f","year":1978},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:12.293443Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:996f14e0256981c249cf0730b0652a40afe21151d8beffd16bf8676ad884650e","observation_id":"e9a6c378-4606-4592-94b9-abeafdd0c1ae","resolution":{"observed_at":"2026-08-06T21:52:25.549695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:25.339018Z","title":"Soft rasterizer: A differentiable renderer for image-based 3d reasoning","venue":null,"work_id":"73f5865d-798d-4dbd-ade8-e26dbed1ca49","year":2019},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:12.327295Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:da056b4257e49f83d640ab2306213569ba9dd52bf5efcef886b48b1583298083","observation_id":"05dad22f-a4c9-4d5e-b07d-273a93a6fc3a","resolution":{"observed_at":"2026-08-06T21:52:25.418707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:25.233410Z","title":"Carr, Jonathan Ragan-Kelley, and Frédo Durand","venue":null,"work_id":"a845f524-4277-43cc-be49-2596ccafac43","year":2020},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:12.364961Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:f7543484af00e34fba3ec23494678279b7c4980a5e0cbd884e460db8deb290ff","observation_id":"47e3950a-d8e2-4c22-ac40-8243dea9bbdb","resolution":{"observed_at":"2026-08-06T21:52:25.281806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:25.093920Z","title":"Differentiable vector graphics rasterization for editing and learning","venue":null,"work_id":"27334175-9e1e-4acb-bb41-316825db71ff","year":2020},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:12.397916Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:dc5ae78f3447996ca9b5a9028aa9c735f4f8b74742b403df10a2267d298c924b","observation_id":"03cb4dd2-5833-44e6-a443-1ded4a1cbcc2","resolution":{"observed_at":"2026-08-06T21:52:25.156345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:24.982728Z","title":"Nerf: Representing scenes as neural radiance fields for view synthesis","venue":null,"work_id":"c1b14839-1cc0-41e9-9267-b8b694877c06","year":2020},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:12.474675Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:576508f6a78ff8ac1124061cd5c1b464aaa4d80778aa7cfb0d36922517dae225","observation_id":"fdf89410-523c-4f03-82e4-6e26fc4b84b2","resolution":{"observed_at":"2026-08-06T21:52:25.044121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:24.885014Z","title":"Unisurf: Unifying neural implicit surfaces and radiance fields for multi-view reconstruction","venue":null,"work_id":"b5a70296-2e66-4a69-9c10-fbfbed8e67ad","year":2021},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:12.567066Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:ed79b484f47379caa8aa42508445fe6c22ce8184593112e3d58a5f98bac2e8e0","observation_id":"185ef9c7-49ac-46b2-984d-870a0eff56e2","resolution":{"observed_at":"2026-08-06T21:52:24.925554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:24.771146Z","title":"V olume rendering of neural implicit surfaces","venue":null,"work_id":"85c21ca8-cfa8-4da8-888f-301980e217f2","year":2021},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:12.634446Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:668c5188dbe90cf9a9a2791cba9fb31f49caae53e2434fe7dd883103cefce088","observation_id":"170cb4bb-be8d-4702-b529-96c80dc09769","resolution":{"observed_at":"2026-08-06T21:52:24.826114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:24.646119Z","title":"Synsin: End-to-end view synthesis from a single image","venue":null,"work_id":"6f4b3654-551c-4557-b1f2-0eeaf10e876e","year":2020},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:12.704011Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:f074c7cf19b75516dff2c73a1f6ee828d2494a43e1615ef48caa7ad5b45873e6","observation_id":"fe13a610-3f42-47f0-be62-c42423e06960","resolution":{"observed_at":"2026-08-06T21:52:24.683222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:24.520823Z","title":"3d gaussian splatting for real-time radiance field rendering","venue":null,"work_id":"56efc215-e5c8-42f4-8d05-ba26caf4a88d","year":2023},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:12.762820Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:bc0990c1cf2ab7c51d7d63cfab2f0319ccbd94abd805b80a75a942aea074507b","observation_id":"a40ed8df-92b3-4d8e-9c4f-eb74c9b4898b","resolution":{"observed_at":"2026-08-06T21:52:24.597407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:24.394771Z","title":"Path-space differentiable rendering","venue":null,"work_id":"ded80b08-d35a-4900-ac8f-c1638bbb0260","year":2020},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:12.822049Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:8d8064a778459de5100b4200d46236752b931bf6c62f1bf04204abe501815014","observation_id":"120bdca9-0787-411c-af13-41bf6860ac8f","resolution":{"observed_at":"2026-08-06T21:52:24.443779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:24.230418Z","title":"Inst3d-lmm: Instance-aware 3d scene understanding with multi-modal instruction tuning, 2025","venue":null,"work_id":"204cc84f-381e-4fa9-93ef-e62db91e85b0","year":2025},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:12.878226Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:b090286da5e96f290eef244b15bebc6d6c6e56e2137187849dcd5a8eaada4c49","observation_id":"4a82b5d2-f0fa-4dcd-90ad-0e7dafa35cb0","resolution":{"observed_at":"2026-08-06T21:52:24.322002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18125","last_updated":"2025-04-27T06:50:23Z","snapshot_observed_at":"2026-08-07T23:35:09.059226Z","submitted_at":"2024-09-26T17:59:11Z","title":"LLaVA-3D: A Simple yet Effective Pathway to Empowering LMMs with 3D-awareness","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18125","snapshot_observed_at":"2026-08-06T21:52:12.924934Z","title":"Llava-3d: A simple yet effective pathway to empowering lmms with 3d-awareness.arXiv preprint arXiv:2409.18125, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:12.924934Z"},"links":{"cited_paper":"/paper/2409.18125","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:fd23226bc5e944e43fbb23eb491d7aff54f7b598feccbab11af820720a3593ca","observation_id":"baa76daf-d0cc-4046-867a-c8c4e18cb39f","resolution":{"observed_at":"2026-08-06T21:52:12.924934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:24.011771Z","title":"Scanqa: 3d question answering for spatial scene understanding","venue":null,"work_id":"1d15c356-4738-42d9-972f-ca427d9efd9b","year":2022},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:12.978758Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:4b304cdd202f0e545f14dc206d48436600b417c9e0c4c63426ade306d913d043","observation_id":"af2108fa-3480-4223-889d-1ddbf54662d7","resolution":{"observed_at":"2026-08-06T21:52:24.123602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:23.792761Z","title":"3d-vista: Pre- trained transformer for 3d vision and text alignment","venue":null,"work_id":"796b2e2c-aa01-427c-bcd3-e8ca88fa25a7","year":2023},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:13.066768Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:95209499d0e94aa878d97b849199e15df0ec0e33de7b62d0b781f961b55cf6a7","observation_id":"0fdde439-780f-4367-abce-abcb0b2ba4ac","resolution":{"observed_at":"2026-08-06T21:52:23.895150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.08830","last_updated":"2020-11-11T09:33:31Z","snapshot_observed_at":"2026-07-06T08:45:31.167221Z","submitted_at":"2019-12-18T19:00:49Z","title":"ScanRefer: 3D Object Localization in RGB-D Scans using Natural Language","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.08830","snapshot_observed_at":"2026-08-06T21:52:13.125119Z","title":"Chang, and Matthias Nießner","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:13.125119Z"},"links":{"cited_paper":"/paper/1912.08830","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:6402ac996438b6df7423e5e8d885c04051bb5afe0421bfc03739797ea820e2b5","observation_id":"804d0774-75fd-4430-b308-0a344c7c0b98","resolution":{"observed_at":"2026-08-06T21:52:13.125119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:23.626604Z","title":null,"venue":null,"work_id":"d2289d5b-7a20-429f-ab6e-0a2838a15047","year":2020},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:13.176031Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:6cdfb1b50c6127c3240445285e568d1b683469e53e2779a821260426e7c3ae51","observation_id":"069e343b-baa2-47c1-ab21-fa116d0be223","resolution":{"observed_at":"2026-08-06T21:52:23.716990Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:23.413530Z","title":null,"venue":null,"work_id":"5302140d-9032-4ea1-82c4-32371713977b","year":2021},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:13.257778Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:a9e591112136ef9518365c7fd6dfeb18fe43fab49cfdfcf12e76f3d3f3a8cc26","observation_id":"8a82e53a-4cde-4c52-8b39-2781b3ce7187","resolution":{"observed_at":"2026-08-06T21:52:23.514382Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:13.307929Z","title":"Scalable 3d captioning with pretrained models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:13.307929Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:7326ffbcb0d3e2f85b043d06d760f3454a994c43693513b10fbc657f1f84e87d","observation_id":"91a71c99-fc19-4bfb-9743-85f859313aca","resolution":{"observed_at":"2026-08-06T21:52:13.307929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:23.244847Z","title":"Openeqa: Embodied question answering in the era of foundation models","venue":null,"work_id":"e6179801-fde1-4c8f-a53f-ade6e40526d5","year":2024},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:13.367178Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:49df0cc24a5e70361c863a6b5fbb4a14c0b5b68548c3e453671324390a473a44","observation_id":"f8e232af-a3db-4d52-a83a-5d822a3dd8a3","resolution":{"observed_at":"2026-08-06T21:52:23.340070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:23.088257Z","title":"Alfred: A benchmark for interpreting grounded instructions for everyday tasks","venue":null,"work_id":"bf099bb6-16a6-4f20-9fc0-048a437a058f","year":2020},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:13.427092Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:04692d16a5e2d42fbd3b31634f64feb5d74fc9599bb6279a0dbc2943aceb1981","observation_id":"5364b1bc-adb6-4a12-a480-5b8ade7cb1cb","resolution":{"observed_at":"2026-08-06T21:52:23.158643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:22.860797Z","title":"Sceneverse: Scaling 3d vision-language learning for grounded scene understanding","venue":null,"work_id":"27d0ed9e-05c7-44d9-a517-fd8fad7b7cb6","year":null},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:13.473093Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:4ca739894fae07acef929ded7dab01fc7ff4551f3164aaa3ee49aed5d1a2e461","observation_id":"79c150fb-dcb2-4dda-9b34-946805354b5f","resolution":{"observed_at":"2026-08-06T21:52:22.964985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:22.661163Z","title":"Spatialrgpt: Grounded spatial reasoning in vision-language models","venue":null,"work_id":"3a02da94-8d7d-43ff-8306-125f43f4ed62","year":2025},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:13.520082Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:0930ad15d50ebb10d7ec459d5483f40a8abd2a8e01e813ded10df8fa16a48a5a","observation_id":"2243b079-f024-4250-87c2-d590e88832e9","resolution":{"observed_at":"2026-08-06T21:52:22.738013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07241","last_updated":"2023-10-23T14:56:15Z","snapshot_observed_at":"2026-07-06T14:51:48.920020Z","submitted_at":"2023-02-14T18:40:26Z","title":"ConceptFusion: Open-set Multimodal 3D Mapping","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.07241","snapshot_observed_at":"2026-08-06T21:52:13.629446Z","title":"Conceptfusion: Open-set multimodal 3d mapping","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:13.629446Z"},"links":{"cited_paper":"/paper/2302.07241","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:dfa12640f5e7a70ad980c7c6f6f998291044d606b8e8067e3092549d855d5bdf","observation_id":"13c423ae-e694-4b4d-9483-84ce12cea5bc","resolution":{"observed_at":"2026-08-06T21:52:13.629446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:22.436962Z","title":"Context-aware entity grounding with open-vocabulary 3d scene graphs","venue":null,"work_id":"b99c67e1-138e-4122-96fc-6fc71c30c53a","year":2023},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:13.689722Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:9738080a04c0e44f48d7e7fb008211dbdd074da4bf45539aa9b4ec36fc8ff4cf","observation_id":"0854f686-091f-4bf1-9322-c38faaea3951","resolution":{"observed_at":"2026-08-06T21:52:22.553902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:22.189394Z","title":"Tenenbaum, Antonio Torralba, Florian Shkurti, and Liam Paull","venue":null,"work_id":"85542c58-6747-4504-a16b-94318d2bea6f","year":2024},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:13.772311Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:ef1b43e26da470ae60c4ffc64e87f34ba8087e9b48a2984e4f3200a9a1be520e","observation_id":"09505462-0c34-481b-9759-994420a4609d","resolution":{"observed_at":"2026-08-06T21:52:22.310278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.12981","last_updated":"2023-07-24T17:59:02Z","snapshot_observed_at":"2026-08-03T03:13:48.042761Z","submitted_at":"2023-07-24T17:59:02Z","title":"3D-LLM: Injecting the 3D World into Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.12981","snapshot_observed_at":"2026-08-06T21:52:13.851642Z","title":"3d-llm: Injecting the 3d world into large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:13.851642Z"},"links":{"cited_paper":"/paper/2307.12981","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:fe0f02cc42b1ea3bd6634da187506a8143f7d0c0b517c9167b681b96681a167b","observation_id":"5d0d8d06-ed63-48ce-ab2b-6ad2bebe8242","resolution":{"observed_at":"2026-08-06T21:52:13.851642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11835","last_updated":"2024-03-18T14:47:03Z","snapshot_observed_at":"2026-07-06T17:46:20.935124Z","submitted_at":"2024-03-18T14:47:03Z","title":"Agent3D-Zero: An Agent for Zero-shot 3D Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11835","snapshot_observed_at":"2026-08-06T21:52:13.961478Z","title":"Agent3d-zero: An agent for zero-shot 3d understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:13.961478Z"},"links":{"cited_paper":"/paper/2403.11835","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:c73d37f03c778b8a2d15b154932db8f24bf78bbf713d86d1dd8e8cc0d5c0858b","observation_id":"af0980fc-8aae-4b20-8ca6-af1ebf75083a","resolution":{"observed_at":"2026-08-06T21:52:13.961478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03201","last_updated":"2024-01-16T16:39:57Z","snapshot_observed_at":"2026-08-06T01:10:16.745527Z","submitted_at":"2024-01-06T12:20:18Z","title":"3DMIT: 3D Multi-modal Instruction Tuning for Scene Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03201","snapshot_observed_at":"2026-08-06T21:52:14.100701Z","title":"3dmit: 3d multi-modal instruction tuning for scene understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:14.100701Z"},"links":{"cited_paper":"/paper/2401.03201","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:57c55d89e82b581ecd2250c619faad7b5de3bd6db6d97c8da01dc081d0b731cf","observation_id":"477b6121-dda0-4230-a3af-7ebb78398485","resolution":{"observed_at":"2026-08-06T21:52:14.100701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:14.285145Z","title":"Openeqa: Embodied question answering in the era of foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:14.285145Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:9f25bba0d7546b0f2493025ab17e27638ef3f00903c671c97645cb511d2752cf","observation_id":"aa631a06-2c28-496b-934d-0e48b671585c","resolution":{"observed_at":"2026-08-06T21:52:14.285145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:21.983644Z","title":"Kulkarni, Pushmeet Kohli, Joshua B","venue":null,"work_id":"e856a8bd-323c-44f7-a44d-59659df344a2","year":2015},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:15.001949Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:3aa68687092ff10d2c51931b0ca5cbc58170d70ef34a85c7c18b762c6a245037","observation_id":"bf2e2b69-3430-422d-9178-84203d7d112f","resolution":{"observed_at":"2026-08-06T21:52:22.056195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:21.803466Z","title":"Learning to infer graphics programs from hand-drawn images","venue":null,"work_id":"6d51cd08-8340-4336-96e6-39b82e1c5ea7","year":2018},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:15.895509Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:e0836cc17cf735ac041af211ca59b1c9ef21a8dcb45efb23b45da87049cb4c9d","observation_id":"92033c46-13f7-4403-9222-3acc43d758a9","resolution":{"observed_at":"2026-08-06T21:52:21.901078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:21.603685Z","title":"Learning to infer and execute 3d shape programs","venue":null,"work_id":"9cd50a35-cc67-41cf-86d2-64737924ae46","year":2019},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:16.005434Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:7160d52d08512a5d29dfcd2ef4f057e853820d6bbcadb79e6132e8508f960a92","observation_id":"ab25332c-a816-4f5b-8b68-f98bd8ce40d5","resolution":{"observed_at":"2026-08-06T21:52:21.706626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:21.442420Z","title":"Shapeassembly: Learning to generate programs for 3d shape structure synthesis","venue":null,"work_id":"ddb42099-874e-4565-b26e-c3d977b48c99","year":2020},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:16.170005Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:574bf2e5dc0f3dc9d4b554feaadf425c74a6fc0a8a905a261eae7139e0d0aa3e","observation_id":"370dc2bc-3632-4845-839c-20e7bf03bfeb","resolution":{"observed_at":"2026-08-06T21:52:21.534646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:21.268243Z","title":"Scenecraft: An llm agent for synthesizing 3d scenes as blender code","venue":null,"work_id":"5c11e347-e5b5-45c0-9c64-6204576934c4","year":2024},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:16.338669Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:f6a0d46afaca659cdf9cfdbd77cf6e96a82e145aa861eaaea12dac26d500dcc3","observation_id":"616311f7-9e01-49cd-bbf1-2bee4be39133","resolution":{"observed_at":"2026-08-06T21:52:21.372486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16770","last_updated":"2025-03-29T19:17:13Z","snapshot_observed_at":"2026-08-03T22:32:47.592540Z","submitted_at":"2024-10-22T07:40:20Z","title":"The Scene Language: Representing Scenes with Programs, Words, and Embeddings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16770","snapshot_observed_at":"2026-08-06T21:52:16.453656Z","title":"The scene language: Representing scenes with programs, words, and embeddings","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:16.453656Z"},"links":{"cited_paper":"/paper/2410.16770","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:93b26de386d611babf0847663cc3f83a6db43027d6ffbc4dc1b81eab88fb79f3","observation_id":"a1d01f54-7b0d-4d4d-ac16-f51c5f1babf8","resolution":{"observed_at":"2026-08-06T21:52:16.453656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12945","last_updated":"2024-05-29T01:35:15Z","snapshot_observed_at":"2026-07-06T16:35:48.413898Z","submitted_at":"2023-10-19T17:41:48Z","title":"3D-GPT: Procedural 3D Modeling with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12945","snapshot_observed_at":"2026-08-06T21:52:16.602426Z","title":"3d-gpt: Procedural 3d modeling with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:16.602426Z"},"links":{"cited_paper":"/paper/2310.12945","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:98d1c05f827e4734287a3b76068feb8e83b5aa471af53ead9eec1fa0d44b7da1","observation_id":"a6f75e8e-096c-4c4f-82dd-00bfbd5e88a2","resolution":{"observed_at":"2026-08-06T21:52:16.602426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02211","last_updated":"2025-06-03T10:28:20Z","snapshot_observed_at":"2026-07-06T18:56:45.173494Z","submitted_at":"2024-08-05T03:24:45Z","title":"SceneMotifCoder: Example-driven Visual Program Learning for Generating 3D Object Arrangements","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02211","snapshot_observed_at":"2026-08-06T21:52:16.700146Z","title":"Scenemotifcoder: Example-driven visual program learning for generating 3d object arrange- ments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:16.700146Z"},"links":{"cited_paper":"/paper/2408.02211","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:b6f7a86e1e59d17c19079e2a837fd89eac1bb7223a2b40d11b6f52c2b74e0b2f","observation_id":"c0e1084c-6cc2-4184-af33-3f98af61bc67","resolution":{"observed_at":"2026-08-06T21:52:16.700146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09052","last_updated":"2024-02-14T09:51:05Z","snapshot_observed_at":"2026-08-04T04:05:17.132241Z","submitted_at":"2024-02-14T09:51:05Z","title":"L3GO: Language Agents with Chain-of-3D-Thoughts for Generating Unconventional Objects","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09052","snapshot_observed_at":"2026-08-06T21:52:16.816617Z","title":"L3go: Language agents with chain-of-3d-thoughts for generating unconventional objects","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:16.816617Z"},"links":{"cited_paper":"/paper/2402.09052","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:c0b78d12d54181b4ec8e3674ed2112b567f311d960131bb82d4c5707ab590d96","observation_id":"2abac4fd-99b5-4555-9d70-d6c9bc572221","resolution":{"observed_at":"2026-08-06T21:52:16.816617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:16.883085Z","title":"Creative agents: Empowering agents with imagination for creative tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:16.883085Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:57cd081364dabc5e2184acd851cc3a2798421dc927b06b6de7a23d1748fc79fc","observation_id":"d6757f77-95e2-4fef-8b62-63e1a9ee112f","resolution":{"observed_at":"2026-08-06T21:52:16.883085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:21.096105Z","title":"Scenex: Procedural controllable large-scale scene generation via large-language models","venue":null,"work_id":"b656cd8e-1d79-4f62-bd86-125a24cb77e6","year":2024},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:16.958079Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:ecd59fb4c7a4ccfe456d56dd41bbaeb9f557f4848cda34ad230d2efcdb7a5e0d","observation_id":"79bd3400-c7c6-46cb-b80a-a8beebee358c","resolution":{"observed_at":"2026-08-06T21:52:21.193430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:20.923128Z","title":"Program-guided image manipulators","venue":null,"work_id":"6ec9d768-5bfe-4a34-9daf-a60b866fad3c","year":2019},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:17.034681Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:05095f170ec399ba28e4a518455e95aa21881f7f0a487fe327f87c81569dfbd8","observation_id":"c70a0e45-e2d4-4063-9d60-a6cd36e02871","resolution":{"observed_at":"2026-08-06T21:52:20.997606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-08-10T01:07:11.269697Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02193","snapshot_observed_at":"2026-08-06T21:52:17.103306Z","title":"Layoutvlm: Differentiable optimization of 3d layout via vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:17.103306Z"},"links":{"cited_paper":"/paper/2412.02193","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:9b250f95a8c61b914ba71eb727c6db8cee7d7da08c20f27f3c59fd3f42e3be9d","observation_id":"56d960d6-db08-4b58-8524-19e5526477d4","resolution":{"observed_at":"2026-08-06T21:52:17.103306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:20.730146Z","title":"Virtualhome: Simulating household activities via programs","venue":null,"work_id":"d774378a-d6d5-42c0-bf3a-aafe11edbdb8","year":2018},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:17.197318Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:c102b61b3675dae6bc0e6705cef2458dac4e98def3a5cea11abc5f8e378246c3","observation_id":"ef41b7f0-8b70-486f-bd19-089ce59ad090","resolution":{"observed_at":"2026-08-06T21:52:20.787871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:20.517042Z","title":"Xia, Peng Xu, Karol Hausman, Brian Ichter, Peter R","venue":null,"work_id":"accc538f-cdac-4c50-82fd-aab9bb46ccda","year":2023},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:17.287964Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:4244766961d0b794045f1970147754cbc6d48adfde2b1375209d137d3eef3983","observation_id":"bfd141a2-30a4-4447-96ec-8d97ac1962a1","resolution":{"observed_at":"2026-08-06T21:52:20.637410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.11390","last_updated":"2019-01-22T18:55:34Z","snapshot_observed_at":"2026-07-06T07:30:18.170401Z","submitted_at":"2019-01-22T18:55:34Z","title":"MONet: Unsupervised Scene Decomposition and Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.11390","snapshot_observed_at":"2026-08-06T21:52:17.363407Z","title":"Monet: Unsupervised scene decomposition and representa- tion","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:17.363407Z"},"links":{"cited_paper":"/paper/1901.11390","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:7d2ad96a904eb261c90ea3a2ab01ad7fb50532cae877b9c5642a6942e2cf261c","observation_id":"a65d344b-a34a-4ad8-8d9e-6228213936f2","resolution":{"observed_at":"2026-08-06T21:52:17.363407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.13052","last_updated":"2020-11-23T10:31:22Z","snapshot_observed_at":"2026-08-08T07:06:12.589881Z","submitted_at":"2019-07-30T16:22:39Z","title":"GENESIS: Generative Scene Inference and Sampling with Object-Centric Latent Representations","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.13052","snapshot_observed_at":"2026-08-06T21:52:17.455262Z","title":"Genesis: Generative scene inference and sampling with object-centric latent representations","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:17.455262Z"},"links":{"cited_paper":"/paper/1907.13052","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:b7d0b12a97a0e0c16608eb772b31753171a9a20bf04c90fbc6eb849175c6e296","observation_id":"6d8a2049-58fe-4748-bb8a-c73c40b2b546","resolution":{"observed_at":"2026-08-06T21:52:17.455262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:20.337366Z","title":"Giraffe: Representing scenes as compositional genera- tive neural feature fields","venue":null,"work_id":"bdc68b20-3791-4d45-a645-c13f067f0fd8","year":2021},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:17.543148Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:f7edc60eba8e698f6418fc5cbacf66c789a39a7ab354b100574c5b1fdb7586bc","observation_id":"a4f98124-b414-415b-a5d4-c4825010d2c2","resolution":{"observed_at":"2026-08-06T21:52:20.430818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:20.146681Z","title":"A simple neural network module for relational reasoning","venue":null,"work_id":"4d8bdfc5-e5ca-4641-ab12-f49346310ad6","year":2017},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:17.637002Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:3ab19aa350d6795fae27362d091485a0699f88e10566059265614e246d1843cd","observation_id":"e66a6f52-80df-424c-844f-adb73f893c23","resolution":{"observed_at":"2026-08-06T21:52:20.210637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.03067","last_updated":"2018-04-24T10:25:07Z","snapshot_observed_at":"2026-07-06T06:27:14.996782Z","submitted_at":"2018-03-08T12:37:14Z","title":"Compositional Attention Networks for Machine Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.03067","snapshot_observed_at":"2026-08-06T21:52:17.725712Z","title":"Compositional attention networks for machine reasoning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:17.725712Z"},"links":{"cited_paper":"/paper/1803.03067","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:86305d190038bc86d6b3f8c71829b1967535755b18ff0058b0d834bd706bf0e2","observation_id":"0c3d53fe-8b34-406e-a0f3-bcdcb4df24c8","resolution":{"observed_at":"2026-08-06T21:52:17.725712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:17.799376Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:17.799376Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:275c388e042407844698327c9f70839194edaa5398fb67307d8e13d29bf2ce54","observation_id":"b22eba6e-6dc0-4ade-97a4-8535b2058c59","resolution":{"observed_at":"2026-08-06T21:52:17.799376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:17.870461Z","title":"Segment anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:17.870461Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:5f6b03e027074617d66b00b7b9f1e9547e30ab6e40ce28bec929ce6c333fa15d","observation_id":"e8e258f8-9e15-4947-b421-1b5902e24e86","resolution":{"observed_at":"2026-08-06T21:52:17.870461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T21:52:17.945267Z","title":"GPT-4 Technical Report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:17.945267Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:a0cb023d3b748db37dc3aebae3fa9034d89ed8ba1e8173b8aca62d0140d8da83","observation_id":"3eda3f9c-55df-4792-a0c4-65ce2a8f4966","resolution":{"observed_at":"2026-08-06T21:52:17.945267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:19.878846Z","title":"The Gemini 2 Model Family: Google Deepmind","venue":null,"work_id":"9fe10a14-926f-44a4-ba47-9860117b95dd","year":null},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:18.015298Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:91edbbfc6fe215830735e05147fd62768bc8f12b745dc7e2c7d8c23a0f112363","observation_id":"0d9e3326-48fc-4d65-ad73-61666236654d","resolution":{"observed_at":"2026-08-06T21:52:19.994411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:19.677871Z","title":"The Grok Model Family: xAI","venue":null,"work_id":"95696eb8-d620-4e94-b96a-e2779810ac15","year":null},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:18.083136Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:541d66b97f9aa15a8aee50f323c0734e2fb129a327bf9e42ac5fd96ee0f723f9","observation_id":"3c804746-c846-4535-9ac2-932819b67dd7","resolution":{"observed_at":"2026-08-06T21:52:19.789753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-06T21:52:18.167303Z","title":"Deepseek-vl2: Mixture-of-experts vision- language models for advanced multimodal understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:18.167303Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:d5b2ff622dbe13d3281e266047b47448f978e9abece8874eaea35f59fd774650","observation_id":"fd58f6e1-3696-4dba-9f93-904ae09d03a6","resolution":{"observed_at":"2026-08-06T21:52:18.167303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:19.576548Z","title":"Llava-next: A strong zero-shot video understanding model, 2024","venue":null,"work_id":"7d0b5cdf-91de-4c62-a52f-691eec90ad16","year":2024},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:18.247348Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:868cbb247b643b7933c01f275986eb5f3ef46e164d9a3b44fa991c8a10c35c25","observation_id":"70584297-2efd-4ea7-a61b-8ecc834cb15a","resolution":{"observed_at":"2026-08-06T21:52:19.606170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T21:52:18.335284Z","title":"The Llama 3 Herd of Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:18.335284Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:147c345b495cc6e8a9ef0506aed9bb0231327be69b4f39bff6215e1a279f9ada","observation_id":"4ba9f124-075a-4a11-962e-08cfa35bf935","resolution":{"observed_at":"2026-08-06T21:52:18.335284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13611","last_updated":"2024-10-17T14:46:34Z","snapshot_observed_at":"2026-08-10T04:18:11.259102Z","submitted_at":"2024-10-17T14:46:34Z","title":"H2OVL-Mississippi Vision Language Models Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13611","snapshot_observed_at":"2026-08-06T21:52:18.427568Z","title":"Galib, Shanshan Wang, Guanshuo Xu, Pascal Pfeiffer, Ryan Chesler, Mark Landry, and SriSatish Ambati","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:18.427568Z"},"links":{"cited_paper":"/paper/2410.13611","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:f2300d49bcbb6dd7213b10d81091ecd4d8b84d91e88b3df4ffb309d94e1c4afe","observation_id":"ddad7a53-b8f2-4202-8256-79c24da2b0b9","resolution":{"observed_at":"2026-08-06T21:52:18.427568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-08-09T11:59:10.408717Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-08-06T21:52:18.492837Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:18.492837Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:4edcaf4ea36d57e4f03c9ca86df734d576ff3aee90f9c69301c2c94fa9770eb3","observation_id":"33af74a0-f683-449d-ad39-85af9eb13b2c","resolution":{"observed_at":"2026-08-06T21:52:18.492837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07073","last_updated":"2024-10-10T17:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-09T17:16:22Z","title":"Pixtral 12B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07073","snapshot_observed_at":"2026-08-06T21:52:18.563315Z","title":"Pixtral 12B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:18.563315Z"},"links":{"cited_paper":"/paper/2410.07073","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:362eee8f2fb4a3b604399d89ee79202efcadf227a7e29885dd574f2866f7d09b","observation_id":"f76e75a6-afe5-4cc8-b853-38164d5b91a9","resolution":{"observed_at":"2026-08-06T21:52:18.563315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-06T21:52:18.651138Z","title":"Aria: An open multimodal native mixture-of-experts model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:18.651138Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:cca305a22575c12cb4c33652397c5333d7f989c2730c2512749540431eaba5cb","observation_id":"84e3669f-09fa-4e89-bf38-aecdd5b59f7a","resolution":{"observed_at":"2026-08-06T21:52:18.651138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.16527","last_updated":"2023-08-21T09:35:52Z","snapshot_observed_at":"2026-07-06T15:48:01.777256Z","submitted_at":"2023-06-21T14:01:01Z","title":"OBELICS: An Open Web-Scale Filtered Dataset of Interleaved Image-Text Documents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.16527","snapshot_observed_at":"2026-08-06T21:52:18.730268Z","title":"Rush, Douwe Kiela, Matthieu Cord, and Victor Sanh","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:18.730268Z"},"links":{"cited_paper":"/paper/2306.16527","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:b2cb47dc4df405b75d64db80fa5eb945e019ee44b7699c6c87f020ceaef609e8","observation_id":"66574c34-677a-4271-8694-6f96025fe335","resolution":{"observed_at":"2026-08-06T21:52:18.730268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-06T21:52:18.821199Z","title":"Expanding performance boundaries of open- source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:18.821199Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:4f00341559a6ea90f1bc24ff0878a2c931957c1f29b83d7ff9ff1285ec47cc57","observation_id":"b05f4901-3c8d-45b0-beb2-d76b513b1823","resolution":{"observed_at":"2026-08-06T21:52:18.821199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T07:07:56.707005Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-06T21:52:18.924233Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:18.924233Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:c469b53414da61c437d536fc557c6e3df637dbf15e46c0a8ded39885dd93ceeb","observation_id":"862d55c2-a190-4aa5-983e-591ccce7ca14","resolution":{"observed_at":"2026-08-06T21:52:18.924233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T21:52:18.990164Z","title":"Qwen2.5 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:18.990164Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:fad2256e8e9f584c731111a873683df7b02526bc9408290a7f78db4e4c25874d","observation_id":"b1dbb342-9b92-4151-94cc-b8c1d253e240","resolution":{"observed_at":"2026-08-06T21:52:18.990164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-06T21:52:19.061479Z","title":"‘json","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:19.061479Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:a172d9d58c2be15d2bd4ed61b0087cf5167185a9dea64fd255d7b0e15bc99013","observation_id":"bbb341f6-1094-4204-bbad-c1ad333a3a6b","resolution":{"observed_at":"2026-08-06T21:52:19.061479Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering"},"reference_resolution":{"displayed":89,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":48,"verified_exact":0,"verified_fuzzy":40},"total_outbound_references":89},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 89 of 89 outbound references and 4 inbound Pith citation observations for arXiv:2506.23329."}