{"as_of":"2026-08-09T20:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:54b21e905f2d16c845b952f1684f3f5584017ac1dfbc5dc767361fe15d666bd1","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T23:29:02.328455Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T14:28:20.930744Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.15418","snapshot_observed_at":"2026-08-03T14:28:20.930744Z","title":"2607.15418 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29058","last_updated":"2026-07-31T06:25:41Z","snapshot_observed_at":"2026-08-06T12:22:05.211974Z","submitted_at":"2026-07-31T06:25:41Z","title":"Evidence-Grounded Constraint Checking in Construction Documents","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-03T14:28:20.930744Z"},"links":{"cited_paper":"/paper/2607.15418","citing_paper":"/paper/2607.29058"},"observation_digest":"sha256:1275464ed03cafcfad3e4f899257b1859cea92abd7e47bb6741ffc70cac3815e","observation_id":"3ef6c10b-1baa-424e-825a-831dbc143560","resolution":{"observed_at":"2026-08-03T14:28:20.930744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.15418/citation-record","integrity":"/paper/2607.15418/integrity","json":"/paper/2607.15418/citation-record.json","paper":"/paper/2607.15418"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:28:55.541852Z","title":"Vqa-med: Overview of the medical visual question answering task at imageclef 2019.CLEF (working notes), 2(6):1–11, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T23:28:55.541852Z"},"links":{"citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:4bae21ebdd26325b12ce64db05b83f3dc4073a75648ec85c9255304b45c9611a","observation_id":"76b7eee8-e047-4e70-b446-990f9ee50122","resolution":{"observed_at":"2026-08-01T23:28:55.541852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-01T23:28:55.639864Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T23:28:55.639864Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:70b0821b2efb972a24a726f2d4551b0946ede509d3257f6c2b3cebcb298fa7e7","observation_id":"20382dab-aa51-499d-9783-e570ebdb1495","resolution":{"observed_at":"2026-08-01T23:28:55.639864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:28:59.622925Z","title":"OCR, Knowledge, Reasoning (Vi- sual, Alignment)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T23:28:59.622925Z"},"links":{"citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:ceb9ba2e097d761118400fae1d9b8faaa1d537123f7cadc14c92a356ab5df1a5","observation_id":"66eafda0-53fa-4f20-ba74-c92f267e8f35","resolution":{"observed_at":"2026-08-01T23:28:59.622925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:28:55.807715Z","title":"Vqa: Visual question answering","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T23:28:55.807715Z"},"links":{"citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:efe5711969de9e91289e2bcfff10b8e89b268ef0b29a50226139e2cb25d0acbc","observation_id":"0ff2ebf1-9fc2-4df4-a004-10ea0e7a75d2","resolution":{"observed_at":"2026-08-01T23:28:55.807715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:28:57.125012Z","title":"Improved baselines with visual instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T23:28:57.125012Z"},"links":{"citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:a7f5db016f78f7be02f1e38ad792068bb5b3051748dccb2b5438232f268fe310","observation_id":"ae858427-a851-449d-baad-cb9207fb2196","resolution":{"observed_at":"2026-08-01T23:28:57.125012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:28:56.035092Z","title":"Are large pre-trained vision language models effective construction safety inspec- tors?, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T23:28:56.035092Z"},"links":{"citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:f88438e4ff135d7da5447790d180b88c94a9ed8a298918756173962344a0e542","observation_id":"7a7c0566-6bc5-4121-ae02-d37742b6c459","resolution":{"observed_at":"2026-08-01T23:28:56.035092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:28:56.131198Z","title":"Doris, Daniele Grandi, Ryan Tomich, Md Ferdous Alam, Mohammadmehdi Ataei, Hyunmin Cheong, and Faez Ahmed","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T23:28:56.131198Z"},"links":{"citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:03ce6b9fd0c460d3300cdb5916fc40f4f14c7b205f01910ea468f7779b237780","observation_id":"88f1199e-4a9c-44a6-ab65-bf3dcee3e951","resolution":{"observed_at":"2026-08-01T23:28:56.131198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:28:55.871341Z","title":"Galaz- Montoya, Yuhui Zhang, Yuchang Su, Disha Bhowmik, Zachary Coman, Sarina M Hasan, Alexandra Johannesson, William D","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T23:28:55.871341Z"},"links":{"citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:7e7d0464b0ce76ba747530d71a20b8b64fdcaf2c5cfe22d915f7360c9f6b1bcc","observation_id":"aa62faaf-d6be-412b-b000-b6ab8e44c544","resolution":{"observed_at":"2026-08-01T23:28:55.871341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:28:56.224966Z","title":"Floorplancad: A large-scale cad draw- ing dataset for panoptic symbol spotting","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T23:28:56.224966Z"},"links":{"citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:391b6a4a57fd82831f8ae5964968a9df66a38a3fca129f871d4b237fef180019","observation_id":"9f717891-e5f7-4cfe-a76a-ace092f3eda4","resolution":{"observed_at":"2026-08-01T23:28:56.224966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:28:55.745606Z","title":"Llava- onevision-1.5: Fully open framework for democratized mul- timodal training, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T23:28:55.745606Z"},"links":{"citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:82cbe4821b7b5f5ebdebc294914e008e3398516f88f5713af9e56fa0bc3b5859","observation_id":"40e0678f-95b9-423a-ae4c-9a7a23386ced","resolution":{"observed_at":"2026-08-01T23:28:55.745606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:28:56.361635Z","title":"Mme-finance: A multimodal finance benchmark for expert-level understanding and rea- soning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T23:28:56.361635Z"},"links":{"citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:f7d7c102e03fac3a9f6eb3523e1126104716e8935c442bcd989bc314a0533666","observation_id":"fb6ca684-c494-4e48-a087-ab570573eced","resolution":{"observed_at":"2026-08-01T23:28:56.361635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:28:56.469991Z","title":"RBench: Graduate-level multi-disciplinary benchmarks for LLM &; MLLM complex reasoning evalu- ation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T23:28:56.469991Z"},"links":{"citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:acc052ea056e16301af8d7599b43128f4d1abfc8f9eae2fdacc00d431a5d48dd","observation_id":"711d3b18-7220-444f-b81a-59a6652bf826","resolution":{"observed_at":"2026-08-01T23:28:56.469991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:28:56.541810Z","title":"Omnimedvqa: A new large- scale comprehensive evaluation benchmark for medical lvlm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T23:28:56.541810Z"},"links":{"citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:cb37c446b79b37ff9cadeffc443e37db51d5964d64a35e930c5c154dfa57d735","observation_id":"3494111d-505f-4b23-9129-0ff386ca773f","resolution":{"observed_at":"2026-08-01T23:28:56.541810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:28:56.642228Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T23:28:56.642228Z"},"links":{"citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:181970adde725c957f3153c965f102a2d3f469111ad89faa30874c429da3e316","observation_id":"ad722b03-8a32-47ca-8a59-13428b3896f9","resolution":{"observed_at":"2026-08-01T23:28:56.642228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:28:56.727583Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T23:28:56.727583Z"},"links":{"citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:9149bb1eb213731705a7989d5adf7a653a7eabad83a61488f875b5798a8abfb2","observation_id":"b53d956d-2528-4347-bc65-1928ae420c61","resolution":{"observed_at":"2026-08-01T23:28:56.727583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:28:56.780619Z","title":"Seed-bench: Benchmark- ing multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T23:28:56.780619Z"},"links":{"citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:45b1aefcb1dad1012a836c61c3bdb5feb78fefcf28daf1a50f1a22cbb82a48b8","observation_id":"3069b9a2-20c5-444a-b713-17aa6d5a0527","resolution":{"observed_at":"2026-08-01T23:28:56.780619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:28:56.846980Z","title":"Drafterbench: Bench- marking large language models for tasks automation in civil engineering, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T23:28:56.846980Z"},"links":{"citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:632a2d932e72dd17b27f61275d796d0d8c85121d5ee0be11c69def4d826bd196","observation_id":"095f1efe-096c-4d8c-848c-b6601d525c74","resolution":{"observed_at":"2026-08-01T23:28:56.846980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:28:56.923864Z","title":"SceMQA: A scientific college entrance level multimodal question answering benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T23:28:56.923864Z"},"links":{"citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:2d6bce93b9810780f871502038e0bd46411235a0fef564cac815ee974b3c561e","observation_id":"65ae23af-9a24-46c3-970c-a3adf9f4d60b","resolution":{"observed_at":"2026-08-01T23:28:56.923864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:28:57.037988Z","title":"Gemex: A large-scale, groundable, and explainable medical vqa benchmark for chest x-ray diagnosis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T23:28:57.037988Z"},"links":{"citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:cfe5f93098784b528411b564d92eed204efcaf34ef42055519552786a43f1ea3","observation_id":"7adec746-f8e4-43aa-9419-43887b6f14a7","resolution":{"observed_at":"2026-08-01T23:28:57.037988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:28:57.207144Z","title":"Mmbench: Is your multi-modal model an all-around player? InComputer Vision – ECCV 2024, pages 216–233, Cham, 2025","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T23:28:57.207144Z"},"links":{"citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:a960de5de284f0c73ca4c338ecadb63eff931ee54fcaed645231cbd55e42a4a2","observation_id":"57477684-b1ff-4ea1-9b22-503575081b9d","resolution":{"observed_at":"2026-08-01T23:28:57.207144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:28:57.269886Z","title":"Micro-bench: A microscopy benchmark for vision- language understanding.Advances in Neural Information Processing Systems, 37:30670–30685, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T23:28:57.269886Z"},"links":{"citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:434f67fc3fccba6d6bc938049d2923e025ab3ebff8eb7d7e699403bfefd22f11","observation_id":"6fca4903-4c21-499f-8647-c663136fe150","resolution":{"observed_at":"2026-08-01T23:28:57.269886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:28:57.365011Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T23:28:57.365011Z"},"links":{"citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:3fa6405bd40b40d5744e9925a02f5df05c4af2c28e5b16fde4c5e9d7bdc3d188","observation_id":"aa0d21de-d5ac-47d7-81a3-1210962f63d0","resolution":{"observed_at":"2026-08-01T23:28:57.365011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:28:57.438314Z","title":"FinMME: Benchmark dataset for financial multi-modal reasoning evaluation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T23:28:57.438314Z"},"links":{"citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:c9bca108e74605d9cd792015506cdbe4999d43dd20dfad8f451ac7d9dd1115c2","observation_id":"2d8a451e-d030-4b3f-b729-2fc62808a74f","resolution":{"observed_at":"2026-08-01T23:28:57.438314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:28:57.536496Z","title":"Archcad-400k: A large-scale cad drawings dataset and new baseline for panoptic symbol spotting","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T23:28:57.536496Z"},"links":{"citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:6839e2271854272ab66dec36986ceef4349d94d282f5e8db03c449baea4fe642","observation_id":"5972c82d-a80f-4ba5-b43e-24de803a10c1","resolution":{"observed_at":"2026-08-01T23:28:57.536496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:28:57.623965Z","title":"Residential floor plan recognition and reconstruction","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T23:28:57.623965Z"},"links":{"citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:035956fb94a6214023e62d93d05f2b1a73751483b2dbb4a8213ae9e9d44949c3","observation_id":"83a48c90-5a79-4a48-90d1-83dab1183777","resolution":{"observed_at":"2026-08-01T23:28:57.623965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:28:57.755065Z","title":"Phi-4-mini technical re- port: Compact yet powerful multimodal language models via mixture-of-loras, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T23:28:57.755065Z"},"links":{"citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:ceb470dbd4c857f6cd80864586e378cd98cb0da335d25169806054aca24f7160","observation_id":"7919f1b7-f60d-4a64-82ef-351f87ca6c45","resolution":{"observed_at":"2026-08-01T23:28:57.755065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:28:57.858309Z","title":"A-okvqa: A bench- mark for visual question answering using world knowledge","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T23:28:57.858309Z"},"links":{"citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:f9b4201b34a7511fbf5c1cbee35c8afaca4d598fbb315607cdc6122ca2bc43e9","observation_id":"79fbece5-5677-4035-a50e-b88430875197","resolution":{"observed_at":"2026-08-01T23:28:57.858309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:28:57.977980Z","title":"Qwen3 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T23:28:57.977980Z"},"links":{"citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:22e201171289291fd28025f42642e5cc1a4338abf342da08ab5ba2b17d6d1830","observation_id":"4bbcd799-cbc6-4213-8dc1-80a7213455c4","resolution":{"observed_at":"2026-08-01T23:28:57.977980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.16081","last_updated":"2025-08-22T04:14:20Z","snapshot_observed_at":"2026-08-07T07:42:29.584700Z","submitted_at":"2025-08-22T04:14:20Z","title":"CEQuest: Benchmarking Large Language Models for Construction Estimation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.16081","snapshot_observed_at":"2026-08-01T23:28:58.158507Z","title":"Cequest: Bench- marking large language models for construction estimation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T23:28:58.158507Z"},"links":{"cited_paper":"/paper/2508.16081","citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:a3244e9b9dd06379fdc8696c313a30d85a5a326271de86bb130449eb6147a9c7","observation_id":"1fccdb11-93ab-4db5-bf61-051684911134","resolution":{"observed_at":"2026-08-01T23:28:58.158507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:28:58.218481Z","title":"Can ai master construction management (cm)? benchmarking state-of-the-art large language models on cm certification exams, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T23:28:58.218481Z"},"links":{"citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:f7da83935abd7d1d6a68e8fa9657e3dfdb5d5ff50d60c136d3bed5400afb4ffc","observation_id":"8c0e8b3a-8f54-4d74-b175-1853727d286b","resolution":{"observed_at":"2026-08-01T23:28:58.218481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:28:58.301832Z","title":"Mm-vet: evaluating large multimodal models for integrated capabilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T23:28:58.301832Z"},"links":{"citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:b9b5e6842a09065a839c17b5a0aed02e2a05ffcad69bbc051843327c0193f1d8","observation_id":"b2476120-54fe-45b1-98cc-5147ccc25607","resolution":{"observed_at":"2026-08-01T23:28:58.301832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:28:58.449248Z","title":"Mmmu: A massive multi-discipline multimodal understand- ing and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T23:28:58.449248Z"},"links":{"citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:1a850c13a5cb0a0f09ff0596b52d4bc0f2cb7a1bf102cc48cc23b1335488ff56","observation_id":"292867be-aa4a-48d4-805b-44d922936c36","resolution":{"observed_at":"2026-08-01T23:28:58.449248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:28:58.572597Z","title":"Deep floor plan recognition using a multi-task network with room-boundary-guided attention","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T23:28:58.572597Z"},"links":{"citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:a6a9651d33b4aa0a957689c4b14300937ef42583b55178fe345752e34ed20639","observation_id":"a921f603-1234-44eb-a8fc-951c96c268bf","resolution":{"observed_at":"2026-08-01T23:28:58.572597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:28:58.677698Z","title":"M3exam: A multilingual, multi- modal, multilevel benchmark for examining large language models.Advances in Neural Information Processing Systems, 36:5484–5505, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T23:28:58.677698Z"},"links":{"citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:8781754b3f6333c03a63daf20e96fa37050f38bcf7c2e83ce8b3168690e3e07e","observation_id":"750768d7-62d8-42e5-b931-48a1f6376cad","resolution":{"observed_at":"2026-08-01T23:28:58.677698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:28:58.750022Z","title":"Pmc-vqa: Visual in- struction tuning for medical visual question answering, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T23:28:58.750022Z"},"links":{"citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:4b8c2058db152be4eea864ce52897e87a4e75d7ea0d40d056085f959e927b84d","observation_id":"8e1c463e-dfef-459f-8e8a-edbbdb02e95c","resolution":{"observed_at":"2026-08-01T23:28:58.750022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:28:58.792929Z","title":"Overview ofDrawingVQA","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T23:28:58.792929Z"},"links":{"citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:48aed25c76aff856fa7e7d30a8cfb3f6a777941ac037f57a21748d20719c51c7","observation_id":"0c2032f8-8431-4294-bc79-06bf0e96825f","resolution":{"observed_at":"2026-08-01T23:28:58.792929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:28:59.028585Z","title":"Baselines","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T23:28:59.028585Z"},"links":{"citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:8b189b0c66258d941fb068613df981cf925f21c35dd898fcf2a0cb2badc078b0","observation_id":"aa8cc483-10f4-4e1a-8c0a-2b0cb98711db","resolution":{"observed_at":"2026-08-01T23:28:59.028585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:28:59.108292Z","title":"expert bottleneck","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T23:28:59.108292Z"},"links":{"citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:78ae20da68435fed3c55e5603931e4533d592e31705ca7faabcdd2bcbb81c370","observation_id":"ddf8d110-8f27-44c4-9b57-c527d7537ccf","resolution":{"observed_at":"2026-08-01T23:28:59.108292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:28:59.203113Z","title":"OCR, Visual Perception","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T23:28:59.203113Z"},"links":{"citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:3225f6aaf05f2e42ca8dca4266eecddade18975adf327b808aa7dad984ec3b27","observation_id":"7048dea6-ea1c-4021-a1dd-827730c0e9be","resolution":{"observed_at":"2026-08-01T23:28:59.203113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:28:59.448156Z","title":"Visual Perception, Reasoning (Alignment, Visual), OCR","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T23:28:59.448156Z"},"links":{"citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:091622b2c76509c14f10b5474803cca10f678f9e09edad74064dcfe1ea244a3a","observation_id":"198b13df-189f-419d-ba60-7019fc510cf0","resolution":{"observed_at":"2026-08-01T23:28:59.448156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:28:59.800016Z","title":"Reasoning (Alignment, Spatial), OCR","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T23:28:59.800016Z"},"links":{"citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:bd939c0817872a8929a6bc9d0f8180903d281796035c2bf87f31b90e6154aabf","observation_id":"342a8184-2faa-44f2-b99a-6d04e987ba9b","resolution":{"observed_at":"2026-08-01T23:28:59.800016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:28:59.940466Z","title":"Knowledge, OCR, Reasoning (Vi- sual, Spatial)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T23:28:59.940466Z"},"links":{"citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:62d23c986d1ed0f21724e7503c893e2cedb8e3fff4d621e976602747a50e8c65","observation_id":"1a1b7d2e-5c1a-4d89-9b44-c096889a32bb","resolution":{"observed_at":"2026-08-01T23:28:59.940466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:29:00.140935Z","title":"Reasoning (Alignment), Visual Per- ception, OCR","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T23:29:00.140935Z"},"links":{"citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:06a0ac2af47d543cf54988beed2690b15b052f695ca59c3b31f00a74dc12d918","observation_id":"0c82cade-8d65-4b35-a682-d9c6aa47ce9a","resolution":{"observed_at":"2026-08-01T23:29:00.140935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:29:00.254896Z","title":"The answer is (X)\\","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T23:29:00.254896Z"},"links":{"citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:50e7bfd638aa64affe9ea01c4fe5b7314205681fadc268ebb488d27ecee349bb","observation_id":"031f92f9-01a6-4c72-985f-e074b851d2d6","resolution":{"observed_at":"2026-08-01T23:29:00.254896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08779","last_updated":"2025-04-04T18:13:45Z","snapshot_observed_at":"2026-08-09T17:36:04.506562Z","submitted_at":"2025-04-04T18:13:45Z","title":"Can AI Master Construction Management (CM)? Benchmarking State-of-the-Art Large Language Models on CM Certification Exams","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08779","snapshot_observed_at":"2026-08-01T23:29:00.488752Z","title":"Xiong, Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T23:29:00.488752Z"},"links":{"cited_paper":"/paper/2504.08779","citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:9d371a2f99bfc7d654f55cf93b88b584d12cf60223224131456f9043d07fbc28","observation_id":"e78abfa0-db37-455c-b52c-57f6e77740c0","resolution":{"observed_at":"2026-08-01T23:29:00.488752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07917","last_updated":"2024-08-23T17:19:18Z","snapshot_observed_at":"2026-07-06T17:58:56.081219Z","submitted_at":"2024-04-11T16:59:54Z","title":"DesignQA: A Multimodal Benchmark for Evaluating Large Language Models' Understanding of Engineering Documentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07917","snapshot_observed_at":"2026-08-01T23:29:00.582559Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T23:29:00.582559Z"},"links":{"cited_paper":"/paper/2404.07917","citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:2f326ca6dd2b1a6c8afc0c2f97ccb96a25beb2f8f1b4effecc01f44bcb29b01e","observation_id":"2bee8ed8-15a9-4efa-b8bf-44ce3ac0f99f","resolution":{"observed_at":"2026-08-01T23:29:00.582559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03321","last_updated":"2025-03-05T09:55:07Z","snapshot_observed_at":"2026-08-07T17:28:11.499465Z","submitted_at":"2025-03-05T09:55:07Z","title":"See What You Are Told: Visual Attention Sink in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03321","snapshot_observed_at":"2026-08-01T23:29:00.730157Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T23:29:00.730157Z"},"links":{"cited_paper":"/paper/2503.03321","citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:82c0c6b38bbf836dba50e473453498b49a998c43f852e9602018f4b24ac0506a","observation_id":"dfaf8944-d82a-4aba-bcd1-997dde3b7c7d","resolution":{"observed_at":"2026-08-01T23:29:00.730157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:29:00.898117Z","title":"Llama-3.2-11b-vision-instruct","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T23:29:00.898117Z"},"links":{"citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:f7c63a6a0e79d776c356b6fcc245e1ce97c25536675fb1615100a22848e35a53","observation_id":"cc5658fa-3d52-452f-a5c0-b2f5dd5cb64e","resolution":{"observed_at":"2026-08-01T23:29:00.898117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-01T23:29:01.030233Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T23:29:01.030233Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:88a77e3e160c56cdbfa386334d924b89b3fb92642f3470b2e393dddd13b80992","observation_id":"1d5ddab6-ecfd-4492-8a70-49f81cfce455","resolution":{"observed_at":"2026-08-01T23:29:01.030233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:29:01.146198Z","title":"The llama 4 herd: The beginning of a new era of natively multimodal ai innovation, April 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T23:29:01.146198Z"},"links":{"citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:b2d3e113e22dee92878ad3345ed32d7a0a91df4c44dd2b5bbfdf382a6fa84cc5","observation_id":"025aeada-05ea-46f4-9e7f-59639cfb5c49","resolution":{"observed_at":"2026-08-01T23:29:01.146198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-08-09T11:59:10.408717Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-08-01T23:29:01.307092Z","title":"Phi-4-mini technical report: Compact yet powerful multimodal language models via mixture-of-loras","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-01T23:29:01.307092Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:84a11ca7b248d9375560e2de9be84182fdbd3e637b347c6c1ca40e8a693c51b3","observation_id":"4d9e78c9-09e4-4148-b100-fc2aaec7711f","resolution":{"observed_at":"2026-08-01T23:29:01.307092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:29:01.445864Z","title":"Burgess et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-01T23:29:01.445864Z"},"links":{"citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:31ed14b413233954b9ce5dd275cc6e75496bf56a819f494edc6ba306dd027571","observation_id":"e695c2ef-bb05-4d72-99ac-84b65e4ad564","resolution":{"observed_at":"2026-08-01T23:29:01.445864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:29:01.594857Z","title":"Yue et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-01T23:29:01.594857Z"},"links":{"citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:e097d7c17d07d6501df42f64eaef130620842717614f4cbf9e3dfd14c24d0f83","observation_id":"66942b01-7847-4f0c-8993-73a45deee2b6","resolution":{"observed_at":"2026-08-01T23:29:01.594857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-01T23:29:01.719021Z","title":"An et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-01T23:29:01.719021Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:0cb902466fd2b1cc53c4115ede55db37253c3e13baa72b175969b782cbfd8198","observation_id":"dbb8dbdd-2c32-43a8-a908-ee7e87b1748c","resolution":{"observed_at":"2026-08-01T23:29:01.719021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-01T23:29:01.869242Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-01T23:29:01.869242Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:2fdd948af29821047659c58a45efeae6674c185b8c1c693b06fee07d7a3ab28c","observation_id":"94998587-451f-4e6e-8757-fe17647b6b45","resolution":{"observed_at":"2026-08-01T23:29:01.869242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-01T23:29:01.995396Z","title":"Wang et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-01T23:29:01.995396Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:2f879c989557a017d206cf7f509c9d858ab2040d28cba6a720a72af569c1a055","observation_id":"39568c5b-0251-4f88-8aa2-18951ac7297e","resolution":{"observed_at":"2026-08-01T23:29:01.995396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:29:02.149807Z","title":null,"venue":null,"work_id":null,"year":1902},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-01T23:29:02.149807Z"},"links":{"citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:fde273a8c48f5af287636f95f8a83013f9848fe730a39b17830a5d6024bddf4c","observation_id":"452419ac-2c48-4ef9-99bf-a11a2c7a10f4","resolution":{"observed_at":"2026-08-01T23:29:02.149807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03882","last_updated":"2024-02-22T01:40:35Z","snapshot_observed_at":"2026-08-06T19:10:47.693909Z","submitted_at":"2023-09-07T17:44:56Z","title":"Large Language Models Are Not Robust Multiple Choice Selectors","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.03882","snapshot_observed_at":"2026-08-01T23:29:02.328455Z","title":"Zheng, H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-01T23:29:02.328455Z"},"links":{"cited_paper":"/paper/2309.03882","citing_paper":"/paper/2607.15418"},"observation_digest":"sha256:38f269a69c34bac7d9b32061f2b65e889ccd25036958f14e65ac9fc94cf879ad","observation_id":"4c31efcf-b031-4334-93ee-712b9eb599cb","resolution":{"observed_at":"2026-08-01T23:29:02.328455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.15418","last_updated":"2026-07-16T19:44:03Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T13:53:25.986787Z","submitted_at":"2026-07-16T19:44:03Z","title":"DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":58,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 1 inbound Pith citation observation for arXiv:2607.15418."}