{"as_of":"2026-08-10T13:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e670dfe2baae761045fa0e26552b592b2b462a3613419d0ff9cff097ec90e3c3","coverage":[{"denominator":103,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:53:33.769358Z","state":"measured"},{"denominator":102,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":102,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T04:17:40.198357Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T15:09:55.004072Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2505.20753","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20753","snapshot_observed_at":"2026-07-04T15:09:55.004072Z","title":null,"venue":null,"work_id":"586a68cf-341b-4352-b4cc-929dd74ae2de","year":2025},"citing_paper":{"arxiv_id":"2606.26196","last_updated":"2026-06-24T15:20:32Z","snapshot_observed_at":"2026-07-07T00:00:31.981360Z","submitted_at":"2026-06-24T15:20:32Z","title":"From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models","version":1},"reference_index":179,"source":"pdf_text","source_observed_at":"2026-06-26T01:50:54.242508Z"},"links":{"cited_paper":"/paper/2505.20753","citing_paper":"/paper/2606.26196"},"observation_digest":"sha256:4fb53d71561380d60ef16ca1f2a0a52abdc51a92b9b3b968ef431466cab323a1","observation_id":"5d8824a4-823a-4543-b995-e55d68069cfd","resolution":{"observed_at":"2026-07-04T15:09:55.006201Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20753","snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"arXiv preprint arXiv:2505.20753 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":267,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"cited_paper":"/paper/2505.20753","citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:9a18973bcd83bc57710f88bfe59b8917221efaf059df93ccb16394f9bd4718ea","observation_id":"5b38d76a-528f-4b16-b509-d2292a23dc31","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.20753/citation-record","integrity":"/paper/2505.20753/integrity","json":"/paper/2505.20753/citation-record.json","paper":"/paper/2505.20753"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:19.496274Z","title":"Tallyqa: Answering complex counting questions","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:19.496274Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:abab1534079375aa368f0159ce3791f27e9154a2de98353a39766ef12274921e","observation_id":"f0c5ce36-7756-4d7f-99c4-076090780625","resolution":{"observed_at":"2026-08-07T13:53:19.496274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:19.548421Z","title":"Macmillan, 2005","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:19.548421Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:5e0c396a6edef246fe85847392dcb3bc1fa4fea72ec2dc379cccb1c51cc42697","observation_id":"378366f4-92e8-4dfe-8de8-9cc157e94372","resolution":{"observed_at":"2026-08-07T13:53:19.548421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-07T13:53:19.693636Z","title":"Qwen-vl: A versatile vision-language model for understanding, localization, text reading, and beyond.arXiv:2308.12966, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:19.693636Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:827f43d454e0235ca3675ae5b76665fae77016f2c839ced0bc1ec36296d8e573","observation_id":"fdf90947-2c0e-48fd-b9a6-444821b05537","resolution":{"observed_at":"2026-08-07T13:53:19.693636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:19.758407Z","title":"Graph of thoughts: Solving elaborate problems with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:19.758407Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:34dd17da1f7ceaa126700deaf30a50322cd50d7a623ec864340c5103b1fe0347","observation_id":"31ab5a2e-056d-4f9d-ab3c-b2824f777881","resolution":{"observed_at":"2026-08-07T13:53:19.758407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:19.844787Z","title":"Vizwiz: nearly real-time answers to visual questions","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:19.844787Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:537489eabae52680d782ba70feaf30c22ded3cf65ed63539618712a0676adf00","observation_id":"c7367a42-a8d2-4aba-b715-d790901e698b","resolution":{"observed_at":"2026-08-07T13:53:19.844787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:19.894399Z","title":"Due: End-to-end document understanding benchmark","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:19.894399Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:dc8a92c685beeccf17dd54434a7f76acb68ca1eb70d9759d240b80177fd04656","observation_id":"27d52929-5863-4763-8f58-0d862d6a24ce","resolution":{"observed_at":"2026-08-07T13:53:19.894399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:19.976064Z","title":"Allava: Harnessing gpt4v-synthesized data for a lite vision-language model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:19.976064Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:f822a25c2c4a3237569e7beebb7cea092e5f56cfd46ca864d187112ef47eaeb4","observation_id":"a14884bd-d4e2-49a5-babe-6df5e63e82e7","resolution":{"observed_at":"2026-08-07T13:53:19.976064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-07-06T15:47:07.545213Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-07T13:53:20.043444Z","title":"Shikra:unleashing multimodal llm’s referential dialogue magic.arXiv:2306.15195, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:20.043444Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:21c7ff9c9edcdaa342455224b0406619560250e3eb2c85004a448afb470bde71","observation_id":"6f9a441d-3597-404b-865a-d2b17460588e","resolution":{"observed_at":"2026-08-07T13:53:20.043444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-07T13:53:20.114407Z","title":"Sharegpt4v: Improving large multi-modal models with better captions.arXiv preprint arXiv:2311.12793, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:20.114407Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:528dc68d0a2f7ba9369882e597a28e9069312a508ff8f9e990339653ac3f17cd","observation_id":"bda90484-709f-472d-b9fa-185e123158c1","resolution":{"observed_at":"2026-08-07T13:53:20.114407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-07T13:53:20.174756Z","title":"Microsoft coco captions: Data collection and evaluation server.arXiv preprint arXiv:1504.00325, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:20.174756Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:b0f139ea0e704e348d9ae48e1fa97bc62826fe8610028177ec0c9fb50a5d05ab","observation_id":"65924100-3232-4961-af83-da8e2ddea302","resolution":{"observed_at":"2026-08-07T13:53:20.174756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:20.255910Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:20.255910Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:48ad153d6c97d39ed3ac22229286c3baa84d9cfeb6be96bd299e86efb8baf45e","observation_id":"4db8759c-387c-4251-be4e-56fc6039b0cb","resolution":{"observed_at":"2026-08-07T13:53:20.255910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:20.325250Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:20.325250Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:3999c2d4e1c014a6ee8ececa7a17310bb911296a16f3ce3ae1cd8eb2fbc63954","observation_id":"52b4758f-07a6-4826-a16b-2257cfbfeaff","resolution":{"observed_at":"2026-08-07T13:53:20.325250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14233","last_updated":"2023-05-23T16:49:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-23T16:49:14Z","title":"Enhancing Chat Language Models by Scaling High-quality Instructional Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14233","snapshot_observed_at":"2026-08-07T13:53:20.400173Z","title":"Enhancing chat language models by scaling high-quality instructional conversations.arXiv preprint arXiv:2305.14233, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:20.400173Z"},"links":{"cited_paper":"/paper/2305.14233","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:231e0768f4685aec8cba5715e31063935eccf2b66bed007cc62cd0d6f2ee93b6","observation_id":"7a573766-a33e-4c3b-a218-901eee60fb5d","resolution":{"observed_at":"2026-08-07T13:53:20.400173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.15010","last_updated":"2023-04-28T17:59:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-28T17:59:25Z","title":"LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.15010","snapshot_observed_at":"2026-08-07T13:53:20.469521Z","title":"Llama-adapter v2: Parameter-efficient visual instruction model.arXiv preprint arXiv:2304.15010, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:20.469521Z"},"links":{"cited_paper":"/paper/2304.15010","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:c65051353ed96ae010baef848855538ab40e06b6702429c10fc7c0ba565bbbcd","observation_id":"417f4e4c-8ac4-44a4-ab4c-d8069a1cf6ed","resolution":{"observed_at":"2026-08-07T13:53:20.469521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:20.529695Z","title":"Shortcut learning in deep neural networks.Nature Machine Intelligence, 2(11):665–673, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:20.529695Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:843a0520230a57e1541b067aec033ac9a6cb17cf4d747a87e3935b9376e3ff28","observation_id":"955f3862-cd6d-425b-9487-cacf88b4967d","resolution":{"observed_at":"2026-08-07T13:53:20.529695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:20.586311Z","title":"Flacuna: Unleashing the problem solving power of vicuna using flan fine-tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:20.586311Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:3ad54319762ca73e52fa453eef83ca496c6c65d9f51c8e4c08d0727d82502662","observation_id":"df4562eb-e1eb-4298-ab9d-ce26fb8d5219","resolution":{"observed_at":"2026-08-07T13:53:20.586311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.02677","last_updated":"2018-04-30T21:53:41Z","snapshot_observed_at":"2026-08-09T05:23:26.365677Z","submitted_at":"2017-06-08T16:51:53Z","title":"Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.02677","snapshot_observed_at":"2026-08-07T13:53:20.636978Z","title":"Accurate, large minibatch sgd: Training imagenet in 1 hour.arXiv preprint arXiv:1706.02677, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:20.636978Z"},"links":{"cited_paper":"/paper/1706.02677","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:4898e85b1a5a8b30c11134a2ceeea1b15b497e1d4ece96dd3a0fe621af8d9216","observation_id":"580d697d-f7a0-417f-9820-53c92980fb3e","resolution":{"observed_at":"2026-08-07T13:53:20.636978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:20.701415Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:20.701415Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:431764c795c33fce3012910d15ec0cbb8beccd3f32c4d37e3eb8d9df663a0e8e","observation_id":"9d33b65c-aaa8-43f7-ac12-8c5fefa27395","resolution":{"observed_at":"2026-08-07T13:53:20.701415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:20.754461Z","title":"Visual programming: Compositional visual reasoning without training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:20.754461Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:63801050d35c5d041fbd28fabb495a2df50e89935b0d7fe6d422bb97fadfb7c2","observation_id":"92a0534e-ba85-4e6b-94bb-03596443725c","resolution":{"observed_at":"2026-08-07T13:53:20.754461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16182","last_updated":"2023-12-24T15:13:10Z","snapshot_observed_at":"2026-07-06T16:12:22.303188Z","submitted_at":"2023-08-30T17:58:50Z","title":"GREC: Generalized Referring Expression Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16182","snapshot_observed_at":"2026-08-07T13:53:20.818723Z","title":"GREC: Generalized referring expression comprehension.arXiv preprint arXiv:2308.16182, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:20.818723Z"},"links":{"cited_paper":"/paper/2308.16182","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:c6ce4cde7a8072a3f0b889e89421a4e26f2df692c8e5e033210bd1b9dc10605e","observation_id":"64bfc413-9da2-4864-9bc9-332813dd0d7f","resolution":{"observed_at":"2026-08-07T13:53:20.818723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:20.893626Z","title":"spaCy: Industrial-strength Natural Language Processing in Python","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:20.893626Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:a21923663d8b51a5f3aea7f5572f774d38913e83cf2f0f010221d7e1c0236a7a","observation_id":"608935c6-b7d3-4b0e-9d73-7fb1f6999ddf","resolution":{"observed_at":"2026-08-07T13:53:20.893626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:21.001252Z","title":"Visual program distillation: Distilling tools and programmatic reasoning into vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:21.001252Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:c1652c0ea836b389a9108de264dfecc8e9a0bb7512c3ea1ae84046b1b97684df","observation_id":"adcf352b-ff59-4a77-a590-39a1900d31a6","resolution":{"observed_at":"2026-08-07T13:53:21.001252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:21.112689Z","title":"Hudson and Christopher D","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:21.112689Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:2e470d8a09486b052b50690c0d912e3160c9d0901df2e981499e847f3b181c95","observation_id":"5ca6894f-45a7-4e25-b8b5-4e6c8779bbe1","resolution":{"observed_at":"2026-08-07T13:53:21.112689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:21.187118Z","title":"Vcoder: Versatile vision encoders for multimodal large lan- guage models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:21.187118Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:2875c87aa65685ad8f784ad6c86af44d73a457f402b51389eca44abe2f3d6d42","observation_id":"e40686fc-98d3-4eb9-b2aa-989e442e7940","resolution":{"observed_at":"2026-08-07T13:53:21.187118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:21.232788Z","title":"Clevr: A diagnostic dataset for compositional language and elementary visual reasoning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:21.232788Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:85f887bf96bc63af524fded8c1454c7f326f42d78067b0cf7ca85716125112db","observation_id":"5a3bc90a-502a-4109-a130-f4f4218e71e7","resolution":{"observed_at":"2026-08-07T13:53:21.232788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:21.291645Z","title":"Dvqa: Understanding data visualizations via question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:21.291645Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:60dfc7f6c419bfbf82a9cc78481190a3a494da6adc8a124bfb3a1fa2962aaddc","observation_id":"fc28b69b-2bdd-4f01-92cb-1e75ae9a1463","resolution":{"observed_at":"2026-08-07T13:53:21.291645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:21.375712Z","title":"Mdetr-modulated detection for end-to-end multi-modal understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:21.375712Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:af066cd1eb40f9ec535dbe01c1a6ed46772882b10a571db0e91b76134a531bdc","observation_id":"7e8d1255-7b28-40ec-9aeb-c7560ea16bc5","resolution":{"observed_at":"2026-08-07T13:53:21.375712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:21.469500Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:21.469500Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:426874e52ec559ab0d577960defa096ec1325026686f55270370e8deecda6eef","observation_id":"6c46aa50-7e9e-497d-8cdd-58f9336c2bdf","resolution":{"observed_at":"2026-08-07T13:53:21.469500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:21.575290Z","title":"Ocr-free document understanding transformer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:21.575290Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:6e4c1e6d5f11ef888cbbbe83dc4147ea3b240a968a8aa49e116143f7cd11e8cc","observation_id":"b88d2eda-89bf-441f-a912-3f178702cb78","resolution":{"observed_at":"2026-08-07T13:53:21.575290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:21.660540Z","title":"Large language models are zero-shot reasoners.Advances in neural information processing systems, 35:22199–22213, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:21.660540Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:e97cf21c13a7a47d15fc31786bdf518f97792e4d1c0f23fbf26cd79b9ff256e9","observation_id":"fde02abc-151c-4d07-8be9-3d5787e222d9","resolution":{"observed_at":"2026-08-07T13:53:21.660540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:21.781128Z","title":"Shamma, Michael S","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:21.781128Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:326200adcbe50c6a41221c0a17c3208a61aee35ce0d1fb0619178d012bedd5a7","observation_id":"8733d8a4-d5f7-4e6d-8edb-c83824827eb1","resolution":{"observed_at":"2026-08-07T13:53:21.781128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12058","last_updated":"2024-02-19T11:23:53Z","snapshot_observed_at":"2026-07-06T17:32:10.828230Z","submitted_at":"2024-02-19T11:23:53Z","title":"Scaffolding Coordinates to Promote Vision-Language Coordination in Large Multi-Modal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12058","snapshot_observed_at":"2026-08-07T13:53:21.886226Z","title":"Scaffolding coordinates to promote vision-language coordination in large multi-modal models.arXiv preprint arXiv:2402.12058, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:21.886226Z"},"links":{"cited_paper":"/paper/2402.12058","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:6b0038eed128d0bc1447d66eb52e5393f85e4750489918280ebdbf59176a73ec","observation_id":"d264e598-dba1-4a0c-8182-39169e1c6db4","resolution":{"observed_at":"2026-08-07T13:53:21.886226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-07T13:53:21.997699Z","title":"Seed-bench: Benchmarking multimodal llms with generative comprehension.arXiv preprint arXiv:2307.16125, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:21.997699Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:9f4aa6292d39c63f5ddcb653038a5e53e2e8aab0f5147c4212ebfe2d8114fdfb","observation_id":"435ca4ef-4f62-4aeb-99fb-5769e0e1ef27","resolution":{"observed_at":"2026-08-07T13:53:21.997699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:22.107442Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:22.107442Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:89f6c7dc45fb7479a72249894bbf62153c2181256a37f4cc49c8b8cb53312c0a","observation_id":"aaa4e6ba-fc9f-48f5-9b0b-facb283dbcf0","resolution":{"observed_at":"2026-08-07T13:53:22.107442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-07T13:53:22.204884Z","title":"Evaluating object hallucination in large vision-language models.arXiv preprint arXiv:2305.10355, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:22.204884Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:b674a4a8d2b7f0a8d0564800bacf27cadd4c54853124af082c779b7baeb01070","observation_id":"a55e395e-5397-4627-8430-f5d8ea9f42d7","resolution":{"observed_at":"2026-08-07T13:53:22.204884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16919","last_updated":"2025-03-08T17:16:09Z","snapshot_observed_at":"2026-08-08T23:08:12.291486Z","submitted_at":"2024-05-27T08:12:00Z","title":"VoCoT: Unleashing Visually Grounded Multi-Step Reasoning in Large Multi-Modal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16919","snapshot_observed_at":"2026-08-07T13:53:22.323235Z","title":"V ocot: Unleashing visually grounded multi-step reasoning in large multi-modal models.arXiv preprint arXiv:2405.16919, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:22.323235Z"},"links":{"cited_paper":"/paper/2405.16919","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:d038d961224970c5d77a488019ab8e33cb0bf7c32a7f891307c0dc3eef766d92","observation_id":"4f1502bd-9178-44d1-928a-fb4d474499b0","resolution":{"observed_at":"2026-08-07T13:53:22.323235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:41.987854Z","title":"Monkey: Image resolution and text label are important things for large multi-modal models","venue":null,"work_id":"c4ca792f-c4b7-4b5d-bd57-30125278f79d","year":2024},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:22.424312Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:65a7293e712c772601b316adb5ad1aece9a37bff6dc34d6c7696c4af7ce169d4","observation_id":"8473446e-f3dc-4a6b-9da8-71901626e012","resolution":{"observed_at":"2026-08-07T13:53:42.125743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:41.731926Z","title":"Openorca: An open dataset of gpt augmented flan reasoning traces","venue":null,"work_id":"5acae410-9f22-4325-8e4f-7f0024a717a4","year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:22.545417Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:8b92bb8cc368a96583f7da8fdd83ef7ba3dbae45a9caab162b3ecabf31bc4906","observation_id":"c11fef41-281f-476d-8165-e17a14aa3f49","resolution":{"observed_at":"2026-08-07T13:53:41.848288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:22.675306Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:22.675306Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:88276142ebd1d5a997775d3be975be3ef946975e0218910782050e36902422a5","observation_id":"a2e8eb45-df10-44a8-8d88-9f589bc5a246","resolution":{"observed_at":"2026-08-07T13:53:22.675306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:41.458391Z","title":"Sphinx-x: Scaling data and parameters for a family of multi-modal large language models","venue":null,"work_id":"41defb1e-733b-4ca1-abf2-bd041d749259","year":null},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:22.820414Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:fb5aac76cf47401eeca6383069353bee59e817438632474426a349eb3abb027b","observation_id":"32adae86-aba9-41c4-98a9-81111160a3a0","resolution":{"observed_at":"2026-08-07T13:53:41.608715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:22.964209Z","title":"Visual spatial reasoning.Transactions of the Association for Computational Linguistics, 11:635–651, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:22.964209Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:3f9780f3d30bbbb49ef4dbe2a496852b4dcc0a64517bad91e179ed637dd78dba","observation_id":"82437ce4-a71e-489f-8774-159e3913f8a1","resolution":{"observed_at":"2026-08-07T13:53:22.964209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:23.130259Z","title":"Improved baselines with visual instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:23.130259Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:37a3cb93b2527b653dde6554c54a2110a037a88bb8e2237f3abac3e8c02a319d","observation_id":"2e9833d0-f52b-4065-8c01-1211b45fa3a0","resolution":{"observed_at":"2026-08-07T13:53:23.130259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:23.373071Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:23.373071Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:9302e558158c7895fb39d45d598f156a12999e7c500c4dba8e4dd680ce1aeae2","observation_id":"63cea63f-afb5-4efd-bb9f-2b4d68737187","resolution":{"observed_at":"2026-08-07T13:53:23.373071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:23.500464Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:23.500464Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:1ab84c711e8d593504180baaf83d1180e4fd8e1dc5a9452e33eccf3a84d74ba1","observation_id":"9b47bb85-f4b1-4233-ab38-4ddb71c2176b","resolution":{"observed_at":"2026-08-07T13:53:23.500464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-07T13:53:23.608745Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection.arXiv preprint arXiv:2303.05499, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:23.608745Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:261a7f76b26981da0d8266d94ff5bbaac31b734007c5f5d745fde6f202d19203","observation_id":"05240b21-1ac2-4421-a709-8474e902b52d","resolution":{"observed_at":"2026-08-07T13:53:23.608745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-07T13:53:23.686995Z","title":"Mmbench: Is your multi-modal model an all-around player?arXiv preprint arXiv:2307.06281, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:23.686995Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:8a0a753efe45652f148689ca1f261556466b8e5fe28dbde4823ff16a4f7b2b93","observation_id":"ea90225d-36a0-4628-b4d1-b53b74070a7d","resolution":{"observed_at":"2026-08-07T13:53:23.686995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1608.03983","last_updated":"2017-05-03T16:28:09Z","snapshot_observed_at":"2026-07-06T05:06:55.589962Z","submitted_at":"2016-08-13T13:46:05Z","title":"SGDR: Stochastic Gradient Descent with Warm Restarts","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1608.03983","snapshot_observed_at":"2026-08-07T13:53:23.781434Z","title":"Sgdr: Stochastic gradient descent with warm restarts.arXiv preprint arXiv:1608.03983, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:23.781434Z"},"links":{"cited_paper":"/paper/1608.03983","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:c9e94a6a5d3e00acd18556654f1571a133cd05d604db0d902416f992c9405398","observation_id":"e2adaeff-cf3f-4379-9212-7a1a5c377f61","resolution":{"observed_at":"2026-08-07T13:53:23.781434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T13:53:23.884963Z","title":"Decoupled weight decay regularization.arXiv preprint arXiv:1711.05101, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:23.884963Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:4e3eccaccb281f24ef0fbc894e9e28ca81cbe5b63083a58bb5ed51cb08b9e033","observation_id":"1c56508f-e269-44b5-96d9-07a2bec943ec","resolution":{"observed_at":"2026-08-07T13:53:23.884963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-05T16:51:32.094151Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-07T13:53:23.995606Z","title":"Deepseek-vl: towards real-world vision-language understanding.arXiv preprint arXiv:2403.05525, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:23.995606Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:25875474a00ff823d079e552dbb61ce94b7890ec629752b0789a46e85b832b6f","observation_id":"2d5289b8-a2f0-4180-8ac6-af8bf1b6a8b7","resolution":{"observed_at":"2026-08-07T13:53:23.995606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:41.189081Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":"31e1bced-69b6-491f-9d50-beec010631c6","year":2022},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:24.139378Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:1a6a542bc9430a2fe99200e6b9b59976aad0934d6991d6a06ad7720485265307","observation_id":"a68b5598-0cb6-4120-bbc7-4155901aeac1","resolution":{"observed_at":"2026-08-07T13:53:41.328177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08568","last_updated":"2025-05-27T07:40:36Z","snapshot_observed_at":"2026-08-04T15:08:40.203853Z","submitted_at":"2023-06-14T15:18:48Z","title":"WizardCoder: Empowering Code Large Language Models with Evol-Instruct","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.08568","snapshot_observed_at":"2026-08-07T13:53:24.296339Z","title":"Wizardcoder: Empowering code large language models with evol-instruct","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:24.296339Z"},"links":{"cited_paper":"/paper/2306.08568","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:5c59bcde97c0790176bf3c682ccbf34f17ede25ec4b2be2eeecaeef36971ebc0","observation_id":"93c279a6-7aaf-40bb-99c5-b7769f486fd0","resolution":{"observed_at":"2026-08-07T13:53:24.296339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:24.447099Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:24.447099Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:37b69bd74adf12058fb8bf3efe12aa45450ad7e512ebf746563dcd69405b4c69","observation_id":"cb7fc0a8-3ee4-45b7-ba58-37f468155d54","resolution":{"observed_at":"2026-08-07T13:53:24.447099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:40.910269Z","title":"ChartQA: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":"2507ee16-1c17-40f0-aa7e-e70315971a01","year":2022},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:24.628303Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:5a8b2c5028445e33d095daec0eb82c409e8b60cc9b1ccb954457e5fa96164e25","observation_id":"f18f105c-723e-4f69-bc5d-835bcd223f7d","resolution":{"observed_at":"2026-08-07T13:53:41.064270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00398","last_updated":"2021-01-05T05:39:39Z","snapshot_observed_at":"2026-08-09T18:59:21.456734Z","submitted_at":"2020-07-01T11:37:40Z","title":"DocVQA: A Dataset for VQA on Document Images","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.00398","snapshot_observed_at":"2026-08-07T13:53:24.790502Z","title":"Docvqa: a dataset for vqa on document images","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:24.790502Z"},"links":{"cited_paper":"/paper/2007.00398","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:37a2edb0451ff40d20369a9924b50573b1436d7645268d12f79d006f0799d06b","observation_id":"99fdb9fa-25a6-4dd7-960c-7f37b6558ffc","resolution":{"observed_at":"2026-08-07T13:53:24.790502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:24.879645Z","title":"Infographicvqa","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:24.879645Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:6d9796b61c97f6f5352b0e38b4d5002e903b3390cd0cc93db7073043bf448c4b","observation_id":"c7fb0e1e-04da-47cc-bf80-2bb65dc0b676","resolution":{"observed_at":"2026-08-07T13:53:24.879645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:40.694793Z","title":"Schema theory revisited.Review of educational research, 75(4):531–566, 2005","venue":null,"work_id":"a9aeb6d2-165d-4f77-a7b2-fecc9c5629a8","year":2005},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:24.937787Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:866119bba155c33e7c6aa330c4fca28a860f9f06f64ddda04bbecba8c96291c6","observation_id":"d5a71263-a21a-4380-abef-d0154ff3ec05","resolution":{"observed_at":"2026-08-07T13:53:40.764860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:40.481037Z","title":"Ocr-vqa: Visual question answering by reading text in images","venue":null,"work_id":"a9be489f-065f-45e9-997e-b1e8a39faa07","year":2019},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:25.026922Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:e81bdc6bf0a7cc32afd2d00ab3a3538bc36716451c22dc86feba1936ed71f716","observation_id":"f8731295-39b9-4461-a89c-a346ff2d16ed","resolution":{"observed_at":"2026-08-07T13:53:40.564102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:40.240621Z","title":"Compositional chain of thought prompting for large multimodal models","venue":null,"work_id":"16d6dcd7-1265-4863-af53-eabc1e8f2d93","year":2024},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:25.120302Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:52022dcd2f8f307e7522526cf20e361cbdaac295081a9d265756f45f37fb0666","observation_id":"50c017f3-90c0-4df5-a43d-a94f52ab6a77","resolution":{"observed_at":"2026-08-07T13:53:40.342412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:25.230063Z","title":"Modeling context between objects for referring expression understanding","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:25.230063Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:e946dda7bd69afa2d5337509d1894805960639708a1736530d63849531b39cd0","observation_id":"c4c16501-60db-4847-a6c4-4a5b7eb6b375","resolution":{"observed_at":"2026-08-07T13:53:25.230063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:25.330170Z","title":"Gpt-4 technical report, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:25.330170Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:debebb0c449d119fe64f1781b48cc91e597e888039f7317c13f6e87c3c15aacb","observation_id":"04158600-31a1-4870-a91c-ace12a753643","resolution":{"observed_at":"2026-08-07T13:53:25.330170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:39.980653Z","title":"Chatgpt: A large language model for natural language processing, 2024","venue":null,"work_id":"87bcb782-7d4e-4e1c-8b73-3ad9bef1115a","year":2024},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:25.475870Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:396d051a8b72754c9bf9a31c98a4b84477165093f1b37cc34799bc4d1b837537","observation_id":"644297db-8b94-4964-ad8d-d9d0c68fa519","resolution":{"observed_at":"2026-08-07T13:53:40.097424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:39.665361Z","title":"Learning to predict visual attributes in the wild","venue":null,"work_id":"70ee987a-9fe1-4998-b420-a41b7f4d4dc0","year":2021},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:25.551507Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:74a8af9fda8e582b1aa69311898b4c66623eda8f183f90ce78e189a35b7015f7","observation_id":"8742e0ac-8199-418e-b456-4aa0f5a1a862","resolution":{"observed_at":"2026-08-07T13:53:39.829599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:39.431287Z","title":"Plummer, Liwei Wang, Chris M","venue":null,"work_id":"c41c2ef8-0fc1-4216-952e-8faf84c3a3d4","year":2017},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:25.619246Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:54cefc99c473f4654cf79dfd99dbb52566c08a7f3f8893a790047e547f1cfb54","observation_id":"e55e88bc-d4d8-4cd2-9c50-ea5b04d010a0","resolution":{"observed_at":"2026-08-07T13:53:39.502500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:39.200960Z","title":"Jack of all tasks master of many: Designing general-purpose coarse-to-fine vision-language model","venue":null,"work_id":"7ab3ae94-f4fd-407d-b375-df2ccb885cd1","year":2024},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:25.770648Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:b062af143c83ef63c8ac003f69b0dad016bdc9a2b52b04524e4cb28dd5e4c966","observation_id":"43f3024b-f2bc-4c52-91c7-2f7eddfb5c10","resolution":{"observed_at":"2026-08-07T13:53:39.286746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04236","last_updated":"2025-03-02T09:39:57Z","snapshot_observed_at":"2026-08-10T05:05:46.269079Z","submitted_at":"2024-02-06T18:43:48Z","title":"CogCoM: A Visual Language Model with Chain-of-Manipulations Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04236","snapshot_observed_at":"2026-08-07T13:53:25.907620Z","title":"Cogcom: Train large vision-language models diving into details through chain of manipulations.arXiv preprint arXiv:2402.04236, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:25.907620Z"},"links":{"cited_paper":"/paper/2402.04236","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:0620dd702550848e622e0c9dca0e4320b32cf8ae0c5acffcf5ace2868a7d83a6","observation_id":"efde47e4-f32c-43f0-8ffa-cd59057f1d59","resolution":{"observed_at":"2026-08-07T13:53:25.907620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:25.963697Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:25.963697Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:f7bdb3d1a7a12c7acb3c874014d38ca23bc07021eccf306510812948e5806e1e","observation_id":"444391bf-6e3d-43a6-988c-750be1226fc7","resolution":{"observed_at":"2026-08-07T13:53:25.963697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:26.136393Z","title":"Deepspeed: System optimizations enable training deep learning models with over 100 billion parameters","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:26.136393Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:14d3c44d81d6ddc21b02dac445b9d9abdb317bf7a189ada41b40eb42c889aaff","observation_id":"fc710403-a39d-40f4-a2ec-e273c051da41","resolution":{"observed_at":"2026-08-07T13:53:26.136393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:38.914454Z","title":"Faster r-cnn: Towards real-time object detection with region proposal networks.Advances in neural information processing systems, 28, 2015","venue":null,"work_id":"ce126065-6f11-4e29-a81e-eb2672466c3b","year":2015},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:26.325068Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:2d8233a55ab2d25c0e9c32507ede340a9b9c75331a05be71feddbd7283c00a2b","observation_id":"2d14563a-fa7f-4563-b0d4-e07d0bba71c7","resolution":{"observed_at":"2026-08-07T13:53:39.065652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:38.569338Z","title":"A- okvqa: A benchmark for visual question answering using world knowledge","venue":null,"work_id":"e5faa042-d140-441e-aff3-e5da46a99d39","year":2022},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:26.448121Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:032d3ff2436ec99ba66360e931609531b46e571b5a0163ffbf2fb3b67d5cc856","observation_id":"40e0e4a3-f065-4fdc-94c8-bfc9dde9bf10","resolution":{"observed_at":"2026-08-07T13:53:38.744111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16999","last_updated":"2024-11-04T05:50:56Z","snapshot_observed_at":"2026-07-06T17:50:18.017647Z","submitted_at":"2024-03-25T17:59:23Z","title":"Visual CoT: Advancing Multi-Modal Language Models with a Comprehensive Dataset and Benchmark for Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16999","snapshot_observed_at":"2026-08-07T13:53:26.608996Z","title":"Visual cot: Unleashing chain-of-thought reasoning in multi-modal language models.arXiv preprint arXiv:2403.16999, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:26.608996Z"},"links":{"cited_paper":"/paper/2403.16999","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:872500efc46ca76294fc8c7024d101eb4da232454d79d98dea64ec94d2a8e2bb","observation_id":"f446b261-ed47-44a9-b1e3-e3c89900bad2","resolution":{"observed_at":"2026-08-07T13:53:26.608996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:26.721908Z","title":"Objects365: A large-scale, high-quality dataset for object detection","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:26.721908Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:df75dba54aab16c122914d51a3ecea4fbc57a0cb99bef1017451756590b12864","observation_id":"a79b54ec-36a7-41a4-9f59-194a176e5c8c","resolution":{"observed_at":"2026-08-07T13:53:26.721908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16045","last_updated":"2024-12-11T02:46:29Z","snapshot_observed_at":"2026-08-10T13:03:08.490304Z","submitted_at":"2023-10-24T17:58:07Z","title":"Woodpecker: Hallucination Correction for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16045","snapshot_observed_at":"2026-08-07T13:53:26.829722Z","title":"Woodpecker: Hallucination correction for multimodal large language models.arXiv preprint arXiv:2310.16045, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:26.829722Z"},"links":{"cited_paper":"/paper/2310.16045","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:b8c6008acfe0abcea4c1f260035b43e231c0ada7b3fe94f3b424687a28acf554","observation_id":"d96e4623-5ba0-4a39-a2e4-78bb8261499a","resolution":{"observed_at":"2026-08-07T13:53:26.829722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:26.964879Z","title":"Textcaps: a dataset for image captioning with reading comprehension","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:26.964879Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:d9a46afcac7a67a72072832cafdf165f21fb45af312f719a4738a7698b4301f0","observation_id":"33b36a20-3f15-494b-9b7e-85c21bb343e3","resolution":{"observed_at":"2026-08-07T13:53:26.964879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:27.138590Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:27.138590Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:5354c56ec70251dbe45a09fe66feadd7300e30c1fcf8477854b24f77abfb75d1","observation_id":"85c83ac2-07e3-4182-ac75-6bc7c05496cb","resolution":{"observed_at":"2026-08-07T13:53:27.138590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:27.298358Z","title":"Vipergpt: Visual inference via python execution for reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:27.298358Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:f3ed41cd56490ae2ef6ed23162a9a33598f6a80beb92f1beaff1506d1377ec62","observation_id":"63324793-9ecd-451d-83e5-20c423547bf7","resolution":{"observed_at":"2026-08-07T13:53:27.298358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T13:53:27.425640Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:27.425640Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:bef1f9a7168ddba441af773b5e356a4f2ead9346efb7b61c30f8d57186b4c09c","observation_id":"b6a94df1-76aa-44e5-b482-72557d258da4","resolution":{"observed_at":"2026-08-07T13:53:27.425640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-07T13:53:27.674640Z","title":"Gemma 2: Improving open language models at a practical size.arXiv preprint arXiv:2408.00118, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:27.674640Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:9132f9debba27eaac5c3ea2888fb8b1c336c6b6cd2de8c40bae391d9f683b7f4","observation_id":"f4576e48-1534-43e1-841f-2936f52b26de","resolution":{"observed_at":"2026-08-07T13:53:27.674640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:38.272595Z","title":"Qwen2.5: A party of foundation models, 2024","venue":null,"work_id":"0dc82627-bce1-4a36-954f-d3fd519d3baf","year":2024},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:27.845136Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:466d5ca78358d29bcdaf7a2da32d44a8f7d9fbd62eb27b3b1dc2fef1053fec47","observation_id":"a8556a4e-68e7-4b55-b6a2-e46ddf9619c1","resolution":{"observed_at":"2026-08-07T13:53:38.385503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-06T03:52:00.226360Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-08-07T13:53:28.020503Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning.arXiv preprint arXiv:2311.07574, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:28.020503Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:e70691d825d7c8d7f49e8e92b2c5c47d7a29356ff064a14d45f3ee5b9b3faf83","observation_id":"00b24c17-26cc-4e54-9912-f809d9449f77","resolution":{"observed_at":"2026-08-07T13:53:28.020503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:37.989817Z","title":"V3det: Vast vocabulary visual detection dataset","venue":null,"work_id":"8f741df1-dc5e-4e41-be40-3e2d70b9de89","year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:28.235980Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:1b23ca6203e6419d36b828aa11c69ed9d11bbd9a3a68b5e2680da6c0570c5f61","observation_id":"a7227ddf-c6ae-4f25-a30b-dc91397c878b","resolution":{"observed_at":"2026-08-07T13:53:38.108520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T13:53:28.436180Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:28.436180Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:1dfd29f2dcaa66233fb80ec5b3396fbe20bd721676d9f0ac1ca5fd179b126045","observation_id":"7ea5dd24-af13-40fd-b158-c0121e0842bd","resolution":{"observed_at":"2026-08-07T13:53:28.436180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:28.654535Z","title":"Chain-of-thought prompting elicits reasoning in large language models.Advances in neural information processing systems, 35:24824–24837, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:28.654535Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:046c7a3c093b78adfa253f05ad267bf857c06e3d0b4a025b6b1fbcee8fd5e993","observation_id":"6664e084-8326-4525-88ac-8aa5900c3b19","resolution":{"observed_at":"2026-08-07T13:53:28.654535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:28.800849Z","title":"V?: Guided visual search as a core mechanism in multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:28.800849Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:d7c2cde3a28e3b8b6342c2b09719ee79a0b5137b6713fa959c71bec833e41617","observation_id":"99fb6267-65f7-4ac8-bcbe-8a35e9da365b","resolution":{"observed_at":"2026-08-07T13:53:28.800849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:37.718733Z","title":"Universal instance perception as object discovery and retrieval","venue":null,"work_id":"b43f848c-9e7f-4f76-9485-48784f869545","year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:28.943646Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:27e0b08420464219f7bd7aa764064647d4b3e7b3d82e40d33b18f8f02f37afab","observation_id":"64d076da-b523-4ae9-95ed-dfada6d68c35","resolution":{"observed_at":"2026-08-07T13:53:37.854933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11441","last_updated":"2023-11-06T07:39:49Z","snapshot_observed_at":"2026-08-04T03:29:49.409446Z","submitted_at":"2023-10-17T17:51:31Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11441","snapshot_observed_at":"2026-08-07T13:53:29.090452Z","title":"Set-of-mark prompting unleashes extraordinary visual grounding in gpt-4v.arXiv preprint arXiv:2310.11441, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:29.090452Z"},"links":{"cited_paper":"/paper/2310.11441","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:37d76746e57fa8d3e6ed51ec843e844e570955c684162daddfb046df0c62fec9","observation_id":"ceb3ff64-846a-4a98-bd96-1e607ffe50f1","resolution":{"observed_at":"2026-08-07T13:53:29.090452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:29.715909Z","title":"Tree of thoughts: Deliberate problem solving with large language models.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:29.715909Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:3f8e9bc0182c705fcbe02deb5d61362c883fd290d2c88146a39a801b856c0964","observation_id":"3bce61a9-aea9-4e95-9caf-c3fdd31c82ca","resolution":{"observed_at":"2026-08-07T13:53:29.715909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:37.436810Z","title":"Ferret: Refer and ground anything anywhere at any granularity","venue":null,"work_id":"20611d39-57c7-49b8-a2b3-47058ccaff05","year":2024},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:31.986056Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:961642bbdfb0ce5f967c0d59497abb35d887bce9d3259ccbc36f4d9325d52d1f","observation_id":"47d9c578-d58f-4748-af17-7ea6ee6efd43","resolution":{"observed_at":"2026-08-07T13:53:37.509787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05719","last_updated":"2024-04-08T17:55:44Z","snapshot_observed_at":"2026-07-06T17:57:19.117933Z","submitted_at":"2024-04-08T17:55:44Z","title":"Ferret-UI: Grounded Mobile UI Understanding with Multimodal LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05719","snapshot_observed_at":"2026-08-07T13:53:32.111913Z","title":"Ferret-ui: Grounded mobile ui understanding with multimodal llms.arXiv preprint arXiv:2404.05719, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:32.111913Z"},"links":{"cited_paper":"/paper/2404.05719","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:b747849d73085084b787911e18f3c1fab06f73a4482aa260c87f54c64a9f39d8","observation_id":"81556e13-6f8a-4852-8d99-066d8bf27378","resolution":{"observed_at":"2026-08-07T13:53:32.111913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:32.216567Z","title":"Modeling context in referring expressions","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:32.216567Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:a873d5f0ac4fb0199d838142ee6eb44e6b52112b39acfe6f9eee2ffd9a8f0508","observation_id":"c74538d7-e8a4-4a2b-b73e-4170ddac37f4","resolution":{"observed_at":"2026-08-07T13:53:32.216567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.12284","last_updated":"2024-05-03T17:36:07Z","snapshot_observed_at":"2026-08-02T15:00:50.388422Z","submitted_at":"2023-09-21T17:45:42Z","title":"MetaMath: Bootstrap Your Own Mathematical Questions for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.12284","snapshot_observed_at":"2026-08-07T13:53:32.326619Z","title":"Metamath: Bootstrap your own mathematical questions for large language models.arXiv preprint arXiv:2309.12284, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:32.326619Z"},"links":{"cited_paper":"/paper/2309.12284","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:83fb90be3109d99b4515c712fc60d7b1c677f31b54bdd9313c14a33dc73ad0c5","observation_id":"88ee7ea1-47a9-43a7-870b-bd16d1a7f6d9","resolution":{"observed_at":"2026-08-07T13:53:32.326619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:32.463254Z","title":"Osprey: Pixel understanding with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:32.463254Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:8f24d3b40c04d38ff99e706b3d8bd09f6ba5ce7b27874c79d91caf83d8262b47","observation_id":"aad44938-ec86-46b1-9972-491612c46e4b","resolution":{"observed_at":"2026-08-07T13:53:32.463254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05653","last_updated":"2023-10-03T02:48:42Z","snapshot_observed_at":"2026-08-07T14:43:09.380195Z","submitted_at":"2023-09-11T17:47:22Z","title":"MAmmoTH: Building Math Generalist Models through Hybrid Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05653","snapshot_observed_at":"2026-08-07T13:53:32.600372Z","title":"Mam- moth: Building math generalist models through hybrid instruction tuning.arXiv preprint arXiv:2309.05653, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:32.600372Z"},"links":{"cited_paper":"/paper/2309.05653","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:b1fdb350c890b3db07a09bac88f477dcde2896a3366fdfa08a8b39c3bbfc5a10","observation_id":"1db65240-c2c3-444a-a8f7-6bbfac99a870","resolution":{"observed_at":"2026-08-07T13:53:32.600372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:37.180491Z","title":"Griffon: Spelling out all object locations at any granularity with large language models","venue":null,"work_id":"bb44ed7f-d3fb-4ae2-a0aa-e3a427ad9155","year":2024},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:32.713818Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:62baac636e686dc5e2761df02352c318d248e13d4dd30869f797c35e696330e5","observation_id":"60d458aa-0cd3-4836-96de-c49499754562","resolution":{"observed_at":"2026-08-07T13:53:37.294153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03493","last_updated":"2022-10-07T12:28:21Z","snapshot_observed_at":"2026-07-06T14:01:50.333970Z","submitted_at":"2022-10-07T12:28:21Z","title":"Automatic Chain of Thought Prompting in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03493","snapshot_observed_at":"2026-08-07T13:53:32.834055Z","title":"Automatic chain of thought prompting in large language models.arXiv preprint arXiv:2210.03493, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:32.834055Z"},"links":{"cited_paper":"/paper/2210.03493","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:fa4888d8930673b99175e42df110435fb1bafe0eec2226b06c0657c859e9914a","observation_id":"250fc1e9-7210-495a-9cb2-b8a494f739d5","resolution":{"observed_at":"2026-08-07T13:53:32.834055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:36.860192Z","title":"yes” or “no","venue":null,"work_id":"a328b780-1f7c-49e9-b334-dccebfa4de83","year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:32.967018Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:06b691b059f4883a8adfe8967bebdd5f6e57fdec4c16bc1fb2bd7dc899e5baa0","observation_id":"43994f56-3434-4817-80de-4d69d73512ac","resolution":{"observed_at":"2026-08-07T13:53:37.033887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:36.516463Z","title":null,"venue":null,"work_id":"69a6d824-43c6-44c6-9830-db24980ff2f8","year":null},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:33.117627Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:4127837028a7062e958dd80160a623fc8ecd431187755a8946b607d00052d7ef","observation_id":"420e162c-67b3-4f6f-9d11-b5510053330e","resolution":{"observed_at":"2026-08-07T13:53:36.655327Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:36.101881Z","title":null,"venue":null,"work_id":"6b96233a-cfe1-443b-8325-73e171abf455","year":null},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:33.381162Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:dcbc3310236d9b5880d3340979c5d90d455724190f1978273260621ec560a08b","observation_id":"f776522e-df36-4c05-9dbb-8041809823c6","resolution":{"observed_at":"2026-08-07T13:53:36.188645Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:35.642377Z","title":null,"venue":null,"work_id":"b7c612cc-6de7-49a2-8ff0-865677e328a3","year":null},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:33.586439Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:ab7c94f1a54d28da1c56b91e8918cb54fa70ff89fecf55db2913d49e5d7aaed5","observation_id":"8fa7385a-6ddc-471a-ab2d-f46df1dbc8bb","resolution":{"observed_at":"2026-08-07T13:53:35.804909Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:35.213184Z","title":null,"venue":null,"work_id":"de18ce1b-39df-4c17-8a8f-be787450a16a","year":null},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:33.665448Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:72da8c8eb2c71c661d3989012ad1ddb0162dc55cb1d44cf91cca7900040ef8cb","observation_id":"af56e164-1237-4768-94ab-da81c32ec363","resolution":{"observed_at":"2026-08-07T13:53:35.445068Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:36.294410Z","title":null,"venue":null,"work_id":"2542bfe8-6053-415e-b840-4e0dc4bacee4","year":null},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:33.769358Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:b912421a4807db975fa19540eea89f7a9903ec5e6571316a5c21d577a50de2c4","observation_id":"1d7846c4-193e-4223-9e09-2d8cbd0b1552","resolution":{"observed_at":"2026-08-07T13:53:36.375321Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T15:49:45.420093Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":80,"verified_exact":0,"verified_fuzzy":20},"total_outbound_references":103},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 100 of 103 outbound references and 2 inbound Pith citation observations for arXiv:2505.20753."}