{"as_of":"2026-08-13T12:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cbd513a7d47b334bd21023c8ccf3e3044df18e6245a41bd3c98b218adba94faa","coverage":[{"denominator":89,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":89,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T12:18:41.518126Z","state":"measured"},{"denominator":89,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":89,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.21924/citation-record","integrity":"/paper/2507.21924/integrity","json":"/paper/2507.21924/citation-record.json","paper":"/paper/2507.21924"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:31.323457Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:31.323457Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:2a9c51ed9f08056397b4654455838d2e06ec6f83321146aa70b7a15cb5046454","observation_id":"5478395a-a3e2-4910-ab88-b83667be0c36","resolution":{"observed_at":"2026-08-06T12:18:31.323457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-12T17:29:41.806995Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T12:18:31.561550Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:31.561550Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:1de8c51ff5aef09d98fd74a48d63d1c999ec357808e8a83ce7e458cb1a65051a","observation_id":"0462b592-f0b1-40a1-ab79-724f553592da","resolution":{"observed_at":"2026-08-06T12:18:31.561550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:31.688929Z","title":"Jawahar, Ernest Valveny, and Dimos- thenis Karatzas","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:31.688929Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:6cf87016630fe6edbc27a6aede95498b28308809d6a097373109e3c968b4d031","observation_id":"d43985dd-d259-4ece-bddd-04e480c521b6","resolution":{"observed_at":"2026-08-06T12:18:31.688929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:31.821625Z","title":"An augmented benchmark dataset for geometric question answering through dual parallel text en- coding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:31.821625Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:c346f53b24ae42ae95f9eedc014ec79bd9e79508691f6799393062ac9cd6d6fc","observation_id":"5e75490b-058d-4a84-81f8-52a64d95e4fb","resolution":{"observed_at":"2026-08-06T12:18:31.821625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05915","last_updated":"2023-10-09T17:58:38Z","snapshot_observed_at":"2026-08-13T05:53:40.193848Z","submitted_at":"2023-10-09T17:58:38Z","title":"FireAct: Toward Language Agent Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05915","snapshot_observed_at":"2026-08-06T12:18:31.887391Z","title":"Fireact: Toward lan- guage agent fine-tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:31.887391Z"},"links":{"cited_paper":"/paper/2310.05915","citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:a4714e98194c3123efe2a2d4cd03a2027e055274838b0a6f9cb116cbc9018694","observation_id":"3baeeb8c-e4ef-4928-8cff-4e32bae54d62","resolution":{"observed_at":"2026-08-06T12:18:31.887391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:31.962339Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:31.962339Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:7429142bfd0c898da6fea545a4e2c02748a473f0c29c8608751f3237530a612a","observation_id":"463991f0-cc00-40b0-8798-d05ee1827c01","resolution":{"observed_at":"2026-08-06T12:18:31.962339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:32.056475Z","title":"Are we on the right way for evaluating large vision-language models? In The Thirty-eighth Annual Con- ference on Neural Information Processing Systems, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:32.056475Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:c8ba22de9efd0dadf99a788a5aefdfa2c167ee01a6c273adb3377c4459bba82d","observation_id":"6705916d-5dbc-4a8f-8611-f80eeaf2b8f1","resolution":{"observed_at":"2026-08-06T12:18:32.056475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-12T23:57:52.483265Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-08-06T12:18:32.202517Z","title":"M 3 cot: A novel benchmark for multi- domain multi-step multi-modal chain-of-thought","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:32.202517Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:fcefbdb201bb4565ad5c2e7c3da79b7e26b5380a132395c0f5002a0549ab3c1c","observation_id":"c5d95906-1dc0-47af-9f83-a6d76b8c75b1","resolution":{"observed_at":"2026-08-06T12:18:32.202517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11713","last_updated":"2023-10-17T14:19:13Z","snapshot_observed_at":"2026-08-13T12:39:09.859466Z","submitted_at":"2023-02-23T00:33:54Z","title":"Can Pre-trained Vision and Language Models Answer Visual Information-Seeking Questions?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.11713","snapshot_observed_at":"2026-08-06T12:18:32.356535Z","title":"Can pre-trained vision and language models answer vi- sual information-seeking questions? arXiv preprint arXiv:2302.11713, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:32.356535Z"},"links":{"cited_paper":"/paper/2302.11713","citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:1fe59d79dca32bb0d1efbe11a5186907d34337f699443972566b2871d18eeb0b","observation_id":"b2b48a63-6335-45e0-b0b6-35b2fc97d4c6","resolution":{"observed_at":"2026-08-06T12:18:32.356535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12881","last_updated":"2024-03-19T16:26:10Z","snapshot_observed_at":"2026-08-13T00:50:10.638819Z","submitted_at":"2024-03-19T16:26:10Z","title":"Agent-FLAN: Designing Data and Methods of Effective Agent Tuning for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12881","snapshot_observed_at":"2026-08-06T12:18:32.447571Z","title":"Agent- flan: Designing data and methods of effective agent tuning for large language models.arXiv preprint arXiv:2403.12881,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:32.447571Z"},"links":{"cited_paper":"/paper/2403.12881","citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:9b82c23c6fbffac68cf2cabfb518a674a065f755c7aac7e71ec418772dd9d638","observation_id":"b41b9cc9-cd38-4c58-9845-d34dd9504529","resolution":{"observed_at":"2026-08-06T12:18:32.447571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-06T12:18:32.551884Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test- time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:32.551884Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:6bc09dac2d28e12de0dfe3b2ef84108b9755d9c0a53e7cebc7fcf3f22f7982fb","observation_id":"92c9f48c-c1af-4cba-885d-a314261a25bf","resolution":{"observed_at":"2026-08-06T12:18:32.551884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:32.676917Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:32.676917Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:34a5b73d45d787ccc8dde466031009fbb36eb247cf96e090a3437a87c3c86fca","observation_id":"15d9bcc5-8cbf-46d3-96b5-c0b01a6075ea","resolution":{"observed_at":"2026-08-06T12:18:32.676917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:32.810532Z","title":"Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:32.810532Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:1f52de3231bab37d481efdfa773cf2bf6949c5ca9dc639ef41369f5811c59e1d","observation_id":"a80648dd-7b1d-458c-ab83-446322737701","resolution":{"observed_at":"2026-08-06T12:18:32.810532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:32.899714Z","title":"Clevr-math: A dataset for compositional language, visual and mathematical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:32.899714Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:dd39a0c8cab58c07eaadd3ccf9377880fe4cc0b7a5097f19251703ca34d78618","observation_id":"971d3421-3b28-423f-9ecc-977122187998","resolution":{"observed_at":"2026-08-06T12:18:32.899714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.09941","last_updated":"2020-10-15T14:21:53Z","snapshot_observed_at":"2026-07-06T09:57:27.039262Z","submitted_at":"2020-09-21T14:57:18Z","title":"PP-OCR: A Practical Ultra Lightweight OCR System","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.09941","snapshot_observed_at":"2026-08-06T12:18:33.133368Z","title":"Pp-ocr: A practical ultra lightweight ocr system","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:33.133368Z"},"links":{"cited_paper":"/paper/2009.09941","citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:773a98401e6bf5fa2a12b6e4524fd493d360aa863699316034240124a3016217","observation_id":"4f5df2a3-68f0-4fb0-9d97-992800e1cd89","resolution":{"observed_at":"2026-08-06T12:18:33.133368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:53.249151Z","title":"Vlmevalkit: An open-source toolkit for evaluating large multi-modality models","venue":null,"work_id":"396de713-1b4c-4d8c-8d58-4e8efdb0b366","year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:33.235402Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:576e9ea55420b451dd3c88083450952636dcaada72c5913530aebdc70706e746","observation_id":"b5973dad-5e46-4e7a-9168-241b722a9d96","resolution":{"observed_at":"2026-08-06T12:18:53.445321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08640","last_updated":"2023-06-28T05:00:35Z","snapshot_observed_at":"2026-08-13T11:17:16.685240Z","submitted_at":"2023-06-14T17:12:56Z","title":"AssistGPT: A General Multi-modal Assistant that can Plan, Execute, Inspect, and Learn","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.08640","snapshot_observed_at":"2026-08-06T12:18:33.353518Z","title":"Assistgpt: A gen- eral multi-modal assistant that can plan, execute, inspect, and learn","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:33.353518Z"},"links":{"cited_paper":"/paper/2306.08640","citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:8d8ac158b5fc02350d2ec93dce13ad03ebcbbcf9bb9471a94e06d4f4b5f34b98","observation_id":"b764f13b-cc2a-4907-983f-74e1c22f8fe0","resolution":{"observed_at":"2026-08-06T12:18:33.353518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:53.002516Z","title":"Multi-modal agent tuning: Building a vlm-driven agent for efficient tool usage","venue":null,"work_id":"0f2933d9-bda3-44d0-bb55-c903e96bd1ac","year":2025},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:33.503296Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:17004cf5c9d7740b78c59a1305688496a2feb9153849dc39560cca57d5102b3d","observation_id":"0b4a3181-5f0a-43df-9a38-1b3f554a584c","resolution":{"observed_at":"2026-08-06T12:18:53.080042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:52.715429Z","title":"Hallusionbench: an advanced diagnos- tic suite for entangled language hallucination and visual il- lusion in large vision-language models","venue":null,"work_id":"8085dbbd-8e36-404f-8544-bb2c9b8eead1","year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:33.635653Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:33a5bae0262032ccf89cd3b8e35f4834129f3c27d02b61a91c2915ac224a31c4","observation_id":"e63cb2f6-1627-44cd-8a77-77aa298bd6b9","resolution":{"observed_at":"2026-08-06T12:18:52.871053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:33.799912Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:33.799912Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:b71f58a06a4fdbd19588fc38dab2caa2b18f707588b35ab5f0441607795f8714","observation_id":"1d71c6f4-9663-4f51-bedf-903cc3f88412","resolution":{"observed_at":"2026-08-06T12:18:33.799912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:52.605420Z","title":"Icdar2019 compe- tition on scanned receipt ocr and information extraction","venue":null,"work_id":"124bc148-0e2d-4d50-bbd9-82a4c647136a","year":2019},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:33.926347Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:849237ed0d2d1dca2a4341e8e1c9f6f291ddba9fc193935e753d71f2ff0d7c21","observation_id":"eae346d7-dea3-4869-a0fd-8ff980354b34","resolution":{"observed_at":"2026-08-06T12:18:52.676694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:52.256054Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional 9 question answering","venue":null,"work_id":"bb5c0204-e42d-4d40-a884-7d505554410b","year":2019},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:34.070741Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:25c76d36953f12b3b47f4c9957f2748438bee17883d0b8d83894142708e551d4","observation_id":"3877697a-21a2-4942-8ffc-e5c49755e270","resolution":{"observed_at":"2026-08-06T12:18:52.425932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T12:18:34.176052Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:34.176052Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:44d2b4b46cf65aa455ba68c27376fc2a402de926ee1e9ff9c9cafbba7ca2df5c","observation_id":"7624ac31-6ceb-4462-b1f2-92689753961f","resolution":{"observed_at":"2026-08-06T12:18:34.176052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:51.981315Z","title":"Lawrence Zitnick, and Ross Girshick","venue":null,"work_id":"97a4c1f2-72df-4578-a657-ff01df17582a","year":null},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:34.324440Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:8ee3e3b4ac93afcc50a0e3f0fff69a2313607bc57a5fde35f2d8b5ec27b387dc","observation_id":"e6c32f4b-80b9-4a92-ba9d-501d5d813541","resolution":{"observed_at":"2026-08-06T12:18:52.105623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:51.654957Z","title":"A diagram is worth a dozen images","venue":null,"work_id":"8cf6da31-0776-4fce-af7e-f688a8a81493","year":2016},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:34.473275Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:bf6e3e0ff98520c6c55e8cab9611251a673ea09f91d8334e45c69a9fa0e49f3a","observation_id":"3cde0bb2-3704-4693-af26-65dc37e6cc7b","resolution":{"observed_at":"2026-08-06T12:18:51.795759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:51.114874Z","title":"Are you smarter than a sixth grader? textbook question answer- ing for multimodal machine comprehension","venue":null,"work_id":"ca7ae37f-4fdb-4277-8507-1ae8ce6d55a3","year":2017},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:34.736523Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:59e7d59d4588fa2beca40d95dfc84aa4965616a8a5238c1c1aaa69893005770b","observation_id":"f257a9f9-e7c1-4d5c-a8b0-4517f4a3ed53","resolution":{"observed_at":"2026-08-06T12:18:51.269990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:50.911071Z","title":"The hateful memes challenge: Detecting hate speech in multimodal memes","venue":null,"work_id":"a46de47d-d48c-4ff0-a2a5-a6029cfaa7d2","year":2020},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:34.828859Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:efbcd9c4505b4fe00e933f97996af587e1e16133a6138c0c2e0d2a7899bc09b2","observation_id":"71b10f2c-bc23-4add-b219-882ce0430e63","resolution":{"observed_at":"2026-08-06T12:18:50.997805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:50.645558Z","title":"The open images dataset v4: Unified image classification, object detection, and visual relationship detection at scale","venue":null,"work_id":"7601ebdf-66d5-480b-9502-b03621a9a09a","year":1956},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:34.949585Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:6c13d25f6db90bf7ea7ca7b22562a7025c82f63f201d0a5d9c5dd17c33349ad4","observation_id":"126b78f9-f3f7-4151-8c5e-c6987d0b1265","resolution":{"observed_at":"2026-08-06T12:18:50.784892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02246","last_updated":"2024-05-03T17:00:00Z","snapshot_observed_at":"2026-08-13T00:15:14.556734Z","submitted_at":"2024-05-03T17:00:00Z","title":"What matters when building vision-language models?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02246","snapshot_observed_at":"2026-08-06T12:18:35.087650Z","title":"What matters when building vision-language models? arXiv preprint arXiv:2405.02246, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:35.087650Z"},"links":{"cited_paper":"/paper/2405.02246","citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:288fb8a5000875b4aab616b78a536cf53f1eac387bb45cddccc8d0673767f0f2","observation_id":"cb91d659-f428-42cd-9432-dd29556578f5","resolution":{"observed_at":"2026-08-06T12:18:35.087650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:50.417633Z","title":"Kankanhalli","venue":null,"work_id":"d3471041-e9e6-4739-a611-6fd0aca28e1c","year":2017},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:35.219442Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:30d01515d550c33b38458cc7bdd3442a02cfe5a5cfe69dda929fc132dac9ea5e","observation_id":"32ee5be9-6523-403c-8df5-f6171b4f14aa","resolution":{"observed_at":"2026-08-06T12:18:50.510363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02937","last_updated":"2025-05-26T06:14:02Z","snapshot_observed_at":"2026-08-12T22:07:29.019095Z","submitted_at":"2024-11-05T09:27:21Z","title":"Benchmarking Multimodal Retrieval Augmented Generation with Dynamic VQA Dataset and Self-adaptive Planning Agent","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02937","snapshot_observed_at":"2026-08-06T12:18:35.368071Z","title":"Benchmarking multimodal retrieval augmented generation with dynamic vqa dataset and self- adaptive planning agent","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:35.368071Z"},"links":{"cited_paper":"/paper/2411.02937","citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:f41c9b244aa6f94df021caaff025b8c1f7f80cf25283ca3c370301e433617cc2","observation_id":"bf4c79f0-08e5-4ae4-9fb8-731fff0b5e2b","resolution":{"observed_at":"2026-08-06T12:18:35.368071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:50.172008Z","title":"Visual spatial reasoning","venue":null,"work_id":"bc05d2a0-ba4c-44c2-9db6-2acc647b7ac7","year":2023},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:35.520950Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:39947f69fb1793ad81c5c0c18feb23682c76c7b06c3013f69fbb4b138fc69972","observation_id":"e6dbb72a-e8be-4707-98fa-1a65ca8b36d9","resolution":{"observed_at":"2026-08-06T12:18:50.268677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:35.688521Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:35.688521Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:f3cf10ef6c7b8c2778eee22ea4997e426e2bdeff1d3a7186c29337954ba4e2ab","observation_id":"150b32c7-24de-4cd7-a868-11d75292721e","resolution":{"observed_at":"2026-08-06T12:18:35.688521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:35.794468Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:35.794468Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:7abf9329151c13e531d281581778f0748a6b21a20f7a056b426854a93528de04","observation_id":"c24c4f2e-b304-45f7-a192-054771395861","resolution":{"observed_at":"2026-08-06T12:18:35.794468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:49.930556Z","title":"Llava-plus: Learning to use tools for creating multi- modal agents","venue":null,"work_id":"fc40c5a9-f0d3-4449-b99b-07cb31541305","year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:35.884051Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:c50b35fcfa1a1667f0c96eed3ad9381720988bf7f802eaf4a4b4f95a3f1a7946","observation_id":"da4acb6d-e861-4fe5-bc60-f8c68030414d","resolution":{"observed_at":"2026-08-06T12:18:50.028090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:49.650153Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":"2f5f4254-d2fc-494c-86d1-994ef6a66011","year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:36.050970Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:e1cbad61e609cf4d455ae77cb6e894d0945ecb2ab03a675bf187b604cc7fcd83","observation_id":"3c4785de-f488-46e6-894f-42253a8b2587","resolution":{"observed_at":"2026-08-06T12:18:49.759709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:49.402233Z","title":"On the hidden mystery of ocr in large multimodal models","venue":null,"work_id":"e384e11b-186f-4d7f-86ab-6783468157db","year":2023},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:36.188259Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:f80afc71da1c7683ff869e165d24ffbea4414a116adab632601ca99fd5082f65","observation_id":"17eb8dc7-fd91-4c74-a714-e93a0aae3cc0","resolution":{"observed_at":"2026-08-06T12:18:49.507460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:49.072168Z","title":"Inter-gps: Interpretable geometry problem solving with formal language and sym- bolic reasoning","venue":null,"work_id":"0aed73a0-7046-45b5-a94a-7f9ed6274082","year":2021},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:36.349318Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:53f0a19dac587314c717e01bfa3d08d0e5cb4cda905aed2e2465c72b49148f76","observation_id":"e8520f35-a2c8-4be5-be7d-da8fdc5baeea","resolution":{"observed_at":"2026-08-06T12:18:49.280302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:48.812929Z","title":"Iconqa: A new benchmark for abstract diagram understand- ing and visual language reasoning","venue":null,"work_id":"b50ad4f9-0f9d-4ddd-9bd3-8eca2c8192bd","year":2021},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:36.452978Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:1e996820e15db33203debc7e44a986668751e5091fb9d4700147961573911473","observation_id":"eec69d49-8b0a-48c7-834b-7b86943d7753","resolution":{"observed_at":"2026-08-06T12:18:48.930150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:48.505184Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":"9aa10b9e-8450-40e7-8a82-54d75e7778a7","year":2022},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:36.570393Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:9febb646af3ddd525d1ad6cfc5d7171859d0407d0ffbe3ae27af5ea868fe1f1e","observation_id":"ce7ff31f-0d94-4bb9-8493-408472c1e8f2","resolution":{"observed_at":"2026-08-06T12:18:48.664559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-08T00:29:35.147198Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-08-06T12:18:36.719126Z","title":"Dynamic prompt learning via policy gradient for semi-structured mathematical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:36.719126Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:904a958ba5aa4ad3aa037bb07efd4a2edff37a660a73a07b35a0452bd835ad37","observation_id":"319aec87-0af3-4f86-bfe8-be9ab2818488","resolution":{"observed_at":"2026-08-06T12:18:36.719126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:48.257690Z","title":"Mathvista: Evaluating mathe- matical reasoning of foundation models in visual contexts","venue":null,"work_id":"ac6cc8a7-95ea-4daa-a6a7-87e585c26926","year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:36.825822Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:50fbd49912dce12c18bfd93075fda1945a1f34aed2de32ae95df6f20e21bcdf5","observation_id":"2ab389bd-043c-404e-8d5f-fce2f8f5d213","resolution":{"observed_at":"2026-08-06T12:18:48.351154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:48.217850Z","title":"ChartQA: A benchmark for question answer- ing about charts with visual and logical reasoning","venue":null,"work_id":"24a28bd5-2d95-4495-aab7-859c19f8ccd1","year":2022},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:36.926908Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:3ebdce1d7ef25673ef46fe8559c9bb32be75b4afb33a30c41b54a994c96c6904","observation_id":"0780e952-e4e3-4756-b3fb-50787697b212","resolution":{"observed_at":"2026-08-06T12:18:48.243615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:48.081806Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":"6604500e-87e2-43c5-b3e4-0cd1bb6646d2","year":2021},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:37.040447Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:51a7a835290dd1ffbe7cca26990ee5d415ab4969d38a641cc87fc3fb139cad0c","observation_id":"6f07a7d3-977d-4b42-a5e1-42ec6e1e802e","resolution":{"observed_at":"2026-08-06T12:18:48.168702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:47.972901Z","title":"Infographicvqa","venue":null,"work_id":"191ab3db-4700-4836-9f40-70b0f8b73971","year":2022},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:37.177685Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:e00b7961015c891a7b556f0b6d2fa8126abb201a94924888d2dbcaf4094fdb9b","observation_id":"1c296ffe-614f-4b16-b661-1b1a212f80d4","resolution":{"observed_at":"2026-08-06T12:18:48.004564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:47.874383Z","title":"Llama 3.2: Revolutionizing edge ai and vision with open, customizable models","venue":null,"work_id":"70c96431-78ad-4e92-8648-c5314225cb41","year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:37.259659Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:54132e3aa4469a0b7f2f686f187b17ea7dd0a85198ea6d8fab3d2760bd384ea9","observation_id":"6ae9bfaa-2a9c-4804-aa2a-dc2b857795ce","resolution":{"observed_at":"2026-08-06T12:18:47.920183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:47.738572Z","title":"Compositional chain-of-thought prompting for large multimodal models","venue":null,"work_id":"4f3c91de-e275-4a21-b730-968f4743fedf","year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:37.377593Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:8dd310fe7bc5ae01bcea84f35e02edc9bc811d28c63ad3fcff7d70373fd1960b","observation_id":"71d02cb0-f2c3-4195-be9c-e0e90823e35f","resolution":{"observed_at":"2026-08-06T12:18:47.797006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:47.606591Z","title":"Compositional semantic parsing on semi-structured tables","venue":null,"work_id":"166f1fe1-ed7c-459a-a863-9136b71012c6","year":2015},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:37.497595Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:6ff42b808d3a6dd613f8782c7737b9dddb84a834cec483f387250e5ae0ca278c","observation_id":"89d54ed3-7d75-46e4-9c19-469c7336160e","resolution":{"observed_at":"2026-08-06T12:18:47.676234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:47.469293Z","title":"Flickr30k entities: Collecting region-to-phrase corre- spondences for richer image-to-sentence models","venue":null,"work_id":"6b9033c2-ba0a-4740-956a-dafd8c774269","year":2015},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:37.575202Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:c1697af3c37afe785f3759b07bf0e77fd0c8e8fe6ccce044c8bf2994b03e14ad","observation_id":"53b939d8-6681-442e-976a-2f9777000580","resolution":{"observed_at":"2026-08-06T12:18:47.533383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:47.344463Z","title":"A benchmark of facial recognition pipelines and co-usability performances of mod- ules","venue":null,"work_id":"2b2cb9c4-0951-4ce5-bf3e-f7e3645197d4","year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:37.702678Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:a79eb759205b82cddfd25a4214d3c1bed8ccac44b8d62af8f2fed5f91c9a3821","observation_id":"67ba3997-6b2a-4bf6-96b9-68bb29ab71f5","resolution":{"observed_at":"2026-08-06T12:18:47.367570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:47.240389Z","title":"Putting gpt-4o to the sword: A comprehensive evaluation of language, vision, speech, and multimodal proficiency","venue":null,"work_id":"4d526bb4-ffe4-4157-8561-9dd3053de362","year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:37.818888Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:6e8800c89dbc97bf8e4a799f22533f5d54e75075878d778d1178f309584e4c04","observation_id":"65e6ac54-3195-45f1-bb0a-adf7d0b85a17","resolution":{"observed_at":"2026-08-06T12:18:47.277223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:47.089229Z","title":"Visual cot: Advancing multi-modal language models with a comprehen- sive dataset and benchmark for chain-of-thought reasoning","venue":null,"work_id":"f7eeda6e-7eee-4c8e-98ce-3f3997cc300c","year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:37.933670Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:68f62034716b47f43f5a1aea5b45dd4417360904e45fa8011000ff614f7671c2","observation_id":"1494792a-ecc3-4427-8057-b946dd8698eb","resolution":{"observed_at":"2026-08-06T12:18:47.182352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:38.079081Z","title":"Hugginggpt: Solving ai tasks with chatgpt and its friends in hugging face","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:38.079081Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:417432561bfd6a13232d4dcdf1b2060e0d4ea335f5997b448ae2d5a50a1dfe56","observation_id":"be5ce8d3-57c9-458f-9ab8-cb9c930acd9a","resolution":{"observed_at":"2026-08-06T12:18:38.079081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:38.200474Z","title":"Textcaps: a dataset for image caption- ing with reading comprehension","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:38.200474Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:f88cf7093f6fac57748ef2f453fc50a500e73576b297072379c82b61a1ce5ae3","observation_id":"d7963086-d156-4656-8cc0-45f01486735e","resolution":{"observed_at":"2026-08-06T12:18:38.200474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:46.935806Z","title":"Towards vqa models that can read","venue":null,"work_id":"f3e173e7-cc73-4325-b876-0df21eb1a2a0","year":2019},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:38.315186Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:b3b4a965441d67958bf074afeee0b9aabf03d44a6f75fe9409444723dae034a6","observation_id":"031f965e-c81e-47ce-990d-88f3dc516a55","resolution":{"observed_at":"2026-08-06T12:18:46.982901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02502","last_updated":"2024-07-10T17:36:25Z","snapshot_observed_at":"2026-08-13T04:03:34.485741Z","submitted_at":"2024-03-04T21:50:29Z","title":"Trial and Error: Exploration-Based Trajectory Optimization for LLM Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02502","snapshot_observed_at":"2026-08-06T12:18:38.403343Z","title":"Trial and error: Exploration-based trajectory optimization for llm agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:38.403343Z"},"links":{"cited_paper":"/paper/2403.02502","citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:a6850da022ae1260fc44dcedf465a0b53bc1278ec9c4e77a2417607aa46e0fec","observation_id":"957c6707-7fcb-4195-84a1-e72f0b84820a","resolution":{"observed_at":"2026-08-06T12:18:38.403343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:46.669731Z","title":"Tang, Angie Boggust, and Arvind Satyanarayan","venue":null,"work_id":"7cbb8d9a-0672-4a9b-87ad-6218a28e0026","year":2023},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:38.500912Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:d408476e8a39f2204c6f7bcee9727e28946ee2c10aa13b8445b102e3e68fadda","observation_id":"cc460c53-afcf-45cc-bb4e-231079fc7c88","resolution":{"observed_at":"2026-08-06T12:18:46.756525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T12:18:38.622584Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:38.622584Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:40d2fd18db96c54389ec08c3515d9f98c5fac58d9bb0ecae9dc4126c30227756","observation_id":"e04a0778-012f-48fb-91de-e1f8e17e9509","resolution":{"observed_at":"2026-08-06T12:18:38.622584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:46.428829Z","title":"Document understanding dataset and evaluation (dude)","venue":null,"work_id":"d463c27d-d9ba-4ac1-a07f-6698b1c5df68","year":2023},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:38.703728Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:833c9981df3ee2ccb5f9276847cc22172f77ec326e931a4326ee835f3f9ebe06","observation_id":"771ed215-2e01-4c95-beb8-e346183c90ee","resolution":{"observed_at":"2026-08-06T12:18:46.522644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:46.177873Z","title":"The caltech-ucsd birds-200-2011 dataset","venue":null,"work_id":"b65401bb-bb36-4dc9-9a13-c1542a9e39a9","year":2011},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:38.811721Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:d491d1e9ad3c96dfcc4eb0c9414ba288f598ca8aaf8e11dc98267b1507188a3d","observation_id":"8a635456-6fae-42b1-b5e6-1c6d2232609a","resolution":{"observed_at":"2026-08-06T12:18:46.288111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:45.976762Z","title":"Screen2words: Automatic mobile ui summarization with multimodal learning","venue":null,"work_id":"a470a18e-dbd8-42dd-805f-9615937e15f1","year":2021},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:38.899604Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:53d68af473d99f192adfb6b8191c7819aa7dda2d3d7446dd682fa6a0f9c1a15f","observation_id":"17cea784-ef6c-4838-ba07-805935d5b36f","resolution":{"observed_at":"2026-08-06T12:18:46.064600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04746","last_updated":"2024-03-07T18:50:51Z","snapshot_observed_at":"2026-08-13T00:59:51.460587Z","submitted_at":"2024-03-07T18:50:51Z","title":"LLMs in the Imaginarium: Tool Learning through Simulated Trial and Error","version":1},"cited_work":{"arxiv_id":"2403.04746","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.04746","snapshot_observed_at":"2026-08-06T12:18:41.756866Z","title":"LLMs in the Imaginarium: Tool Learning through Simulated Trial and Error","venue":"cs.CL","work_id":"a4228b51-e3a5-4542-a7d3-dc5e1e902e5b","year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:39.029360Z"},"links":{"cited_paper":"/paper/2403.04746","citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:e51d2f22d94de9dd49e24b16809672fb4610c3987375249b338cb9e9bae33561","observation_id":"3d2fe1c4-0a8c-4ee2-bfd4-ebe8f53cfd67","resolution":{"observed_at":"2026-08-06T12:18:41.874604Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10727","last_updated":"2025-04-11T10:01:13Z","snapshot_observed_at":"2026-08-13T04:39:07.381736Z","submitted_at":"2024-01-19T14:44:37Z","title":"MLLM-Tool: A Multimodal Large Language Model For Tool Agent Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10727","snapshot_observed_at":"2026-08-06T12:18:39.118189Z","title":"Mllm-tool: A multimodal large language model for tool agent learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:39.118189Z"},"links":{"cited_paper":"/paper/2401.10727","citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:62982e76a6208fd4097d79937a2a651f019f9547f6507e1e5a9e25355fc903f5","observation_id":"7509c407-ae30-4486-8ab7-12cd21de8e94","resolution":{"observed_at":"2026-08-06T12:18:39.118189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:45.740010Z","title":"Mea- suring multimodal mathematical reasoning with math-vision dataset","venue":null,"work_id":"06032c77-d763-4aec-90e6-a5316ba0230e","year":2025},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:39.207676Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:ef93a7a694707338c40a88680caf82183d4e82f6fd9021011c565cded66472fc","observation_id":"29515936-2adf-4b96-8dcd-d245ff7c8558","resolution":{"observed_at":"2026-08-06T12:18:45.869578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T12:18:39.306583Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:39.306583Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:918920b9bc83b938e78a75ca957aac20ad93fcbac66952b11dafdd01aca02afb","observation_id":"5e426e2b-2a9f-4ee5-b01b-71570168c1a5","resolution":{"observed_at":"2026-08-06T12:18:39.306583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-06T12:18:39.399123Z","title":"Visual chatgpt: Talking, drawing and editing with visual foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:39.399123Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:b82adf43fa043958f681df941a1718857b7522ecc1caa1088dd504d204f3409d","observation_id":"b2630173-c5e9-4b66-b4b2-b531121a1309","resolution":{"observed_at":"2026-08-06T12:18:39.399123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:45.502258Z","title":"Grok-1.5 vision preview","venue":null,"work_id":"2fc7993d-d13c-4f47-9bcd-965135a5af06","year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:39.504236Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:aa06208922d5a5bcba1c4b6c7e0ab5ed63942843da1cd9507a4d9543a9f98ad4","observation_id":"4197aa3f-1e21-4c07-b7c3-0bd0709b8881","resolution":{"observed_at":"2026-08-06T12:18:45.603526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-08-07T09:36:29.319006Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-08-06T12:18:39.605249Z","title":"Llava-o1: Let vision language models reason step- by-step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:39.605249Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:4def5aca4d50b8f3248f6a6ad806944ebdda7f1c9348e7e1b16722db6f4bdc98","observation_id":"744db546-4e65-46b4-96d3-0275004cc8e8","resolution":{"observed_at":"2026-08-06T12:18:39.605249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:45.256798Z","title":"Llava-cot: Let vision language models reason step- by-step, 2024","venue":null,"work_id":"3ef3322e-e53a-450a-b964-382c3361dc1f","year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:39.749545Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:7bf80d94b5940e0f7273032cf078d326ee47633672f166409ebdc63843c744df","observation_id":"6af0f074-14a1-49a9-a077-7722867c6ca3","resolution":{"observed_at":"2026-08-06T12:18:45.387347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:45.003711Z","title":"Gpt4tools: Teaching large language model to use tools via self-instruction","venue":null,"work_id":"190356cb-5940-4797-90bc-71f49645fd6e","year":2023},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:39.829944Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:244be82e020e37dea006b8892de64366ba2c9d5ba6f20d3c7db9390eb22f1ee8","observation_id":"6f935308-2bd6-42db-a8bb-dbd13a588ae8","resolution":{"observed_at":"2026-08-06T12:18:45.106833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:44.762502Z","title":"React: Synergizing rea- soning and acting in language models","venue":null,"work_id":"522ed7f3-3f9b-48fb-93aa-04a565582bb3","year":2023},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:39.900854Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:f00ecdc7bdc28ebfb668e4528632f8eb82cfa12727f7e579a88e83015fceee95","observation_id":"fc6a8b88-5b9e-4155-82de-657a638a8d80","resolution":{"observed_at":"2026-08-06T12:18:44.865434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-06T12:18:40.013192Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:40.013192Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:88f1b6ab3552458c433258d211ec310295bb4aaa31d4d13e6bb60e5b9fc2a8bd","observation_id":"6aed4166-fd33-4939-ae15-4e8f720b5c6a","resolution":{"observed_at":"2026-08-06T12:18:40.013192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:44.567121Z","title":"Agent lumos: Unified and modular training for open-source language agents","venue":null,"work_id":"03fa697e-9b47-42c3-9d00-0d4b7be08ebf","year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:40.111923Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:0c3d5e6f17a4db943cd570e7927b43e0ced21e382267ed0eb504ab5d1fc66538","observation_id":"bed3ff95-f0d1-42b0-b8b5-0604add61aee","resolution":{"observed_at":"2026-08-06T12:18:44.640480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:44.295859Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for ex- pert agi","venue":null,"work_id":"3fda3734-6279-4ef5-b1e8-04744779c103","year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:40.209708Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:d112a694497fee45ef37f7b2ac61990c31db092d658e7d86e51698f25ae853b5","observation_id":"09ac949a-d7ff-4981-a42b-e5acb84a3f31","resolution":{"observed_at":"2026-08-06T12:18:44.437025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12823","last_updated":"2023-10-22T16:19:16Z","snapshot_observed_at":"2026-08-13T05:45:19.606713Z","submitted_at":"2023-10-19T15:19:53Z","title":"AgentTuning: Enabling Generalized Agent Abilities for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12823","snapshot_observed_at":"2026-08-06T12:18:40.313560Z","title":"Agenttuning: En- abling generalized agent abilities for llms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:40.313560Z"},"links":{"cited_paper":"/paper/2310.12823","citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:227f08ad57844824062a66150f5fafe32589002bb82175a5f7840c5c1e7aca50","observation_id":"565e3f9f-ecd4-4be0-a9e7-b16f64f828c3","resolution":{"observed_at":"2026-08-06T12:18:40.313560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:44.062117Z","title":"Raven: A dataset for relational and analogical visual reasoning","venue":null,"work_id":"b5bbf6a3-a7cd-4eff-ac25-c4cb334ca35f","year":2019},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:40.418499Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:2f30e78d0a6e527722371092f6416e98fbbb56b4ef0cd9658ee42a586a9ca997","observation_id":"0967ca33-3478-437a-911a-75eb29b5b5d5","resolution":{"observed_at":"2026-08-06T12:18:44.189547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:43.872458Z","title":"Swift:a scal- able lightweight infrastructure for fine-tuning, 2024","venue":null,"work_id":"953a9170-5671-4bad-b040-60c50d637abe","year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:40.563398Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:1e690a51bda01fc300dcf9bea31f98f6de060e84ac8f86c05b6cb23e250a56d0","observation_id":"0cc7d3f4-c98e-406c-8321-11f839aad7c7","resolution":{"observed_at":"2026-08-06T12:18:43.965856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:43.665967Z","title":"Seq2sql: Generating structured queries from natural language using reinforcement learning, 2017","venue":null,"work_id":"06d57c4b-da7f-43f5-a7b3-eba2fe860c82","year":2017},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:40.636458Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:d2ab8e3e2a6aeb485d1339ff97dd6027d6d448c5dce222161f63d526fab4e6c0","observation_id":"4411d2fb-c374-493c-8caa-d4770086b41b","resolution":{"observed_at":"2026-08-06T12:18:43.750174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:43.400294Z","title":"Visual7w: Grounded question answering in images","venue":null,"work_id":"d37744df-fdb2-41bf-a2fb-904d9972fa43","year":2016},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:40.695193Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:16ae69207e927b545a6d9f072f1ba3c089eb543b2ed561db98e22cfb90200aee","observation_id":"de5ef537-70bf-40f3-9766-c216ab3a5fd5","resolution":{"observed_at":"2026-08-06T12:18:43.524971Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:40.808887Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:40.808887Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:bd4bacdf53cf092af7f869d8ccd8fa606e66aac8f295f0782d27ac0caabd0f59","observation_id":"5256053a-33dd-46de-8251-152ba8f8af31","resolution":{"observed_at":"2026-08-06T12:18:40.808887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:40.922255Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:40.922255Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:3a8e46da18b322028a3a37205343ebb273b7d242c88f093ac9d0d6307c1db4a1","observation_id":"c81563ba-84aa-460c-a47c-c3f38c58dd28","resolution":{"observed_at":"2026-08-06T12:18:40.922255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:43.121637Z","title":"objects\": [","venue":null,"work_id":"a0935625-1b85-49bd-86bf-e60ba92fbbf4","year":null},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:41.042512Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:ecec6d6de13d09a4d5b70a375922502fa6d137bee0c9c8f829c448ef7bb2000d","observation_id":"8c1b6981-1d26-4138-b7c8-99894dea8acf","resolution":{"observed_at":"2026-08-06T12:18:43.246936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:42.867039Z","title":null,"venue":null,"work_id":"89d87364-5601-461f-9bcc-c168b939dfe8","year":null},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:41.141614Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:c778f6701eff1e668c440cac285cdf2fbae3a926c26b4e8b93d5fcd265eceeac","observation_id":"05128088-b15e-47bb-ac2d-8c23e84e2e5c","resolution":{"observed_at":"2026-08-06T12:18:42.999932Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:42.619399Z","title":"image_caption","venue":null,"work_id":"a81e3ea4-1d56-4125-bb9c-c3acfc908cd0","year":null},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:41.259999Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:ab8a440987488bf682fe617ae528d212c86700b0bc7b2b77acb93758656c2025","observation_id":"3f7bae2a-c3bb-48b8-98f5-9085610ac3ff","resolution":{"observed_at":"2026-08-06T12:18:42.706027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:42.391975Z","title":"needed\": true,","venue":null,"work_id":"791da42b-db94-400e-b079-4cee2140f5f8","year":null},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:41.390516Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:ef8b068a02c1211524b005c0ea7e296d6551cd769314d682b23580df45372eb8","observation_id":"d5f08797-6684-43ed-88c0-c5610b21feb7","resolution":{"observed_at":"2026-08-06T12:18:42.471282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:42.169099Z","title":"continue","venue":null,"work_id":"4fb730a4-cce8-4a13-bc52-3eca8d5a8904","year":null},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:41.518126Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:a2659c46694fa6a2db9b0fe0c0c87b3caacdf79223085d1f0ad39cc20ea9188c","observation_id":"72e7adf1-f915-45ba-b014-9a7760bf60b4","resolution":{"observed_at":"2026-08-06T12:18:42.265587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:33.027058Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":170,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:33.027058Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:9fb3a7e1ba816bcb2e69b4b11a3fd58d379027eb2f0c1aa21efeb3ba4bfbec8b","observation_id":"d63ce0b8-1ee8-4fc6-a71d-aea9de96110b","resolution":{"observed_at":"2026-08-06T12:18:33.027058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:18:51.421998Z","title":null,"venue":null,"work_id":"cf1c1a00-3cfa-49bd-83a0-587800ef3f2c","year":2016},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":251,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:34.612419Z"},"links":{"citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:4e14491a4fbb1cc094264d92d872f8a6ef60951325f6a064b9dbab1f96af40fc","observation_id":"cf2204af-5146-43f9-9318-0ccc42de42dc","resolution":{"observed_at":"2026-08-06T12:18:51.528283Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T12:18:31.416961Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:31.416961Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:457541a9c9c233ea0873a373bd35599aa78a188da2e73f3a41780ea4a1e9dfbf","observation_id":"846a591b-e1c1-4d71-bf21-87c1e714b30f","resolution":{"observed_at":"2026-08-06T12:18:31.416961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T07:14:16.143343Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning"},"reference_resolution":{"displayed":89,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":38,"verified_exact":1,"verified_fuzzy":48},"total_outbound_references":89},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 89 of 89 outbound references and 0 inbound Pith citation observations for arXiv:2507.21924."}