{"as_of":"2026-08-16T21:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2661b93a1a3fbc1815827620508da5df24becef12464c2f4d397c32969fca80a","coverage":[{"denominator":98,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":98,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:40:25.866299Z","state":"measured"},{"denominator":98,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":98,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.21389/citation-record","integrity":"/paper/2505.21389/integrity","json":"/paper/2505.21389/citation-record.json","paper":"/paper/2505.21389"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-16T19:15:03.922358Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-07T13:40:16.876872Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:16.876872Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:b14d5256bf462c2cbb732ac4f451bcd62b499c6b46068903d332863169a5dfa2","observation_id":"859e0860-1a10-44ea-97f4-4cd191c0163c","resolution":{"observed_at":"2026-08-07T13:40:16.876872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-16T19:40:28.523700Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T13:40:16.965863Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:16.965863Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:f7de171f9d74558007669b056b3178bb02a34bf13872e93b038e2377d20ec92b","observation_id":"0729bc2a-b115-45d9-acc8-ac2492a13ee9","resolution":{"observed_at":"2026-08-07T13:40:16.965863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07073","last_updated":"2024-10-10T17:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-09T17:16:22Z","title":"Pixtral 12B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07073","snapshot_observed_at":"2026-08-07T13:40:17.009599Z","title":"Pixtral 12b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:17.009599Z"},"links":{"cited_paper":"/paper/2410.07073","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:2983d4026dc81fead959beb817b2110cdbf5ed72c5c85598af74f82a84fe7fd7","observation_id":"079b0580-3e41-495c-9245-cd3bdebbd3e7","resolution":{"observed_at":"2026-08-07T13:40:17.009599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:40:17.058484Z","title":"Item response theory: What it is and how you can use the irt procedure to apply it","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:17.058484Z"},"links":{"citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:8610f9d64809b9ec1350ab1927f76f7da8e092d10d7393e16ec55d43f43e8d06","observation_id":"e11e2f29-ff11-441f-916e-ae9f96db639d","resolution":{"observed_at":"2026-08-07T13:40:17.058484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-07T13:40:17.127745Z","title":"Qwen-vl: A versatile vision-language model for understanding, localization, text reading, and beyond, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:17.127745Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:9c3558bc94ae0a256c113b02c0ce73c14293ae7229f4a51d0c2b356c92d358fd","observation_id":"2f164e09-d6e1-49a0-936e-b035439e018c","resolution":{"observed_at":"2026-08-07T13:40:17.127745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T13:40:17.235028Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:17.235028Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:5179b85dc1b1687787a60caddda1eb658b2fe62783287772c4e566edc68d9c6d","observation_id":"7927f561-cbe5-4108-927e-2b125ae26319","resolution":{"observed_at":"2026-08-07T13:40:17.235028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-07T13:40:17.304870Z","title":"PaliGemma: A versatile 3B VLM for transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:17.304870Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:3bcbd3b7a4089589a2bd1f3201d8c9def97aa8077cb4e9aa0b4f75b7facb2736","observation_id":"dbdff70e-2be6-4d25-9704-bddeebb5f246","resolution":{"observed_at":"2026-08-07T13:40:17.304870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.02434","last_updated":"2018-07-16T02:46:10Z","snapshot_observed_at":"2026-08-14T21:21:54.681306Z","submitted_at":"2017-01-10T04:26:06Z","title":"A Conceptual Introduction to Hamiltonian Monte Carlo","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.02434","snapshot_observed_at":"2026-08-07T13:40:17.377010Z","title":"Pyro: Deep universal probabilistic programming","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:17.377010Z"},"links":{"cited_paper":"/paper/1701.02434","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:f6908f77a50e99e90d8c6fcd1a9f2be4480e145bb69b9740ffd5f0d767b5e51e","observation_id":"2e3d10c7-ce79-499f-8a62-2560758f21e8","resolution":{"observed_at":"2026-08-07T13:40:17.377010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:40:17.476747Z","title":"Item response theory","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:17.476747Z"},"links":{"citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:d8bdffc8cb4911c6c4a7d5afd499a24823c34c20533f681a10b8d8c2ef0a6635","observation_id":"7256ea90-91fe-4931-adab-9785d9e88e4d","resolution":{"observed_at":"2026-08-07T13:40:17.476747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-08-12T12:44:22.350068Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-07T13:40:17.593586Z","title":"Janus-pro: Unified multimodal understanding and generation with data and model scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:17.593586Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:0750c507fa86d803b93840a4a002a3169c64496dfc929b9a6bfbaf56090eca2c","observation_id":"01a3f6e8-ed5f-428f-ae38-e30f8c9e180a","resolution":{"observed_at":"2026-08-07T13:40:17.593586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T13:40:17.736081Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:17.736081Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:4632bc5d2f3ce55007c88cc663b83dcda93f5076845ee01ccd2ce4edc4b72ead","observation_id":"0c8d5d8f-a9db-45a7-b901-2184cca4158c","resolution":{"observed_at":"2026-08-07T13:40:17.736081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-07T13:40:17.925783Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:17.925783Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:6283aac06dc5f1590351cfbf8a2617615df1ab52e412c95ee88b850f53862c22","observation_id":"60714eb7-06d6-49be-8b88-0d9642f4ba7d","resolution":{"observed_at":"2026-08-07T13:40:17.925783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:40:18.004748Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:18.004748Z"},"links":{"citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:bafb7df2d537346f4cb0b60bf6f248a9844e84c719154c528c5597277722730e","observation_id":"3ce60de2-ff36-4248-b395-deaec309f805","resolution":{"observed_at":"2026-08-07T13:40:18.004748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.11698","last_updated":"2021-05-25T06:43:13Z","snapshot_observed_at":"2026-08-16T18:22:28.914874Z","submitted_at":"2021-05-25T06:43:13Z","title":"Guiding the Growth: Difficulty-Controllable Question Generation through Step-by-Step Rewriting","version":1},"cited_work":{"arxiv_id":"2105.11698","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.11698","snapshot_observed_at":"2026-08-07T13:40:27.646856Z","title":"Guiding the Growth: Difficulty-Controllable Question Generation through Step-by-Step Rewriting","venue":"cs.CL","work_id":"da7d76e9-e103-4833-a01c-2e6bf32702c6","year":2021},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:18.134077Z"},"links":{"cited_paper":"/paper/2105.11698","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:8b10aa69da331f4ad1a6c022bf16e176020de8644c988cea0cfd1fe46be10225","observation_id":"53d5e796-3d5d-45fe-92d6-accde172e660","resolution":{"observed_at":"2026-08-07T13:40:27.784818Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:40:18.299995Z","title":"https://github.com/jiutiancv/JT-VL-Chat , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:18.299995Z"},"links":{"citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:b028d9c98ffcb330c4d1264acc1f37e10086bd3df16390d62731dfec3ef18e32","observation_id":"d7fa42ba-1ca5-4c80-aaa8-c3ec8efc44e9","resolution":{"observed_at":"2026-08-07T13:40:18.299995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11402","last_updated":"2024-10-22T23:13:34Z","snapshot_observed_at":"2026-08-16T13:17:44.282942Z","submitted_at":"2024-09-17T17:59:06Z","title":"NVLM: Open Frontier-Class Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11402","snapshot_observed_at":"2026-08-07T13:40:18.424220Z","title":"Nvlm: Open frontier-class multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:18.424220Z"},"links":{"cited_paper":"/paper/2409.11402","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:3ae3856fec4ac8035bcb96203af6aa4e2f44eb6b12da460176a7bc5332e7cd9a","observation_id":"4a7b1f43-7a6b-431e-9147-1e3b5b05c94c","resolution":{"observed_at":"2026-08-07T13:40:18.424220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:40:18.565070Z","title":"Smith, Hannaneh Hajishirzi, Ross Girshick, Ali Farhadi, and Aniruddha Kembhavi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:18.565070Z"},"links":{"citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:8b9696d85021b89fe4ce23a71438d3d62c5b3d9247077138b9d9dfdd486b91cd","observation_id":"aa5e6d45-5701-4755-b6de-8fc3dbb449fd","resolution":{"observed_at":"2026-08-07T13:40:18.565070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-07T13:40:18.745834Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:18.745834Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:ef15bda32c28bcdb2c1d67eee447c4a8299f871401df10c96ffb8459786ad5c2","observation_id":"41571838-bf52-4676-847b-b06030067006","resolution":{"observed_at":"2026-08-07T13:40:18.745834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:40:18.905650Z","title":"Easy2hard-bench: Standardized difficulty labels for profiling llm performance and generalization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:18.905650Z"},"links":{"citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:504764c9314f6480a412379655916e3ba5c5230a9749e27611e8a1d88d907d87","observation_id":"f96212fa-8499-41f4-a7f8-0867af10a55c","resolution":{"observed_at":"2026-08-07T13:40:18.905650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12480","last_updated":"2024-08-23T09:52:52Z","snapshot_observed_at":"2026-08-16T13:24:33.685916Z","submitted_at":"2024-08-22T15:15:51Z","title":"Vintern-1B: An Efficient Multimodal Large Language Model for Vietnamese","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12480","snapshot_observed_at":"2026-08-07T13:40:18.998229Z","title":"Doan, Bao G","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:18.998229Z"},"links":{"cited_paper":"/paper/2408.12480","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:543a8095c91d5aa057b896c1cfc90b490cfe5d2a259d4d6ea188904ece77a803","observation_id":"9320d1f5-1fce-4579-85aa-230e6bdb3984","resolution":{"observed_at":"2026-08-07T13:40:18.998229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16420","last_updated":"2024-01-29T18:59:02Z","snapshot_observed_at":"2026-08-16T05:38:56.513422Z","submitted_at":"2024-01-29T18:59:02Z","title":"InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16420","snapshot_observed_at":"2026-08-07T13:40:19.144832Z","title":"Internlm-xcomposer2: Mastering free-form text-image composition and comprehension in vision-language large model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:19.144832Z"},"links":{"cited_paper":"/paper/2401.16420","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:8c9f22e7f6dcc7f5309f5c585ee12c0becc2d538b577c173ea902bbaff732c29","observation_id":"e074296d-34d8-4ca8-97c5-a1dff4d401d4","resolution":{"observed_at":"2026-08-07T13:40:19.144832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:40:19.265190Z","title":"Vlmevalkit: An open-source toolkit for evaluating large multi-modality models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:19.265190Z"},"links":{"citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:1a6f90631bbac9e053895343596015a6a181086a4843e17950c98d98363113bd","observation_id":"51196814-becb-4580-811f-3854ec73b33e","resolution":{"observed_at":"2026-08-07T13:40:19.265190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-07T13:40:19.367021Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:19.367021Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:66fa3f895b143e0b5b2c209752a2601ce5cbcebc7afe24349376efce13289277","observation_id":"98834668-9201-4eae-8e30-e3bf8c7b63cb","resolution":{"observed_at":"2026-08-07T13:40:19.367021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:40:19.464859Z","title":"Blink: Multimodal large language models can see but not perceive","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:19.464859Z"},"links":{"citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:540206e027edddeee377b1a72a803035055fd3cd7eff2c22717b3f4242592329","observation_id":"305abdde-2cf4-4737-95c8-7fd3ec942c1c","resolution":{"observed_at":"2026-08-07T13:40:19.464859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13611","last_updated":"2024-10-17T14:46:34Z","snapshot_observed_at":"2026-08-16T13:08:23.452837Z","submitted_at":"2024-10-17T14:46:34Z","title":"H2OVL-Mississippi Vision Language Models Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13611","snapshot_observed_at":"2026-08-07T13:40:19.557859Z","title":"H2ovl-mississippi vision language models technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:19.557859Z"},"links":{"cited_paper":"/paper/2410.13611","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:8bb24821433f88710e70fab90c8095b21dd77ea3fa4cd8eaecdb52d56f50de03","observation_id":"e25bf317-5f2d-40ca-955e-33badcf75361","resolution":{"observed_at":"2026-08-07T13:40:19.557859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03586","last_updated":"2019-05-30T09:41:11Z","snapshot_observed_at":"2026-08-14T18:53:48.514883Z","submitted_at":"2018-07-10T12:10:16Z","title":"Difficulty Controllable Generation of Reading Comprehension Questions","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03586","snapshot_observed_at":"2026-08-07T13:40:19.684878Z","title":"Difficulty controllable generation of reading comprehension questions","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:19.684878Z"},"links":{"cited_paper":"/paper/1807.03586","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:5ee362fd8d705888ed70419014a6fdfc61ec6ebd32eee874b06a3af17b1f30a8","observation_id":"fa7790e8-d9bc-4313-af73-73e7ae890635","resolution":{"observed_at":"2026-08-07T13:40:19.684878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2401.20847","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:40:27.144773Z","title":"Cmmmu: A chinese massive multi-discipline multimodal understanding benchmark","venue":null,"work_id":"6efcd938-2edf-4d7b-a81e-5b29d388abf3","year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:19.794790Z"},"links":{"citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:a8d856f03e13b77cefb027b95c529dbbc950a4db908610d4c7e3d1de80c3d05e","observation_id":"c5d85e1e-a194-4f42-a0bb-7503eae4c33d","resolution":{"observed_at":"2026-08-07T13:40:27.277575Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:40:19.884750Z","title":"Example of the glicko-2 system","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:19.884750Z"},"links":{"citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:655966ff08dd60ea66627d3074054269efd06bcd08aba8952d231987117aaddf","observation_id":"66d1d3e2-7d90-4b33-b486-4af3e58fe14e","resolution":{"observed_at":"2026-08-07T13:40:19.884750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18558","last_updated":"2025-01-06T12:48:47Z","snapshot_observed_at":"2026-08-16T13:06:21.193431Z","submitted_at":"2024-10-24T09:03:48Z","title":"Infinity-MM: Scaling Multimodal Performance with Large-Scale and High-Quality Instruction Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18558","snapshot_observed_at":"2026-08-07T13:40:19.937612Z","title":"Infinity-mm: Scaling multimodal performance with large-scale and high-quality instruction data, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:19.937612Z"},"links":{"cited_paper":"/paper/2410.18558","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:417b2659d56bf5e765a1ecd23c550cd6306b28ddbf7c0b6b7d94a96a3d3817c3","observation_id":"a9a8c5b9-0124-4481-8765-c5224935fc06","resolution":{"observed_at":"2026-08-07T13:40:19.937612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T13:40:20.074750Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:20.074750Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:0ff6cdafcf1a3be5d5177e3e8e0399ad2ac02d5261a7048bbd7676314e230a2b","observation_id":"d18be7ea-ff13-41a2-981c-a9343786aeaa","resolution":{"observed_at":"2026-08-07T13:40:20.074750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-08-16T14:17:37.981310Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-07T13:40:20.145924Z","title":"Efficient multimodal learning from data-centric perspective, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:20.145924Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:f993e55783593bf1246d737d0709ee7956bbdf6b72959b9dc356d515e92fd249","observation_id":"68ae5757-6f11-422c-a62d-ccb59f4426d7","resolution":{"observed_at":"2026-08-07T13:40:20.145924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14011","last_updated":"2024-05-08T07:34:06Z","snapshot_observed_at":"2026-08-16T14:24:38.945790Z","submitted_at":"2024-01-25T08:22:10Z","title":"CMMU: A Benchmark for Chinese Multi-modal Multi-type Question Understanding and Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14011","snapshot_observed_at":"2026-08-07T13:40:20.204272Z","title":"Cmmu: A benchmark for chinese multi-modal multi-type question understanding and reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:20.204272Z"},"links":{"cited_paper":"/paper/2401.14011","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:f9f82d5b370b8526bef1e19bb1ccc87eb5e2fe557ae7fc65b48a977b2d20c98f","observation_id":"95a4f9f4-96cc-4e33-9af1-591cddb241f5","resolution":{"observed_at":"2026-08-07T13:40:20.204272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T13:40:20.344855Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:20.344855Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:199aed78fdc6baa45690b15e55096ad9cd8cc3b018cd4ee75e4bc32f401e45e6","observation_id":"bdb5378d-d934-481d-b76c-bc1ad7a36ae3","resolution":{"observed_at":"2026-08-07T13:40:20.344855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01483","last_updated":"2024-11-15T06:31:44Z","snapshot_observed_at":"2026-08-16T13:55:52.665411Z","submitted_at":"2024-05-02T17:14:57Z","title":"MANTIS: Interleaved Multi-Image Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01483","snapshot_observed_at":"2026-08-07T13:40:20.474830Z","title":"Mantis: Interleaved multi-image instruction tuning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:20.474830Z"},"links":{"cited_paper":"/paper/2405.01483","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:5956688fa1f5ed3443b6959487bdfd9040ff8cddce90d34c2900da14eb6737ab","observation_id":"d85cb312-c88b-420a-ac44-aa7a40c2c00f","resolution":{"observed_at":"2026-08-07T13:40:20.474830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:40:20.560521Z","title":"Ku, Qian Liu, and Wenhu Chen","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:20.560521Z"},"links":{"citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:a89e0eb70e0d72a5f9df3d4140d222067728b18b00f7efdf04103f0d665d1380","observation_id":"503d17eb-a3c7-42d3-861e-26b2633339aa","resolution":{"observed_at":"2026-08-07T13:40:20.560521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:40:20.701466Z","title":"Automatic educational question generation with difficulty level controls","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:20.701466Z"},"links":{"citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:8dcce05c493cfcbc0d9e6132f9acd65cbc17793cc89680af1a167e766c8b1a06","observation_id":"c8f61ed3-621c-4886-b07e-099b92ef3a73","resolution":{"observed_at":"2026-08-07T13:40:20.701466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:40:20.808317Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:20.808317Z"},"links":{"citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:523b8c289adc6eb79c9807256762a214edb0a9d1b3f45992317c1ea239da175e","observation_id":"b155af45-9c20-464f-b9ec-a9994238aa44","resolution":{"observed_at":"2026-08-07T13:40:20.808317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-14T18:51:16.666127Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T13:40:20.943836Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:20.943836Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:08735db0996c4872f8fbb07b8c6252ef61ff990d595a18c0c0e5c781c0a8c8c7","observation_id":"26a03eb3-3c59-43d6-b8ef-1a0cfccaeb51","resolution":{"observed_at":"2026-08-07T13:40:20.943836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-08-14T23:50:45.029465Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-07T13:40:21.060758Z","title":"Auto-encoding variational bayes, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:21.060758Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:2440b2a8466163a182b0df81cad41903a1f86f7e2b625601ff01d3cabd0a9f66","observation_id":"90f0ecd7-0d61-4caa-b63c-9f5112eca615","resolution":{"observed_at":"2026-08-07T13:40:21.060758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:40:21.190757Z","title":"Moondream2: A vision-language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:21.190757Z"},"links":{"citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:1a477f8d2d8f2e6b64b1813b776ee3ee7796251419726a6d5dcfb48f8dfdac05","observation_id":"29d13fbe-517a-4dc7-968d-fb2e65c111ca","resolution":{"observed_at":"2026-08-07T13:40:21.190757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:40:21.254890Z","title":"What matters when building vision- language models? Advances in Neural Information Processing Systems, 37:87874–87907, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:21.254890Z"},"links":{"citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:34647d6c2d196aef99f824ceadec1f80a38ec887700e800d710ccefb5d54c9b3","observation_id":"62a52ced-8ff9-455f-9d0c-2d6e37ac6711","resolution":{"observed_at":"2026-08-07T13:40:21.254890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11890","last_updated":"2023-12-19T06:26:25Z","snapshot_observed_at":"2026-08-16T14:33:30.710395Z","submitted_at":"2023-12-19T06:26:25Z","title":"Difficulty-Focused Contrastive Learning for Knowledge Tracing with a Large Language Model-Based Difficulty Prediction","version":1},"cited_work":{"arxiv_id":"2312.11890","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.11890","snapshot_observed_at":"2026-08-07T13:40:26.711313Z","title":"Difficulty-Focused Contrastive Learning for Knowledge Tracing with a Large Language Model-Based Difficulty Prediction","venue":"cs.CL","work_id":"aa452b29-1bba-42f1-9f8a-06eb38e1572e","year":2023},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:21.327752Z"},"links":{"cited_paper":"/paper/2312.11890","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:8c6444b85e141f41c44086c115b55c249a9039dccf09f67618d92a6c8b94eceb","observation_id":"6c0c972b-48de-4849-a504-0cbdf2699521","resolution":{"observed_at":"2026-08-07T13:40:26.790665Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T13:40:21.421761Z","title":"Llava-onevision: Easy visual task transfer, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:21.421761Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:205a7671573f8335e0d6f94ae04b7d322ed628a68ec896933f964a7bfe1b09df","observation_id":"ea43b17b-bf85-4e6e-819d-8a48bff9a40f","resolution":{"observed_at":"2026-08-07T13:40:21.421761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-07T13:40:21.495770Z","title":"Seed-bench: Benchmarking multimodal llms with generative comprehension","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:21.495770Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:21923a60010002f89eeea0020937aa4512908f85230eb474661e0a753cd0b014","observation_id":"13917c5a-bb02-4254-bbd5-83c110a4c83f","resolution":{"observed_at":"2026-08-07T13:40:21.495770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:40:21.591907Z","title":"Seed-bench: Benchmarking multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:21.591907Z"},"links":{"citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:58da0680bd453b32234672b5f50cfdfb7cd87cbce651301e9d561ec1c1821eac","observation_id":"c50813fc-6d66-46ed-98d9-610c938ae99b","resolution":{"observed_at":"2026-08-07T13:40:21.591907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:40:21.684259Z","title":"Reform-eval: Evaluating large vision language models via unified re-formulation of task-oriented benchmarks","venue":null,"work_id":null,"year":1971},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:21.684259Z"},"links":{"citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:25a608d901230a05a5d902fd474958bf7f178c7c504a82477ec623487f8f0b01","observation_id":"0df7fb95-3801-4a8d-83c5-60b5fff0a581","resolution":{"observed_at":"2026-08-07T13:40:21.684259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:40:21.767930Z","title":"Continuous or discrete, that is the question: A survey on large multi-modal models from the perspective of input-output space extension","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:21.767930Z"},"links":{"citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:a62cb4d83e61b60249fc57d609f1505735b335663268c3cec6282ca99f77f9b6","observation_id":"aa363727-9181-443f-a5be-3fd6cbe7a698","resolution":{"observed_at":"2026-08-07T13:40:21.767930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.06607","last_updated":"2024-08-26T06:57:51Z","snapshot_observed_at":"2026-08-16T14:44:08.593739Z","submitted_at":"2023-11-11T16:37:41Z","title":"Monkey: Image Resolution and Text Label Are Important Things for Large Multi-modal Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.06607","snapshot_observed_at":"2026-08-07T13:40:21.845958Z","title":"Monkey: Image resolution and text label are important things for large multi-modal models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:21.845958Z"},"links":{"cited_paper":"/paper/2311.06607","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:0a861483b5b4f8cf14b8011a80983e2f331d3fcbf81e96ecc8063bfe767ebac2","observation_id":"810e2824-ad71-43d2-b5fb-4cbea895bf9b","resolution":{"observed_at":"2026-08-07T13:40:21.845958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:40:21.916276Z","title":"A survey of state of the art large vision language models: Alignment, benchmark, evaluations and challenges","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:21.916276Z"},"links":{"citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:68cee0250bd721c1cb191aea2e40f0464d9d1439c8052fdf27ec2f7f6b56c165","observation_id":"47c8a659-4aa0-42aa-ba8f-6b73c7f96a09","resolution":{"observed_at":"2026-08-07T13:40:21.916276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-15T17:27:11.980940Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T13:40:21.984280Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:21.984280Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:5fd60562ea697ed0c605c57401088003fa12aa6faaebb5296ff12ae99bbc340b","observation_id":"2060fb34-e3cf-4ee8-b7c6-167d41a4c4c5","resolution":{"observed_at":"2026-08-07T13:40:21.984280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:40:22.055666Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:22.055666Z"},"links":{"citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:473814f9e7c4a425c835b9109f00593e5b537337b7467a712b5328403d810b01","observation_id":"5e75d31a-f5b7-4617-aa5f-3ec23d9331f3","resolution":{"observed_at":"2026-08-07T13:40:22.055666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-08-15T02:35:59.111911Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-07T13:40:22.131773Z","title":"Improved baselines with visual instruction tuning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:22.131773Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:1d27b8c32c80fa74e3cc8d46ca9242bbb2a8a0a88d3140078f639ff346865c8e","observation_id":"b734376c-1a68-4c36-be08-0f4910be9971","resolution":{"observed_at":"2026-08-07T13:40:22.131773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:40:22.202086Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, January 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:22.202086Z"},"links":{"citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:06e15329b76a9e29bf8832be0542d4259c9c1e2f1727df5345ee067e910d3ad2","observation_id":"2037cf67-c670-4b76-95c5-4406e91a5acf","resolution":{"observed_at":"2026-08-07T13:40:22.202086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:40:22.271868Z","title":"Mmbench: Is your multi-modal model an all-around player? In European conference on computer vision, pages 216–233","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:22.271868Z"},"links":{"citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:bee83986cc867ad2277c9278b23f8a4bde6640781631cd69d24ef1d6c14bb378","observation_id":"baf79efd-d0cc-404b-9aad-a36ac0a2091a","resolution":{"observed_at":"2026-08-07T13:40:22.271868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04828","last_updated":"2024-11-05T02:32:06Z","snapshot_observed_at":"2026-08-16T13:20:32.598815Z","submitted_at":"2024-09-07T13:41:37Z","title":"POINTS: Improving Your Vision-language Model with Affordable Strategies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04828","snapshot_observed_at":"2026-08-07T13:40:22.349276Z","title":"Points: Improving your vision-language model with affordable strategies, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:22.349276Z"},"links":{"cited_paper":"/paper/2409.04828","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:e57be61ce62f2444fdb411dc5d037c1ec52c7f7b0dc31b877f3b3ef041892a23","observation_id":"0c7b6a80-6563-476d-bf84-ec4f198ca983","resolution":{"observed_at":"2026-08-07T13:40:22.349276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:40:22.430479Z","title":"Ocrbench: on the hidden mystery of ocr in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:22.430479Z"},"links":{"citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:2806f9f67875e3de2e379b2c27ab246af2a8f0ad38ab083421936926fc3d4e87","observation_id":"03b9e430-240a-41a5-b3ea-b30911b9beff","resolution":{"observed_at":"2026-08-07T13:40:22.430479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:40:32.255279Z","title":"Applications of item response theory to practical testing problems","venue":null,"work_id":"0da47c34-026d-41bd-892d-e4e3318a149c","year":2012},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:22.523026Z"},"links":{"citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:fccdb23cbbc7b0a7f3e553b4a6eac7ebcbf2b03bbb589e5f937570a11aa58400","observation_id":"caf27b58-1937-4909-9ec2-6de1a6df3046","resolution":{"observed_at":"2026-08-07T13:40:32.347477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:40:31.976221Z","title":"Mmalaya2","venue":null,"work_id":"7706f85a-bf7a-475e-89a9-fa294f19acb6","year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:22.596247Z"},"links":{"citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:e123d8451ebe021d5065fb66931b7afad4d7972a13c8c46da72e730e4d6f878c","observation_id":"7ef08d00-959d-4ee2-95ec-540db9247e00","resolution":{"observed_at":"2026-08-07T13:40:32.112816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:40:31.678489Z","title":"Deepseek- vl: Towards real-world vision-language understanding, 2024","venue":null,"work_id":"9379a479-9e61-44da-9a80-2601073304be","year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:22.651579Z"},"links":{"citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:f9ce53e6bbdc54a615f82837ec65051755240e26b87df476ab6b3ebc183c7570","observation_id":"297b0366-7d48-44e1-8630-d5f8542fc998","resolution":{"observed_at":"2026-08-07T13:40:31.816745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:40:31.419684Z","title":"Deepseek- vl: Towards real-world vision-language understanding, 2024","venue":null,"work_id":"4640ffbc-5765-445d-9f36-afae5695b839","year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:22.733757Z"},"links":{"citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:735e75033d187b0f9abc7756ba8342c60c9aefafe3c46564654b349eb93014e9","observation_id":"ea0cfe11-27b0-466a-b325-f0517896acb3","resolution":{"observed_at":"2026-08-07T13:40:31.524040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:40:22.790997Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:22.790997Z"},"links":{"citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:444cea519f6043f51d64f17eada0d7e8545b48591cfbd1d0299ce909e9c07718","observation_id":"609752e8-c675-46bc-b10a-040ce47a9637","resolution":{"observed_at":"2026-08-07T13:40:22.790997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-07T13:40:22.864807Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:22.864807Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:4ae11bd5f3e34875e756433e8b7d73be5da6ad9573e285f8b040db9e0a2b51e9","observation_id":"e6e772b1-2662-4301-b53f-c44867191a32","resolution":{"observed_at":"2026-08-07T13:40:22.864807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-07T13:40:22.917151Z","title":"Ovis: Structural embedding alignment for multimodal large language model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:22.917151Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:6037d5480c08ae0bc4aa47555f0e7dbe0ad9b5079254e2eda157e1280ef9eb5e","observation_id":"66051f3d-87e3-4bc9-be8c-dd4563c51b30","resolution":{"observed_at":"2026-08-07T13:40:22.917151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10640","last_updated":"2024-11-16T00:14:51Z","snapshot_observed_at":"2026-08-16T03:42:56.050856Z","submitted_at":"2024-11-16T00:14:51Z","title":"BlueLM-V-3B: Algorithm and System Co-Design for Multimodal Large Language Models on Mobile Devices","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10640","snapshot_observed_at":"2026-08-07T13:40:22.995802Z","title":"Bluelm-v-3b: Algorithm and system co-design for multimodal large language models on mobile devices, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:22.995802Z"},"links":{"cited_paper":"/paper/2411.10640","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:36ef56d3cf1b63b5d7bf434d078ab1893e7d995259579dbbf352cc24adac0d93","observation_id":"94969d3f-a8bd-4ac6-a698-06814836e0d4","resolution":{"observed_at":"2026-08-07T13:40:22.995802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:40:31.078831Z","title":"Taiyi: a bilingual fine-tuned large language model for diverse biomedical tasks","venue":null,"work_id":"88249b04-459b-4985-a4df-871c79ad07a2","year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:23.050318Z"},"links":{"citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:0b37dc42bf6913985f82e6877890e099150342f1e2e86822a5fe679044a9b302","observation_id":"520597f7-df58-4bc6-a649-8e2f9dcf1183","resolution":{"observed_at":"2026-08-07T13:40:31.245487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:40:30.785944Z","title":"Gpt-4v-system-card","venue":null,"work_id":"4c17f8d8-a9af-4e1e-9cef-18d38bec01b0","year":2023},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:23.124750Z"},"links":{"citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:28931d924c9aa98e437baa642805b0dc8a32de416c09b75b4d93f1854344ca75","observation_id":"d0ade989-03d2-4893-9686-1a9ad66289db","resolution":{"observed_at":"2026-08-07T13:40:30.926145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:40:30.548646Z","title":"Large language models are students at various levels: Zero-shot question difficulty estimation","venue":null,"work_id":"32aed956-8f52-4667-a75e-a71b69856c6d","year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:23.190615Z"},"links":{"citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:c780b2a2d5f492d0fa124870238df241a7e9f9559f40f6e5210707dc8f586cc8","observation_id":"da47228a-1241-4eea-81b9-7a3371231ebe","resolution":{"observed_at":"2026-08-07T13:40:30.663955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:40:23.257385Z","title":"Automatic differentiation in pytorch","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:23.257385Z"},"links":{"citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:47cf16c417f980e6415387ea87f7df73abada4f3c5b68211def0bfd9c814864c","observation_id":"244d940c-0c30-4aca-99a0-f4a451543ee4","resolution":{"observed_at":"2026-08-07T13:40:23.257385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:40:30.268593Z","title":"Transcore-m: Multimodal foundation model for transportation research","venue":null,"work_id":"e2f53101-0547-4a66-ac49-81e78f9daa40","year":2023},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:23.338474Z"},"links":{"citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:5bcda179c89bb26f82e687f7c36ce76f8f76c5f608b88ab2c9123b4f4379f5c6","observation_id":"0892b2d4-f7cb-48cc-b7e2-ac4e0151c6cb","resolution":{"observed_at":"2026-08-07T13:40:30.397632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-08-12T12:24:23.815073Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-07T13:40:23.405782Z","title":"Kosmos-2: Grounding multimodal large language models to the world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:23.405782Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:0b4614a284a38edb169bdb517af51431903c79747d05aa1c1a4f70c413bc8305","observation_id":"b256a703-e9a1-4633-883a-ef3724999d41","resolution":{"observed_at":"2026-08-07T13:40:23.405782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11696","last_updated":"2024-04-01T17:34:34Z","snapshot_observed_at":"2026-08-16T15:06:35.255242Z","submitted_at":"2023-08-22T17:59:30Z","title":"Efficient Benchmarking of Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.11696","snapshot_observed_at":"2026-08-07T13:40:23.474799Z","title":"Efficient benchmarking of language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:23.474799Z"},"links":{"cited_paper":"/paper/2308.11696","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:3b00bcf970b919f21c215af88c4d40807bb440baf6a96102f3bde0656938311b","observation_id":"b4d52ffe-f59f-4b81-baae-5b941819db4e","resolution":{"observed_at":"2026-08-07T13:40:23.474799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14992","last_updated":"2024-05-26T22:27:23Z","snapshot_observed_at":"2026-08-16T14:16:04.584604Z","submitted_at":"2024-02-22T22:05:23Z","title":"tinyBenchmarks: evaluating LLMs with fewer examples","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14992","snapshot_observed_at":"2026-08-07T13:40:23.551580Z","title":"tinybenchmarks: evaluating llms with fewer examples","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:23.551580Z"},"links":{"cited_paper":"/paper/2402.14992","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:055729faaee81f0959388bc20baa8b38c6779be2d9fe7c722ec0b3fc9445270a","observation_id":"91455da6-36ac-4a4e-a460-a335005e4c24","resolution":{"observed_at":"2026-08-07T13:40:23.551580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:40:29.960374Z","title":"qihoo360/360vl-70b: An open-source large vision-language model based on llama3-70b","venue":null,"work_id":"c760a86e-e032-4437-bc0f-1d6cd6bd90be","year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:23.613829Z"},"links":{"citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:8c3974acaea9745f46c8d0777e5d906524b981dee139157bf9d04a95b1a83645","observation_id":"59f84bff-13ca-43a7-8ba9-0b07af0b27ad","resolution":{"observed_at":"2026-08-07T13:40:30.073666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:40:23.645848Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:23.645848Z"},"links":{"citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:e66deb6165ac989471a3d3a71f76cb03bce6ce97ff3b0dece81fb8efc4739903","observation_id":"295d6d78-4cb0-4b82-9c92-e5588ff9ede2","resolution":{"observed_at":"2026-08-07T13:40:23.645848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:40:29.701781Z","title":"Probabilistic models for some intelligence and attainment tests","venue":null,"work_id":"ae6ad232-d59c-4638-b178-8728312a3099","year":1993},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:23.795607Z"},"links":{"citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:543417d3eb1bb542a94b5a6d7a9ba3205fab0035290916a4c99dde98699d0825","observation_id":"483bd89e-23a3-4733-a06c-d82a11abeb39","resolution":{"observed_at":"2026-08-07T13:40:29.811540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15998","last_updated":"2025-03-02T23:41:37Z","snapshot_observed_at":"2026-08-16T13:23:07.170488Z","submitted_at":"2024-08-28T17:59:31Z","title":"Eagle: Exploring The Design Space for Multimodal LLMs with Mixture of Encoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15998","snapshot_observed_at":"2026-08-07T13:40:23.941064Z","title":"Eagle: Exploring the design space for multimodal llms with mixture of encoders","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:23.941064Z"},"links":{"cited_paper":"/paper/2408.15998","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:cc7f63f24dfa12b753c379d1a5cd2de2a29b466e0e3c55dac92d7863e58b5ae6","observation_id":"d47bf71d-1318-4c93-a5c0-783ff35a655a","resolution":{"observed_at":"2026-08-07T13:40:23.941064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:40:29.461939Z","title":null,"venue":null,"work_id":"35380084-83dc-4dcf-af3d-5631bb3915e6","year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:24.054741Z"},"links":{"citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:db7fdc94910b3a89858224b7db225b73219ac886eb550762c0811e54ff621cf7","observation_id":"1ef07471-8c90-4b3e-a5f4-abe0866ca726","resolution":{"observed_at":"2026-08-07T13:40:29.567216Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T13:40:24.145551Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:24.145551Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:9ea3e17128f42016d333c14b8fc7c1538505a0d33c210d2bfa17d29e6f3d109e","observation_id":"35fe3493-ed07-4dd7-b2ab-7eef11a78a2d","resolution":{"observed_at":"2026-08-07T13:40:24.145551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:40:29.190016Z","title":"tiiuae/falcon-11b-vlm: A vision-language model based on falcon- 11b","venue":null,"work_id":"14416735-660f-40d3-9887-e997e781cebf","year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:24.222825Z"},"links":{"citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:4c434dcfc2118b4113fba7bcfc9277580b98237463ec31449adfd58b0f220825","observation_id":"15471aa2-dd38-4627-b45e-f1a6f99d2d4b","resolution":{"observed_at":"2026-08-07T13:40:29.325515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19974","last_updated":"2024-10-25T21:29:04Z","snapshot_observed_at":"2026-08-16T13:05:51.114479Z","submitted_at":"2024-10-25T21:29:04Z","title":"Evaluating Cost-Accuracy Trade-offs in Multimodal Search Relevance Judgements","version":1},"cited_work":{"arxiv_id":"2410.19974","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.19974","snapshot_observed_at":"2026-08-07T13:40:26.227173Z","title":"Evaluating Cost-Accuracy Trade-offs in Multimodal Search Relevance Judgements","venue":"cs.LG","work_id":"ee43e02e-188d-4532-a6e4-993c9e5b9948","year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:24.292226Z"},"links":{"cited_paper":"/paper/2410.19974","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:64aae8b72c7bde8d47bd2bf6d0117e88c56de0738439fca77ca730145d1ac164","observation_id":"b7e95455-61d5-4a24-a70e-853cd13385c7","resolution":{"observed_at":"2026-08-07T13:40:26.299574Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T13:40:24.376969Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:24.376969Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:7ef918f367b3bb977a4bf2575549c6915511be8855c151c2b3e1c9c90751ad93","observation_id":"8d7e483c-391c-4725-994d-a8d24ac5dadc","resolution":{"observed_at":"2026-08-07T13:40:24.376969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.00840","last_updated":"2021-06-01T22:33:53Z","snapshot_observed_at":"2026-08-16T18:20:25.028859Z","submitted_at":"2021-06-01T22:33:53Z","title":"Comparing Test Sets with Item Response Theory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.00840","snapshot_observed_at":"2026-08-07T13:40:24.455373Z","title":"Comparing test sets with item response theory","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:24.455373Z"},"links":{"cited_paper":"/paper/2106.00840","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:9e64c3b4cc2832485bd03060dd562cae8ff3d9ff255bf3ae2f2d2b41b16b2f10","observation_id":"343cb7bb-915e-49a8-9ab6-0fe700ab8fd4","resolution":{"observed_at":"2026-08-07T13:40:24.455373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:40:28.921623Z","title":"Moondream1","venue":null,"work_id":"5816dd3f-3e90-45ae-99f2-9919dcf35125","year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:24.533043Z"},"links":{"citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:10f881e11975af9ca0ac4cdefa97df85f90c3a9e230b5311b646029848a401f1","observation_id":"486e7a53-c6a3-466e-a9d4-4b5e2ffcbfdd","resolution":{"observed_at":"2026-08-07T13:40:29.085273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.08638","last_updated":"2024-02-18T21:37:47Z","snapshot_observed_at":"2026-08-16T15:00:38.056848Z","submitted_at":"2023-09-14T17:45:51Z","title":"Anchor Points: Benchmarking Models with Much Fewer Examples","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.08638","snapshot_observed_at":"2026-08-07T13:40:24.611594Z","title":"Anchor points: Benchmarking models with much fewer examples","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:24.611594Z"},"links":{"cited_paper":"/paper/2309.08638","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:c4843faa62e789ae2b4d9bfe9117b24065ce53892579a0d5cf56dd49735360cd","observation_id":"5b4da071-ba41-44d2-ada8-c4d333ccc169","resolution":{"observed_at":"2026-08-07T13:40:24.611594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T13:40:24.725004Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:24.725004Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:122483fb7c3b0b57837160641dde51b08d550ee36a100a7a5e4a840725f665fe","observation_id":"b942e48d-4611-4c30-b882-f65be3a79527","resolution":{"observed_at":"2026-08-07T13:40:24.725004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11443","last_updated":"2024-02-18T03:40:06Z","snapshot_observed_at":"2026-08-16T14:17:40.785468Z","submitted_at":"2024-02-18T03:40:06Z","title":"Benchmark Self-Evolving: A Multi-Agent Framework for Dynamic LLM Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11443","snapshot_observed_at":"2026-08-07T13:40:24.777981Z","title":"Benchmark self-evolving: A multi-agent framework for dynamic llm evaluation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:24.777981Z"},"links":{"cited_paper":"/paper/2402.11443","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:68d56b0c717bf85a4874278e86428820f9918ed82c766e3abfd82d930ace8b56","observation_id":"2590573f-3035-4269-b202-ff079e461bb5","resolution":{"observed_at":"2026-08-07T13:40:24.777981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:40:24.833222Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:24.833222Z"},"links":{"citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:e7f0d1f7c5b12ce7dedf2ac0c7edcbcf57a5290e84b92bf769a5b30caab6a8d0","observation_id":"1ba1d4ed-d1df-43e7-a8bf-19aa739846be","resolution":{"observed_at":"2026-08-07T13:40:24.833222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13848","snapshot_observed_at":"2026-08-07T13:40:24.887964Z","title":"Janus: Decoupling visual encoding for unified multimodal understanding and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:24.887964Z"},"links":{"cited_paper":"/paper/2410.13848","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:6c3f8fd0561eeb19a2cdd39038a69d7e708ecf5a025fadbddb6690e9f752dd94","observation_id":"ac17db1a-9f78-4d02-9572-ad99f23879b9","resolution":{"observed_at":"2026-08-07T13:40:24.887964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:40:28.673307Z","title":"Adaption-of-thought: Learning question difficulty improves large language models for reasoning","venue":null,"work_id":"e94cda3f-0403-47e6-ac77-f779dbe2e586","year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:24.949625Z"},"links":{"citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:950ded8608011ab313d0b20fa37c972e4d323ec8cd795bbb6dbbf3ed934bf145","observation_id":"5fe6123b-dd9f-4f2b-ab07-a73f2d78e955","resolution":{"observed_at":"2026-08-07T13:40:28.769525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:40:25.034630Z","title":"Lvlm-ehub: A comprehensive evaluation benchmark for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:25.034630Z"},"links":{"citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:43b1d2c6a9dc34b8a4cd6dc6020e84d2e38ca4d9ae70dbd3e475cadd0d5a3938","observation_id":"292c4461-a251-49bc-afa8-8774d69dfb8f","resolution":{"observed_at":"2026-08-07T13:40:25.034630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:40:28.447968Z","title":"Collageprompt: A benchmark for budget- friendly visual recognition with gpt-4v","venue":null,"work_id":"56bc1b86-027c-4425-b13d-0f6d1f741140","year":2025},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:25.120067Z"},"links":{"citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:430f3d923f5389df10d165677d8ff33d874f795285fc9f316b081a9d441c3850","observation_id":"b2c8dcad-48dd-43e4-b100-9a4a16e77231","resolution":{"observed_at":"2026-08-07T13:40:28.522427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T13:40:25.219084Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:25.219084Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:153a6dc1b090d1c72faab63e4c9d5c95938cf09126689709c30398d2ecfa7ae7","observation_id":"8890e8ef-0ae4-4903-85c3-f15493e5c72c","resolution":{"observed_at":"2026-08-07T13:40:25.219084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T13:40:25.336819Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:25.336819Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:a0645c9b743b90326cf16ed67fb188e30b9917bbeededcb1d61a5f9bbcb2a1f8","observation_id":"c5336192-b0dd-44e1-8dea-3ac387e47985","resolution":{"observed_at":"2026-08-07T13:40:25.336819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16006","last_updated":"2024-04-24T17:37:05Z","snapshot_observed_at":"2026-08-16T13:58:08.863436Z","submitted_at":"2024-04-24T17:37:05Z","title":"MMT-Bench: A Comprehensive Multimodal Benchmark for Evaluating Large Vision-Language Models Towards Multitask AGI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16006","snapshot_observed_at":"2026-08-07T13:40:25.406739Z","title":"Mmt-bench: A comprehensive multimodal benchmark for evaluating large vision-language models towards multitask agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:25.406739Z"},"links":{"cited_paper":"/paper/2404.16006","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:d55cfd0e49e1ed0c2c6bfab8c04dfb6eec96ba33d0a4f39eb927a8177bd559fa","observation_id":"dd1247fd-ca59-4c6e-8d84-ab8666766be7","resolution":{"observed_at":"2026-08-07T13:40:25.406739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:40:25.494783Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:25.494783Z"},"links":{"citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:eda122402a2621982ef8f42bcf6754a20b5d2188eee9e6ce82ad68e4defc9eda","observation_id":"6fa99504-6013-429a-97a8-9a2d03f49ce8","resolution":{"observed_at":"2026-08-07T13:40:25.494783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08487","last_updated":"2024-06-14T00:52:35Z","snapshot_observed_at":"2026-08-16T13:43:37.776811Z","submitted_at":"2024-06-12T17:59:49Z","title":"Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08487","snapshot_observed_at":"2026-08-07T13:40:25.686235Z","title":"Beyond llava-hd: Diving into high-resolution large multimodal models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:25.686235Z"},"links":{"cited_paper":"/paper/2406.08487","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:79a12ed9550c2cd5255bb6f4f845ae27b704da4b856721348dd53ace85fd2f91","observation_id":"80f2e1f6-1317-4010-b328-cee0148f0e27","resolution":{"observed_at":"2026-08-07T13:40:25.686235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:40:28.164266Z","title":"Efficiently measuring the cognitive ability of llms: An adaptive testing perspective","venue":null,"work_id":"f30d91b2-3901-43bd-8f07-21f5384482d3","year":2023},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:25.765528Z"},"links":{"citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:d4a4a445170d1e9494f4284a1275abe13b13a9464bda157d572b3fa18a4d7f76","observation_id":"f7b04f8e-7b3d-4e43-96a6-b8aaf36a9168","resolution":{"observed_at":"2026-08-07T13:40:28.252949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.10512","last_updated":"2025-05-08T03:45:24Z","snapshot_observed_at":"2026-08-16T15:23:03.808495Z","submitted_at":"2023-06-18T09:54:33Z","title":"Position: AI Evaluation Should Learn from How We Test Humans","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.10512","snapshot_observed_at":"2026-08-07T13:40:25.866299Z","title":"From static benchmarks to adaptive testing: Psychometrics in ai evaluation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:25.866299Z"},"links":{"cited_paper":"/paper/2306.10512","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:fc7acff9e2ee88f47bb7732aa701fa67fd24ca6e8d0579952ea378ed051ff3c7","observation_id":"05ed1da9-f499-4840-9920-0ff28eff1f3c","resolution":{"observed_at":"2026-08-07T13:40:25.866299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs"},"reference_resolution":{"displayed":98,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":79,"verified_exact":4,"verified_fuzzy":15},"total_outbound_references":98},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 98 of 98 outbound references and 0 inbound Pith citation observations for arXiv:2505.21389."}