Pith. sign in

Paper Citation Record · LEDGER

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs

As of 16 August 2026, this Paper Citation Record lists 98 of 98 outbound references and 0 inbound Pith citation observations for arXiv:2505.21389.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.21389 v1

Coverage vector

measured 98 of 98 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T13:40:25.866299Z

measured 98 of 98 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-16T06:30:59.297886+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

98 of 98 outbound references displayed

  • verified exact4
  • verified fuzzy15
  • unresolved79
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 859e0860-1a10-44ea-97f4-4cd191c0163c · outbound

This paper cites Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:16.876872Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:16.876872Z digest=sha256:b14d5256bf462c2cbb732ac4f451bcd62b499c6b46068903d332863169a5dfa2

Observation 0729bc2a-b115-45d9-acc8-ac2492a13ee9 · outbound

This paper cites GPT-4 Technical Report.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs GPT-4 Technical Report

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:16.965863Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:16.965863Z digest=sha256:f7de171f9d74558007669b056b3178bb02a34bf13872e93b038e2377d20ec92b

Observation 079b0580-3e41-495c-9245-cd3bdebbd3e7 · outbound

This paper cites Pixtral 12B.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Pixtral 12B

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:17.009599Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:17.009599Z digest=sha256:2983d4026dc81fead959beb817b2110cdbf5ed72c5c85598af74f82a84fe7fd7

Observation e11e2f29-ff11-441f-916e-ae9f96db639d · outbound

This paper cites Item response theory: What it is and how you can use the irt procedure to apply it.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Item response theory: What it is and how you can use the irt procedure to apply it

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:17.058484Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:17.058484Z digest=sha256:8610f9d64809b9ec1350ab1927f76f7da8e092d10d7393e16ec55d43f43e8d06

Observation 2f164e09-d6e1-49a0-936e-b035439e018c · outbound

This paper cites Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:17.127745Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:17.127745Z digest=sha256:9c3558bc94ae0a256c113b02c0ce73c14293ae7229f4a51d0c2b356c92d358fd

Observation 7927f561-cbe5-4108-927e-2b125ae26319 · outbound

This paper cites Qwen2.5-VL Technical Report.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Qwen2.5-VL Technical Report

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:17.235028Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:17.235028Z digest=sha256:5179b85dc1b1687787a60caddda1eb658b2fe62783287772c4e566edc68d9c6d

Observation dbdff70e-2be6-4d25-9704-bddeebb5f246 · outbound

This paper cites PaliGemma: A versatile 3B VLM for transfer.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs PaliGemma: A versatile 3B VLM for transfer

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:17.304870Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:17.304870Z digest=sha256:3bcbd3b7a4089589a2bd1f3201d8c9def97aa8077cb4e9aa0b4f75b7facb2736

Observation 2e3d10c7-ce79-499f-8a62-2560758f21e8 · outbound

This paper cites A Conceptual Introduction to Hamiltonian Monte Carlo.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs A Conceptual Introduction to Hamiltonian Monte Carlo

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:17.377010Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:17.377010Z digest=sha256:f6908f77a50e99e90d8c6fcd1a9f2be4480e145bb69b9740ffd5f0d767b5e51e

Observation 7256ea90-91fe-4931-adab-9785d9e88e4d · outbound

This paper cites Item response theory.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Item response theory

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:17.476747Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:17.476747Z digest=sha256:d8bdffc8cb4911c6c4a7d5afd499a24823c34c20533f681a10b8d8c2ef0a6635

Observation 01a3f6e8-ed5f-428f-ae38-e30f8c9e180a · outbound

This paper cites Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:17.593586Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:17.593586Z digest=sha256:0750c507fa86d803b93840a4a002a3169c64496dfc929b9a6bfbaf56090eca2c

Observation 0c8d5d8f-a9db-45a7-b901-2184cca4158c · outbound

This paper cites Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:17.736081Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:17.736081Z digest=sha256:4632bc5d2f3ce55007c88cc663b83dcda93f5076845ee01ccd2ce4edc4b72ead

Observation 60714eb7-06d6-49be-8b88-0d9642f4ba7d · outbound

This paper cites How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:17.925783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:17.925783Z digest=sha256:6283aac06dc5f1590351cfbf8a2617615df1ab52e412c95ee88b850f53862c22

Observation 3ce60de2-ff36-4248-b395-deaec309f805 · outbound

This paper cites Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:18.004748Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:18.004748Z digest=sha256:bafb7df2d537346f4cb0b60bf6f248a9844e84c719154c528c5597277722730e

Observation 53d5e796-3d5d-45fe-92d6-accde172e660 · outbound

This paper cites Guiding the Growth: Difficulty-Controllable Question Generation through Step-by-Step Rewriting.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Guiding the Growth: Difficulty-Controllable Question Generation through Step-by-Step Rewriting

Reference 14

Resolution
verified exact
local_arxiv, observed 2026-08-07T13:40:27.784818Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T13:40:18.134077Z digest=sha256:8b10aa69da331f4ad1a6c022bf16e176020de8644c988cea0cfd1fe46be10225

Observation d7fa42ba-1ca5-4c80-aaa8-c3ec8efc44e9 · outbound

This paper cites https://github.com/jiutiancv/JT-VL-Chat , 2024.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs https://github.com/jiutiancv/JT-VL-Chat , 2024

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:18.299995Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:18.299995Z digest=sha256:b028d9c98ffcb330c4d1264acc1f37e10086bd3df16390d62731dfec3ef18e32

Observation 4a7b1f43-7a6b-431e-9147-1e3b5b05c94c · outbound

This paper cites NVLM: Open Frontier-Class Multimodal LLMs.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs NVLM: Open Frontier-Class Multimodal LLMs

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:18.424220Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:18.424220Z digest=sha256:3ae3856fec4ac8035bcb96203af6aa4e2f44eb6b12da460176a7bc5332e7cd9a

Observation aa5e6d45-5701-4755-b6de-8fc3dbb449fd · outbound

This paper cites Smith, Hannaneh Hajishirzi, Ross Girshick, Ali Farhadi, and Aniruddha Kembhavi.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Smith, Hannaneh Hajishirzi, Ross Girshick, Ali Farhadi, and Aniruddha Kembhavi

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:18.565070Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:18.565070Z digest=sha256:8b9696d85021b89fe4ce23a71438d3d62c5b3d9247077138b9d9dfdd486b91cd

Observation 41571838-bf52-4676-847b-b06030067006 · outbound

This paper cites Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:18.745834Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:18.745834Z digest=sha256:ef15bda32c28bcdb2c1d67eee447c4a8299f871401df10c96ffb8459786ad5c2

Observation f96212fa-8499-41f4-a7f8-0867af10a55c · outbound

This paper cites Easy2hard-bench: Standardized difficulty labels for profiling llm performance and generalization.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Easy2hard-bench: Standardized difficulty labels for profiling llm performance and generalization

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:18.905650Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:18.905650Z digest=sha256:504764c9314f6480a412379655916e3ba5c5230a9749e27611e8a1d88d907d87

Observation 9320d1f5-1fce-4579-85aa-230e6bdb3984 · outbound

This paper cites Vintern-1B: An Efficient Multimodal Large Language Model for Vietnamese.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Vintern-1B: An Efficient Multimodal Large Language Model for Vietnamese

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:18.998229Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:18.998229Z digest=sha256:543a8095c91d5aa057b896c1cfc90b490cfe5d2a259d4d6ea188904ece77a803

Observation e074296d-34d8-4ca8-97c5-a1dff4d401d4 · outbound

This paper cites InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:19.144832Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:19.144832Z digest=sha256:8c9f22e7f6dcc7f5309f5c585ee12c0becc2d538b577c173ea902bbaff732c29

Observation 51196814-becb-4580-811f-3854ec73b33e · outbound

This paper cites Vlmevalkit: An open-source toolkit for evaluating large multi-modality models.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Vlmevalkit: An open-source toolkit for evaluating large multi-modality models

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:19.265190Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:19.265190Z digest=sha256:1a6f90631bbac9e053895343596015a6a181086a4843e17950c98d98363113bd

Observation 98834668-9201-4eae-8e30-e3bf8c7b63cb · outbound

This paper cites MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:19.367021Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:19.367021Z digest=sha256:66fa3f895b143e0b5b2c209752a2601ce5cbcebc7afe24349376efce13289277

Observation 305abdde-2cf4-4737-95c8-7fd3ec942c1c · outbound

This paper cites Blink: Multimodal large language models can see but not perceive.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Blink: Multimodal large language models can see but not perceive

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:19.464859Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:19.464859Z digest=sha256:540206e027edddeee377b1a72a803035055fd3cd7eff2c22717b3f4242592329

Observation e25bf317-5f2d-40ca-955e-33badcf75361 · outbound

This paper cites H2OVL-Mississippi Vision Language Models Technical Report.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs H2OVL-Mississippi Vision Language Models Technical Report

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:19.557859Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:19.557859Z digest=sha256:8bb24821433f88710e70fab90c8095b21dd77ea3fa4cd8eaecdb52d56f50de03

Observation fa7790e8-d9bc-4313-af73-73e7ae890635 · outbound

This paper cites Difficulty Controllable Generation of Reading Comprehension Questions.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Difficulty Controllable Generation of Reading Comprehension Questions

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:19.684878Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:19.684878Z digest=sha256:5ee362fd8d705888ed70419014a6fdfc61ec6ebd32eee874b06a3af17b1f30a8

Observation c5d85e1e-a194-4f42-a0bb-7503eae4c33d · outbound

This paper cites Cmmmu: A chinese massive multi-discipline multimodal understanding benchmark.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Cmmmu: A chinese massive multi-discipline multimodal understanding benchmark

Reference 27

Resolution
verified exact
raw_fallback, observed 2026-08-07T13:40:27.277575Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T13:40:19.794790Z digest=sha256:a8d856f03e13b77cefb027b95c529dbbc950a4db908610d4c7e3d1de80c3d05e

Observation 66d1d3e2-7d90-4b33-b486-4af3e58fe14e · outbound

This paper cites Example of the glicko-2 system.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Example of the glicko-2 system

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:19.884750Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:19.884750Z digest=sha256:655966ff08dd60ea66627d3074054269efd06bcd08aba8952d231987117aaddf

Observation a9a8c5b9-0124-4481-8765-c5224935fc06 · outbound

This paper cites Infinity-MM: Scaling Multimodal Performance with Large-Scale and High-Quality Instruction Data.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Infinity-MM: Scaling Multimodal Performance with Large-Scale and High-Quality Instruction Data

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:19.937612Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:19.937612Z digest=sha256:417b2659d56bf5e765a1ecd23c550cd6306b28ddbf7c0b6b7d94a96a3d3817c3

Observation d18be7ea-ff13-41a2-981c-a9343786aeaa · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:20.074750Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:20.074750Z digest=sha256:0ff6cdafcf1a3be5d5177e3e8e0399ad2ac02d5261a7048bbd7676314e230a2b

Observation 68ae5757-6f11-422c-a62d-ccb59f4426d7 · outbound

This paper cites Efficient Multimodal Learning from Data-centric Perspective.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Efficient Multimodal Learning from Data-centric Perspective

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:20.145924Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:20.145924Z digest=sha256:f993e55783593bf1246d737d0709ee7956bbdf6b72959b9dc356d515e92fd249

Observation 95a4f9f4-96cc-4e33-9af1-591cddb241f5 · outbound

This paper cites CMMU: A Benchmark for Chinese Multi-modal Multi-type Question Understanding and Reasoning.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs CMMU: A Benchmark for Chinese Multi-modal Multi-type Question Understanding and Reasoning

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:20.204272Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:20.204272Z digest=sha256:f9f82d5b370b8526bef1e19bb1ccc87eb5e2fe557ae7fc65b48a977b2d20c98f

Observation bdb5378d-d934-481d-b76c-bc1ad7a36ae3 · outbound

This paper cites GPT-4o System Card.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs GPT-4o System Card

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:20.344855Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:20.344855Z digest=sha256:199aed78fdc6baa45690b15e55096ad9cd8cc3b018cd4ee75e4bc32f401e45e6

Observation d85cb312-c88b-420a-ac44-aa7a40c2c00f · outbound

This paper cites MANTIS: Interleaved Multi-Image Instruction Tuning.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs MANTIS: Interleaved Multi-Image Instruction Tuning

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:20.474830Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:20.474830Z digest=sha256:5956688fa1f5ed3443b6959487bdfd9040ff8cddce90d34c2900da14eb6737ab

Observation 503d17eb-a3c7-42d3-861e-26b2633339aa · outbound

This paper cites Ku, Qian Liu, and Wenhu Chen.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Ku, Qian Liu, and Wenhu Chen

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:20.560521Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:20.560521Z digest=sha256:a89e0eb70e0d72a5f9df3d4140d222067728b18b00f7efdf04103f0d665d1380

Observation c8f61ed3-621c-4886-b07e-099b92ef3a73 · outbound

This paper cites Automatic educational question generation with difficulty level controls.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Automatic educational question generation with difficulty level controls

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:20.701466Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:20.701466Z digest=sha256:8dcce05c493cfcbc0d9e6132f9acd65cbc17793cc89680af1a167e766c8b1a06

Observation b155af45-9c20-464f-b9ec-a9994238aa44 · outbound

This paper cites A diagram is worth a dozen images.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs A diagram is worth a dozen images

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:20.808317Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:20.808317Z digest=sha256:523b8c289adc6eb79c9807256762a214edb0a9d1b3f45992317c1ea239da175e

Observation 26a03eb3-3c59-43d6-b8ef-1a0cfccaeb51 · outbound

This paper cites Adam: A Method for Stochastic Optimization.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Adam: A Method for Stochastic Optimization

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:20.943836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:20.943836Z digest=sha256:08735db0996c4872f8fbb07b8c6252ef61ff990d595a18c0c0e5c781c0a8c8c7

Observation 90f0ecd7-0d61-4caa-b63c-9f5112eca615 · outbound

This paper cites Auto-Encoding Variational Bayes.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Auto-Encoding Variational Bayes

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:21.060758Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:21.060758Z digest=sha256:2440b2a8466163a182b0df81cad41903a1f86f7e2b625601ff01d3cabd0a9f66

Observation 29d13fbe-517a-4dc7-968d-fb2e65c111ca · outbound

This paper cites Moondream2: A vision-language model.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Moondream2: A vision-language model

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:21.190757Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:21.190757Z digest=sha256:1a477f8d2d8f2e6b64b1813b776ee3ee7796251419726a6d5dcfb48f8dfdac05

Observation 62a52ced-8ff9-455f-9d0c-2d6e37ac6711 · outbound

This paper cites What matters when building vision- language models? Advances in Neural Information Processing Systems, 37:87874–87907, 2024.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs What matters when building vision- language models? Advances in Neural Information Processing Systems, 37:87874–87907, 2024

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:21.254890Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:21.254890Z digest=sha256:34647d6c2d196aef99f824ceadec1f80a38ec887700e800d710ccefb5d54c9b3

Observation 6c0c972b-48de-4849-a504-0cbdf2699521 · outbound

This paper cites Difficulty-Focused Contrastive Learning for Knowledge Tracing with a Large Language Model-Based Difficulty Prediction.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Difficulty-Focused Contrastive Learning for Knowledge Tracing with a Large Language Model-Based Difficulty Prediction

Reference 42

Resolution
verified exact
local_arxiv, observed 2026-08-07T13:40:26.790665Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T13:40:21.327752Z digest=sha256:8c6444b85e141f41c44086c115b55c249a9039dccf09f67618d92a6c8b94eceb

Observation ea43b17b-bf85-4e6e-819d-8a48bff9a40f · outbound

This paper cites LLaVA-OneVision: Easy Visual Task Transfer.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs LLaVA-OneVision: Easy Visual Task Transfer

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:21.421761Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:21.421761Z digest=sha256:205a7671573f8335e0d6f94ae04b7d322ed628a68ec896933f964a7bfe1b09df

Observation 13917c5a-bb02-4254-bbd5-83c110a4c83f · outbound

This paper cites SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:21.495770Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:21.495770Z digest=sha256:21923a60010002f89eeea0020937aa4512908f85230eb474661e0a753cd0b014

Observation c50813fc-6d66-46ed-98d9-610c938ae99b · outbound

This paper cites Seed-bench: Benchmarking multimodal large language models.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Seed-bench: Benchmarking multimodal large language models

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:21.591907Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:21.591907Z digest=sha256:58da0680bd453b32234672b5f50cfdfb7cd87cbce651301e9d561ec1c1821eac

Observation 0df7fb95-3801-4a8d-83c5-60b5fff0a581 · outbound

This paper cites Reform-eval: Evaluating large vision language models via unified re-formulation of task-oriented benchmarks.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Reform-eval: Evaluating large vision language models via unified re-formulation of task-oriented benchmarks

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:21.684259Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:21.684259Z digest=sha256:25a608d901230a05a5d902fd474958bf7f178c7c504a82477ec623487f8f0b01

Observation aa363727-9181-443f-a5be-3fd6cbe7a698 · outbound

This paper cites Continuous or discrete, that is the question: A survey on large multi-modal models from the perspective of input-output space extension.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Continuous or discrete, that is the question: A survey on large multi-modal models from the perspective of input-output space extension

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:21.767930Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:21.767930Z digest=sha256:a62cb4d83e61b60249fc57d609f1505735b335663268c3cec6282ca99f77f9b6

Observation 810e2824-ad71-43d2-b5fb-4cbea895bf9b · outbound

This paper cites Monkey: Image Resolution and Text Label Are Important Things for Large Multi-modal Models.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Monkey: Image Resolution and Text Label Are Important Things for Large Multi-modal Models

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:21.845958Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:21.845958Z digest=sha256:0a861483b5b4f8cf14b8011a80983e2f331d3fcbf81e96ecc8063bfe767ebac2

Observation 47c8a659-4aa0-42aa-ba8f-6b73c7f96a09 · outbound

This paper cites A survey of state of the art large vision language models: Alignment, benchmark, evaluations and challenges.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs A survey of state of the art large vision language models: Alignment, benchmark, evaluations and challenges

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:21.916276Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:21.916276Z digest=sha256:68cee0250bd721c1cb191aea2e40f0464d9d1439c8052fdf27ec2f7f6b56c165

Observation 2060fb34-e3cf-4ee8-b7c6-167d41a4c4c5 · outbound

This paper cites DeepSeek-V3 Technical Report.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs DeepSeek-V3 Technical Report

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:21.984280Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:21.984280Z digest=sha256:5fd60562ea697ed0c605c57401088003fa12aa6faaebb5296ff12ae99bbc340b

Observation 5e75d31a-f5b7-4617-aa5f-3ec23d9331f3 · outbound

This paper cites Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:22.055666Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:22.055666Z digest=sha256:473814f9e7c4a425c835b9109f00593e5b537337b7467a712b5328403d810b01

Observation b734376c-1a68-4c36-be08-0f4910be9971 · outbound

This paper cites Improved Baselines with Visual Instruction Tuning.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Improved Baselines with Visual Instruction Tuning

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:22.131773Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:22.131773Z digest=sha256:1d27b8c32c80fa74e3cc8d46ca9242bbb2a8a0a88d3140078f639ff346865c8e

Observation 2037cf67-c670-4b76-95c5-4406e91a5acf · outbound

This paper cites Llava-next: Improved reasoning, ocr, and world knowledge, January 2024.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Llava-next: Improved reasoning, ocr, and world knowledge, January 2024

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:22.202086Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:22.202086Z digest=sha256:06e15329b76a9e29bf8832be0542d4259c9c1e2f1727df5345ee067e910d3ad2

Observation baf79efd-d0cc-404b-9aad-a36ac0a2091a · outbound

This paper cites Mmbench: Is your multi-modal model an all-around player? In European conference on computer vision, pages 216–233.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Mmbench: Is your multi-modal model an all-around player? In European conference on computer vision, pages 216–233

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:22.271868Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:22.271868Z digest=sha256:bee83986cc867ad2277c9278b23f8a4bde6640781631cd69d24ef1d6c14bb378

Observation 0c7b6a80-6563-476d-bf84-ec4f198ca983 · outbound

This paper cites POINTS: Improving Your Vision-language Model with Affordable Strategies.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs POINTS: Improving Your Vision-language Model with Affordable Strategies

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:22.349276Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:22.349276Z digest=sha256:e57be61ce62f2444fdb411dc5d037c1ec52c7f7b0dc31b877f3b3ef041892a23

Observation 03b9e430-240a-41a5-b3ea-b30911b9beff · outbound

This paper cites Ocrbench: on the hidden mystery of ocr in large multimodal models.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Ocrbench: on the hidden mystery of ocr in large multimodal models

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:22.430479Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:22.430479Z digest=sha256:2806f9f67875e3de2e379b2c27ab246af2a8f0ad38ab083421936926fc3d4e87

Observation caf27b58-1937-4909-9ec2-6de1a6df3046 · outbound

This paper cites Applications of item response theory to practical testing problems.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Applications of item response theory to practical testing problems

Reference 57

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:40:32.347477Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T13:40:22.523026Z digest=sha256:fccdb23cbbc7b0a7f3e553b4a6eac7ebcbf2b03bbb589e5f937570a11aa58400

Observation 7ef08d00-959d-4ee2-95ec-540db9247e00 · outbound

This paper cites Mmalaya2.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Mmalaya2

Reference 58

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:40:32.112816Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T13:40:22.596247Z digest=sha256:e123d8451ebe021d5065fb66931b7afad4d7972a13c8c46da72e730e4d6f878c

Observation 297b0366-7d48-44e1-8630-d5f8542fc998 · outbound

This paper cites Deepseek- vl: Towards real-world vision-language understanding, 2024.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Deepseek- vl: Towards real-world vision-language understanding, 2024

Reference 59

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:40:31.816745Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T13:40:22.651579Z digest=sha256:f9ce53e6bbdc54a615f82837ec65051755240e26b87df476ab6b3ebc183c7570

Observation ea0cfe11-27b0-466a-b325-f0517896acb3 · outbound

This paper cites Deepseek- vl: Towards real-world vision-language understanding, 2024.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Deepseek- vl: Towards real-world vision-language understanding, 2024

Reference 60

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:40:31.524040Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T13:40:22.733757Z digest=sha256:735e75033d187b0f9abc7756ba8342c60c9aefafe3c46564654b349eb93014e9

Observation 609752e8-c675-46bc-b10a-040ce47a9637 · outbound

This paper cites Learn to explain: Multimodal reasoning via thought chains for science question answering.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Learn to explain: Multimodal reasoning via thought chains for science question answering

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:22.790997Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:22.790997Z digest=sha256:444cea519f6043f51d64f17eada0d7e8545b48591cfbd1d0299ce909e9c07718

Observation e6e772b1-2662-4301-b53f-c44867191a32 · outbound

This paper cites MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:22.864807Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:22.864807Z digest=sha256:4ae11bd5f3e34875e756433e8b7d73be5da6ad9573e285f8b040db9e0a2b51e9

Observation 66051f3d-87e3-4bc9-be8c-dd4563c51b30 · outbound

This paper cites Ovis: Structural Embedding Alignment for Multimodal Large Language Model.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Ovis: Structural Embedding Alignment for Multimodal Large Language Model

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:22.917151Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:22.917151Z digest=sha256:6037d5480c08ae0bc4aa47555f0e7dbe0ad9b5079254e2eda157e1280ef9eb5e

Observation 94969d3f-a8bd-4ac6-a698-06814836e0d4 · outbound

This paper cites BlueLM-V-3B: Algorithm and System Co-Design for Multimodal Large Language Models on Mobile Devices.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs BlueLM-V-3B: Algorithm and System Co-Design for Multimodal Large Language Models on Mobile Devices

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:22.995802Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:22.995802Z digest=sha256:36ef56d3cf1b63b5d7bf434d078ab1893e7d995259579dbbf352cc24adac0d93

Observation 520597f7-df58-4bc6-a649-8e2f9dcf1183 · outbound

This paper cites Taiyi: a bilingual fine-tuned large language model for diverse biomedical tasks.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Taiyi: a bilingual fine-tuned large language model for diverse biomedical tasks

Reference 65

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:40:31.245487Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T13:40:23.050318Z digest=sha256:0b37dc42bf6913985f82e6877890e099150342f1e2e86822a5fe679044a9b302

Observation d0ade989-03d2-4893-9686-1a9ad66289db · outbound

This paper cites Gpt-4v-system-card.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Gpt-4v-system-card

Reference 66

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:40:30.926145Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T13:40:23.124750Z digest=sha256:28931d924c9aa98e437baa642805b0dc8a32de416c09b75b4d93f1854344ca75

Observation da47228a-1241-4eea-81b9-7a3371231ebe · outbound

This paper cites Large language models are students at various levels: Zero-shot question difficulty estimation.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Large language models are students at various levels: Zero-shot question difficulty estimation

Reference 67

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:40:30.663955Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T13:40:23.190615Z digest=sha256:c780b2a2d5f492d0fa124870238df241a7e9f9559f40f6e5210707dc8f586cc8

Observation 244d940c-0c30-4aca-99a0-f4a451543ee4 · outbound

This paper cites Automatic differentiation in pytorch.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Automatic differentiation in pytorch

Reference 68

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:23.257385Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:23.257385Z digest=sha256:47cf16c417f980e6415387ea87f7df73abada4f3c5b68211def0bfd9c814864c

Observation 0892b2d4-f7cb-48cc-b7e2-ac4e0151c6cb · outbound

This paper cites Transcore-m: Multimodal foundation model for transportation research.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Transcore-m: Multimodal foundation model for transportation research

Reference 69

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:40:30.397632Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T13:40:23.338474Z digest=sha256:5bcda179c89bb26f82e687f7c36ce76f8f76c5f608b88ab2c9123b4f4379f5c6

Observation b256a703-e9a1-4633-883a-ef3724999d41 · outbound

This paper cites Kosmos-2: Grounding Multimodal Large Language Models to the World.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Kosmos-2: Grounding Multimodal Large Language Models to the World

Reference 70

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:23.405782Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:23.405782Z digest=sha256:0b4614a284a38edb169bdb517af51431903c79747d05aa1c1a4f70c413bc8305

Observation b4d52ffe-f59f-4b81-baae-5b941819db4e · outbound

This paper cites Efficient Benchmarking of Language Models.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Efficient Benchmarking of Language Models

Reference 71

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:23.474799Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:23.474799Z digest=sha256:3b00bcf970b919f21c215af88c4d40807bb440baf6a96102f3bde0656938311b

Observation 91455da6-36ac-4a4e-a460-a335005e4c24 · outbound

This paper cites tinyBenchmarks: evaluating LLMs with fewer examples.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs tinyBenchmarks: evaluating LLMs with fewer examples

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:23.551580Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:23.551580Z digest=sha256:055729faaee81f0959388bc20baa8b38c6779be2d9fe7c722ec0b3fc9445270a

Observation 59f84bff-13ca-43a7-8ba9-0b07af0b27ad · outbound

This paper cites qihoo360/360vl-70b: An open-source large vision-language model based on llama3-70b.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs qihoo360/360vl-70b: An open-source large vision-language model based on llama3-70b

Reference 73

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:40:30.073666Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T13:40:23.613829Z digest=sha256:8c3974acaea9745f46c8d0777e5d906524b981dee139157bf9d04a95b1a83645

Observation 295d6d78-4cb0-4b82-9c92-e5588ff9ede2 · outbound

This paper cites Learning transferable visual models from natural language supervision.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Learning transferable visual models from natural language supervision

Reference 74

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:23.645848Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:23.645848Z digest=sha256:e66deb6165ac989471a3d3a71f76cb03bce6ce97ff3b0dece81fb8efc4739903

Observation 483bd89e-23a3-4733-a06c-d82a11abeb39 · outbound

This paper cites Probabilistic models for some intelligence and attainment tests.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Probabilistic models for some intelligence and attainment tests

Reference 75

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:40:29.811540Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T13:40:23.795607Z digest=sha256:543417d3eb1bb542a94b5a6d7a9ba3205fab0035290916a4c99dde98699d0825

Observation d47bf71d-1318-4c93-a5c0-783ff35a655a · outbound

This paper cites Eagle: Exploring The Design Space for Multimodal LLMs with Mixture of Encoders.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Eagle: Exploring The Design Space for Multimodal LLMs with Mixture of Encoders

Reference 76

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:23.941064Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:23.941064Z digest=sha256:cc7f63f24dfa12b753c379d1a5cd2de2a29b466e0e3c55dac92d7863e58b5ae6

Observation 1ef07471-8c90-4b3e-a5f4-abe0866ca726 · outbound

This paper cites an unresolved cited work.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Unresolved cited work

Reference 77

Resolution
unresolved
raw_fallback, observed 2026-08-07T13:40:29.567216Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T13:40:24.054741Z digest=sha256:db7fdc94910b3a89858224b7db225b73219ac886eb550762c0811e54ff621cf7

Observation 35fe3493-ed07-4dd7-b2ab-7eef11a78a2d · outbound

This paper cites Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context

Reference 78

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:24.145551Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:24.145551Z digest=sha256:9ea3e17128f42016d333c14b8fc7c1538505a0d33c210d2bfa17d29e6f3d109e

Observation 15471aa2-dd38-4627-b45e-f1a6f99d2d4b · outbound

This paper cites tiiuae/falcon-11b-vlm: A vision-language model based on falcon- 11b.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs tiiuae/falcon-11b-vlm: A vision-language model based on falcon- 11b

Reference 79

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:40:29.325515Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T13:40:24.222825Z digest=sha256:4c434dcfc2118b4113fba7bcfc9277580b98237463ec31449adfd58b0f220825

Observation b7e95455-61d5-4a24-a70e-853cd13385c7 · outbound

This paper cites Evaluating Cost-Accuracy Trade-offs in Multimodal Search Relevance Judgements.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Evaluating Cost-Accuracy Trade-offs in Multimodal Search Relevance Judgements

Reference 80

Resolution
verified exact
local_arxiv, observed 2026-08-07T13:40:26.299574Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T13:40:24.292226Z digest=sha256:64aae8b72c7bde8d47bd2bf6d0117e88c56de0738439fca77ca730145d1ac164

Observation 8d7e483c-391c-4725-994d-a8d24ac5dadc · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs LLaMA: Open and Efficient Foundation Language Models

Reference 81

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:24.376969Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:24.376969Z digest=sha256:7ef918f367b3bb977a4bf2575549c6915511be8855c151c2b3e1c9c90751ad93

Observation 343cb7bb-915e-49a8-9ab6-0fe700ab8fd4 · outbound

This paper cites Comparing Test Sets with Item Response Theory.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Comparing Test Sets with Item Response Theory

Reference 82

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:24.455373Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:24.455373Z digest=sha256:9e64c3b4cc2832485bd03060dd562cae8ff3d9ff255bf3ae2f2d2b41b16b2f10

Observation 486e7a53-c6a3-466e-a9d4-4b5e2ffcbfdd · outbound

This paper cites Moondream1.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Moondream1

Reference 83

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:40:29.085273Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T13:40:24.533043Z digest=sha256:10f881e11975af9ca0ac4cdefa97df85f90c3a9e230b5311b646029848a401f1

Observation 5b4da071-ba41-44d2-ada8-c4d333ccc169 · outbound

This paper cites Anchor Points: Benchmarking Models with Much Fewer Examples.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Anchor Points: Benchmarking Models with Much Fewer Examples

Reference 84

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:24.611594Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:24.611594Z digest=sha256:c4843faa62e789ae2b4d9bfe9117b24065ce53892579a0d5cf56dd49735360cd

Observation b942e48d-4611-4c30-b882-f65be3a79527 · outbound

This paper cites Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution

Reference 85

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:24.725004Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:24.725004Z digest=sha256:122483fb7c3b0b57837160641dde51b08d550ee36a100a7a5e4a840725f665fe

Observation 2590573f-3035-4269-b202-ff079e461bb5 · outbound

This paper cites Benchmark Self-Evolving: A Multi-Agent Framework for Dynamic LLM Evaluation.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Benchmark Self-Evolving: A Multi-Agent Framework for Dynamic LLM Evaluation

Reference 86

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:24.777981Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:24.777981Z digest=sha256:68d56b0c717bf85a4874278e86428820f9918ed82c766e3abfd82d930ace8b56

Observation 1ba1d4ed-d1df-43e7-a8bf-19aa739846be · outbound

This paper cites Chain-of-thought prompting elicits reasoning in large language models.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Chain-of-thought prompting elicits reasoning in large language models

Reference 87

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:24.833222Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:24.833222Z digest=sha256:e7f0d1f7c5b12ce7dedf2ac0c7edcbcf57a5290e84b92bf769a5b30caab6a8d0

Observation ac17db1a-9f78-4d02-9572-ad99f23879b9 · outbound

This paper cites Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation

Reference 88

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:24.887964Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:24.887964Z digest=sha256:6c3f8fd0561eeb19a2cdd39038a69d7e708ecf5a025fadbddb6690e9f752dd94

Observation 5fe6123b-dd9f-4f2b-ab07-a73f2d78e955 · outbound

This paper cites Adaption-of-thought: Learning question difficulty improves large language models for reasoning.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Adaption-of-thought: Learning question difficulty improves large language models for reasoning

Reference 89

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:40:28.769525Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T13:40:24.949625Z digest=sha256:950ded8608011ab313d0b20fa37c972e4d323ec8cd795bbb6dbbf3ed934bf145

Observation 292c4461-a251-49bc-afa8-8774d69dfb8f · outbound

This paper cites Lvlm-ehub: A comprehensive evaluation benchmark for large vision-language models.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Lvlm-ehub: A comprehensive evaluation benchmark for large vision-language models

Reference 90

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:25.034630Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:25.034630Z digest=sha256:43b1d2c6a9dc34b8a4cd6dc6020e84d2e38ca4d9ae70dbd3e475cadd0d5a3938

Observation b2c8dcad-48dd-43e4-b100-9a4a16e77231 · outbound

This paper cites Collageprompt: A benchmark for budget- friendly visual recognition with gpt-4v.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Collageprompt: A benchmark for budget- friendly visual recognition with gpt-4v

Reference 91

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:40:28.522427Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T13:40:25.120067Z digest=sha256:430f3d923f5389df10d165677d8ff33d874f795285fc9f316b081a9d441c3850

Observation 8890e8ef-0ae4-4903-85c3-f15493e5c72c · outbound

This paper cites Qwen2.5 Technical Report.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Qwen2.5 Technical Report

Reference 92

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:25.219084Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:25.219084Z digest=sha256:153a6dc1b090d1c72faab63e4c9d5c95938cf09126689709c30398d2ecfa7ae7

Observation c5336192-b0dd-44e1-8dea-3ac387e47985 · outbound

This paper cites MiniCPM-V: A GPT-4V Level MLLM on Your Phone.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs MiniCPM-V: A GPT-4V Level MLLM on Your Phone

Reference 93

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:25.336819Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:25.336819Z digest=sha256:a0645c9b743b90326cf16ed67fb188e30b9917bbeededcb1d61a5f9bbcb2a1f8

Observation dd1247fd-ca59-4c6e-8d84-ab8666766be7 · outbound

This paper cites MMT-Bench: A Comprehensive Multimodal Benchmark for Evaluating Large Vision-Language Models Towards Multitask AGI.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs MMT-Bench: A Comprehensive Multimodal Benchmark for Evaluating Large Vision-Language Models Towards Multitask AGI

Reference 94

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:25.406739Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:25.406739Z digest=sha256:d55cfd0e49e1ed0c2c6bfab8c04dfb6eec96ba33d0a4f39eb927a8177bd559fa

Observation 6fa99504-6013-429a-97a8-9a2d03f49ce8 · outbound

This paper cites Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi

Reference 95

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:25.494783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:25.494783Z digest=sha256:eda122402a2621982ef8f42bcf6754a20b5d2188eee9e6ce82ad68e4defc9eda

Observation 80f2e1f6-1317-4010-b328-cee0148f0e27 · outbound

This paper cites Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models

Reference 97

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:25.686235Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:25.686235Z digest=sha256:79a12ed9550c2cd5255bb6f4f845ae27b704da4b856721348dd53ace85fd2f91

Observation f7b04f8e-7b3d-4e43-96a6-b8aaf36a9168 · outbound

This paper cites Efficiently measuring the cognitive ability of llms: An adaptive testing perspective.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Efficiently measuring the cognitive ability of llms: An adaptive testing perspective

Reference 98

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:40:28.252949Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-07T13:40:25.765528Z digest=sha256:d4a4a445170d1e9494f4284a1275abe13b13a9464bda157d572b3fa18a4d7f76

Observation 05ed1da9-f499-4840-9920-0ff28eff1f3c · outbound

This paper cites Position: AI Evaluation Should Learn from How We Test Humans.

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs Position: AI Evaluation Should Learn from How We Test Humans

Reference 99

Resolution
unresolved
no resolver link, observed 2026-08-07T13:40:25.866299Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:40:25.866299Z digest=sha256:fc7acff9e2ee88f47bb7732aa701fa67fd24ca6e8d0579952ea378ed051ff3c7

Pith citing papers

No inbound Pith citation observations are available.