Pith. sign in

Paper Citation Record · LEDGER

AutoBench-V: Can Large Vision-Language Models Benchmark Themselves?

As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 6 inbound Pith citation observations for arXiv:2410.21259.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2410.21259 v4

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 6 of 6 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-09T06:31:02.800959+00:00

measured 6 of 6 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-07T10:35:44.349157Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-04T00:39:16.763538Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation ef369034-fb0f-4a96-8549-ffb33799306d · inbound

BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models cites this paper.

BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models AutoBench-V: Can Large Vision-Language Models Benchmark Themselves?

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-07T10:35:44.349157Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T10:35:44.349157Z digest=sha256:a1c8ce1efd8c60aad63dbac633370390f394e240b0ae9c94f73a3deab0865ea7

Observation 9861685b-8ecc-4ebf-84cd-ae559635bbee · inbound

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling cites this paper.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling AutoBench-V: Can Large Vision-Language Models Benchmark Themselves?

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-06T10:53:06.140763Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T10:53:06.140763Z digest=sha256:b4406e59d8e7802ff29220aa5185fe2b1ebad56e830487e8e1a95a74ee2d791b

Observation 354f2864-ae19-4f89-9384-8c94d5f5c920 · inbound

Generative Models for Synthetic Data: Transforming Data Mining in the GenAI Era cites this paper.

Generative Models for Synthetic Data: Transforming Data Mining in the GenAI Era AutoBench-V: Can Large Vision-Language Models Benchmark Themselves?

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-05T15:43:12.626532Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T15:43:12.626532Z digest=sha256:c240d870c9b901067a08b653ba4c4def94f89c3054c98dad0937648e8f041116

Observation 4e9c706f-0a7b-46b1-af29-0dc823b69cce · inbound

PolicyLLM: Towards Excellent Comprehension of Public Policy for Large Language Models cites this paper.

PolicyLLM: Towards Excellent Comprehension of Public Policy for Large Language Models AutoBench-V: Can Large Vision-Language Models Benchmark Themselves?

Reference 1

Resolution
metadata mismatch
arxiv_id, observed 2026-05-11T09:31:03.326869Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-10T15:59:34.133124Z digest=sha256:d83ff546aa314851d9d335e0b2a5dd8eeb0a78a5efffb1920ce226bf944e7914

Observation a9a61a10-e1bd-469c-8826-97563c5e681c · inbound

SkillGen: Verified Inference-Time Agent Skill Synthesis cites this paper.

SkillGen: Verified Inference-Time Agent Skill Synthesis AutoBench-V: Can Large Vision-Language Models Benchmark Themselves?

Reference 2

Resolution
verified exact
arxiv_id, observed 2026-05-13T06:17:23.039581Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-13T06:14:28.614825Z digest=sha256:d63d5bfb39c2be74fed424eafc61d7ad7298bfe69a15156dfa650b65e17d0658

Observation 461ef548-fc35-4fd6-9a73-beecdad8ad8e · inbound

REKEY: Metadata-Grounded Visual-Key Regeneration for Contamination-Resilient VQA Evaluation cites this paper.

REKEY: Metadata-Grounded Visual-Key Regeneration for Contamination-Resilient VQA Evaluation AutoBench-V: Can Large Vision-Language Models Benchmark Themselves?

Reference 1

Resolution
metadata mismatch
arxiv_id, observed 2026-07-04T00:39:16.765637Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-06-26T21:06:09.166363Z digest=sha256:2b87a4d3a8272498e5affe876e5103d13e3786e564c3e5e1222964e9c854dae7