{"as_of":"2026-08-11T15:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:309d191c505a30d79f9a06b21ca6417dcbc0d5691dc0194f6474df9ff089953f","coverage":[{"denominator":74,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":74,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:35:47.354401Z","state":"measured"},{"denominator":74,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":74,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.05440/citation-record","integrity":"/paper/2506.05440/integrity","json":"/paper/2506.05440/citation-record.json","paper":"/paper/2506.05440"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.16640","last_updated":"2024-07-18T09:01:52Z","snapshot_observed_at":"2026-07-06T18:20:09.790181Z","submitted_at":"2024-05-26T17:31:21Z","title":"A Survey of Multimodal Large Language Model from A Data-centric Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16640","snapshot_observed_at":"2026-08-07T10:35:40.086587Z","title":"A survey of multimodal large language model from a data-centric perspective,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:40.086587Z"},"links":{"cited_paper":"/paper/2405.16640","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:0d7320fe2739ef8bb7356e88eec72ac97abc1f208a0aef445512aed3f3b507b0","observation_id":"f6605ebf-5760-41ff-8d5f-207cf9fa725f","resolution":{"observed_at":"2026-08-07T10:35:40.086587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:56.389836Z","title":"Understanding the limits of vision language models through the lens of the binding problem,","venue":null,"work_id":"aafe3029-6d15-45d3-b824-1917e157fa5e","year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:40.159257Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:093092c093410e9cd20c2eff6b3883f366c7a8ca2b0e54eb0ff023f9f3921c48","observation_id":"798ada72-7bba-43f2-b70f-b9c6fd8f1891","resolution":{"observed_at":"2026-08-07T10:35:56.466850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:56.242422Z","title":"Vision language models are blind,","venue":null,"work_id":"f90d3928-3b05-4585-8e29-6f7eb01668be","year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:40.177234Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:fbabc11d115ba719b179f530ffda02a158b94c33d4bb0f0a29e2fef05128003d","observation_id":"7f9318cc-ccdc-47cf-adaf-5f451659b3aa","resolution":{"observed_at":"2026-08-07T10:35:56.314770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15563","last_updated":"2025-02-21T16:24:10Z","snapshot_observed_at":"2026-08-09T11:49:02.006465Z","submitted_at":"2025-02-21T16:24:10Z","title":"Bridging vision language model (VLM) evaluation gaps with a framework for scalable and cost-effective benchmark generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.15563","snapshot_observed_at":"2026-08-07T10:35:40.241722Z","title":"Bridging vision language model (vlm) evaluation gaps with a frame- work for scalable and cost-effective benchmark generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:40.241722Z"},"links":{"cited_paper":"/paper/2502.15563","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:aa17a727c2356df6b8cad46c4039d8b7be0c2a5024838a6b51e8bfff6e1ad9bf","observation_id":"8e4113d0-fc0c-4237-9c6b-e888e47cdaff","resolution":{"observed_at":"2026-08-07T10:35:40.241722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:56.071661Z","title":"Vlmevalkit: An open-source toolkit for evaluating large multi-modality models,","venue":null,"work_id":"23b26b9b-6b1e-4163-9b06-4540d1208c35","year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:40.431645Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:830852012d5898831de934761df9e9cbc77eefd051281ea2b9a46d453c137d91","observation_id":"918d0586-7f49-4275-99ac-26ebcfd182cd","resolution":{"observed_at":"2026-08-07T10:35:56.145205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04810","last_updated":"2024-08-09T01:41:05Z","snapshot_observed_at":"2026-08-10T06:32:11.456518Z","submitted_at":"2024-08-09T01:41:05Z","title":"UniBench: Visual Reasoning Requires Rethinking Vision-Language Beyond Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04810","snapshot_observed_at":"2026-08-07T10:35:40.558440Z","title":"Unibench: Visual reasoning requires rethinking vision-language beyond scaling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:40.558440Z"},"links":{"cited_paper":"/paper/2408.04810","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:a60c64d632311fc0e03dfb3d897f676a115c761fcaed2b502e8d7155b7cddac8","observation_id":"9771b082-b0d9-4e98-a987-f8f79d71e0b5","resolution":{"observed_at":"2026-08-07T10:35:40.558440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15296","last_updated":"2024-12-08T04:24:31Z","snapshot_observed_at":"2026-08-07T09:14:56.498818Z","submitted_at":"2024-11-22T18:59:54Z","title":"MME-Survey: A Comprehensive Survey on Evaluation of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15296","snapshot_observed_at":"2026-08-07T10:35:40.742944Z","title":"Mme-survey: A comprehensive survey on evaluation of multimodal llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:40.742944Z"},"links":{"cited_paper":"/paper/2411.15296","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:4d1164a98a9fa6e7066249211a9fc5876d87c85cd43873c00a2bbdfbfbba73ab","observation_id":"8a236e54-b53d-4350-96ea-4fa5bbd5bdf2","resolution":{"observed_at":"2026-08-07T10:35:40.742944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02189","last_updated":"2025-04-06T03:12:51Z","snapshot_observed_at":"2026-08-10T22:12:00.200330Z","submitted_at":"2025-01-04T04:59:33Z","title":"A Survey of State of the Art Large Vision Language Models: Alignment, Benchmark, Evaluations and Challenges","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02189","snapshot_observed_at":"2026-08-07T10:35:40.831220Z","title":"Benchmark evaluations, applications, and challenges of large vision language models: A survey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:40.831220Z"},"links":{"cited_paper":"/paper/2501.02189","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:867b5a40dac019c8a2029d92ecd9f09307463be15fec713d956516342914ae60","observation_id":"15fec2b0-8f47-4e75-8cd6-cc5e476f6d72","resolution":{"observed_at":"2026-08-07T10:35:40.831220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:40.936899Z","title":"Chatbot arena: An open platform for evaluating llms by human preference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:40.936899Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:38e059e8e78acc61765ec36e64c0b6ba631a1720ff25ea821955b07ce0502ac5","observation_id":"45644ae1-fae6-48d9-998e-b400adfe02e6","resolution":{"observed_at":"2026-08-07T10:35:40.936899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-07T10:35:41.061652Z","title":"Are we on the right way for evaluating large vision-language models?,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:41.061652Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:a6252679929d3202edf204ef34f90aa153a42fe748adde68e0e0f08e26c3d000","observation_id":"1671100a-2f05-4f81-afdc-d5e48cd0d7d9","resolution":{"observed_at":"2026-08-07T10:35:41.061652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:55.883195Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models,","venue":null,"work_id":"ffc81107-6865-40cc-811b-35485550c92d","year":2022},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:41.158854Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:ebee93cfc67c150afec18728c230ea0380bbb78fc1c6e60371866957e76c0e44","observation_id":"162f5834-9397-4106-a575-7443c5b65715","resolution":{"observed_at":"2026-08-07T10:35:55.963492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:55.694464Z","title":"Reproducible scaling laws for contrastive language- image learning,","venue":null,"work_id":"5a4d679a-0845-4a30-80c1-dc5d05e80d56","year":2023},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:41.263252Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:c3211e2b8b2fff2f78364d4abc4848587ffa29b481c93965d6c22f4e5a0c24cb","observation_id":"04a75bf2-b7eb-4506-850e-3d362dd4e933","resolution":{"observed_at":"2026-08-07T10:35:55.782803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:55.514496Z","title":"Mapping global dynamics of benchmark creation and saturation in artificial intelligence,","venue":null,"work_id":"eb63cba7-2dfc-4689-a127-ef4dd20516c4","year":2022},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:41.426121Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:b26d149ce1c3b327678d5064ff36ee9838b40a26b63ce99450a52fac444303a5","observation_id":"eebbae27-2485-4fef-bf04-5ac753034236","resolution":{"observed_at":"2026-08-07T10:35:55.600956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:55.338851Z","title":"Sugarcrepe: Fixing hackable benchmarks for vision- language compositionality,","venue":null,"work_id":"305a8c18-98d0-4162-b57a-4b8a4c36f17e","year":2023},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:41.511793Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:1c083f789dffa2b6c832a8ab9ec9cab1f3694fac86f1e12241af87fc8ee733f8","observation_id":"7be181f3-e544-4f7b-9081-70c9b9536f2b","resolution":{"observed_at":"2026-08-07T10:35:55.414344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:55.192217Z","title":"Blender - a 3d modelling and rendering package,","venue":null,"work_id":"b6bbaf56-253a-44ab-9b84-bbb742c3a0a5","year":2018},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:41.636972Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:dfe7fc00edc544b6b9d4c487dd5b07281a7350d695be6b30cc786372a2d6def8","observation_id":"e514ba06-7d22-4451-b669-6cee76028f3f","resolution":{"observed_at":"2026-08-07T10:35:55.265725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:55.025067Z","title":"Is a picture worth a thousand words? delving into spatial reasoning for vision language models,","venue":null,"work_id":"8cdd0704-f018-4775-b7e4-ed4f928b8f94","year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:41.736340Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:3344df89395fa1942cc1d4890da76466e856efe448c051737bc0e2093cd08546","observation_id":"637f5d01-345a-491e-bf80-7c2d8ca3673a","resolution":{"observed_at":"2026-08-07T10:35:55.111765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17600","last_updated":"2024-01-31T04:57:12Z","snapshot_observed_at":"2026-07-06T17:22:53.623679Z","submitted_at":"2024-01-31T04:57:12Z","title":"Good at captioning, bad at counting: Benchmarking GPT-4V on Earth observation data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.17600","snapshot_observed_at":"2026-08-07T10:35:41.868792Z","title":"Good at captioning, bad at counting: Benchmarking gpt-4v on earth observation data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:41.868792Z"},"links":{"cited_paper":"/paper/2401.17600","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:0aab55e20096ef1ef76f9b4a28dc46de8eb9738dabea4f3c78fad4a39375bf55","observation_id":"910cafb6-7591-4ee6-b69e-bc74298e466a","resolution":{"observed_at":"2026-08-07T10:35:41.868792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:54.858129Z","title":"Gpt-4.1, technical report,","venue":null,"work_id":"00e53855-1eab-4d70-807b-4c6311a6d807","year":2025},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:41.964786Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:3e9d8fb6b6e3049abb55516b4e539b2a4d95cfb009e2d9e5cfd49d57f3f94d5d","observation_id":"c4e5a6f5-c21c-49d0-b702-ec3f46dff493","resolution":{"observed_at":"2026-08-07T10:35:54.925232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:54.682699Z","title":"The llama 4 herd","venue":null,"work_id":"e94a6f88-5940-42b9-b0f7-72fb6dea1145","year":2025},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:42.040132Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:1a57c7589383317496019cfa8c2dcf6ee4f7c099365a3d80cebceb45d8daab58","observation_id":"a015eb3e-0c87-42fa-8231-ad83279b42e7","resolution":{"observed_at":"2026-08-07T10:35:54.763787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:42.138086Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:42.138086Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:1bf7f0ac9d6345f73a091479ba1b335d1c6094ac2cd2e04c497f932b221cf095","observation_id":"914a2a46-733e-489c-add6-3b10a3d2a725","resolution":{"observed_at":"2026-08-07T10:35:42.138086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:54.497731Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi,","venue":null,"work_id":"83d721ac-48c9-4643-8941-cf67f0897720","year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:42.225863Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:24bf3687e68df803d2ad8cee431182fe9f4f7cc8f55b57bc851fe9cdb5504236","observation_id":"7cc571b9-2bde-4424-9621-7bbba127e374","resolution":{"observed_at":"2026-08-07T10:35:54.584548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-07T10:35:42.333123Z","title":"Mmbench: Is your multi-modal model an all-around player?,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:42.333123Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:186966462ecb785fc59e60721ff044f2fe5ef6be8efadd3dc8972c4ee0a94fc9","observation_id":"befd5ea0-e3ed-4888-9489-2620759315e3","resolution":{"observed_at":"2026-08-07T10:35:42.333123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:54.296873Z","title":"Towards vqa models that can read,","venue":null,"work_id":"3415c3a0-71aa-477e-b063-440fe2b0a95f","year":2019},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:42.437285Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:85c9a70213c4cdbc00d5faaf31d507a0a60ac67d000aff9c5c40d73da12dd6b8","observation_id":"eac71a37-6b61-4086-8b6b-49f56f195732","resolution":{"observed_at":"2026-08-07T10:35:54.377220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-07T10:35:42.526705Z","title":"Seed-bench: Benchmarking multimodal llms with generative comprehension,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:42.526705Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:a4b7e150e85d302a47b4c8f507c675d56d3bb159577f590b7adb9252b6f68924","observation_id":"9bf2c512-191e-4dd6-88b1-14c17ed52933","resolution":{"observed_at":"2026-08-07T10:35:42.526705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:42.639320Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:42.639320Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:b5cdbed0bc1c7faee0240061046aa776a11a534d4997ca6c393ddd2bfdbbfe0d","observation_id":"6cb976dd-c83a-4ef1-a2ea-d79b09f94e3f","resolution":{"observed_at":"2026-08-07T10:35:42.639320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T10:35:42.739222Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:42.739222Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:156fd11de3744833c76b886abd6ea83039438503bac658b3924a7893208cb99c","observation_id":"c9fe4d05-4ff3-4bef-90f8-08dae7389772","resolution":{"observed_at":"2026-08-07T10:35:42.739222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T10:35:42.968424Z","title":"Qwen2. 5 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:42.968424Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:73916b393eb75fdf048c4305fe873d7ed9400c67edca20ffbec27b9f4da42869","observation_id":"83aee8e2-3d05-4441-911c-1dc9bd8deac6","resolution":{"observed_at":"2026-08-07T10:35:42.968424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T10:35:43.079240Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:43.079240Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:61bf6de22b886545956ef9dc1a20cbd2c734e7c1672c83fce8f5861247f4209a","observation_id":"3a6e5bd1-65ee-44e7-8efc-7b10b5a64350","resolution":{"observed_at":"2026-08-07T10:35:43.079240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18923","last_updated":"2025-08-13T17:44:18Z","snapshot_observed_at":"2026-08-07T16:40:29.716914Z","submitted_at":"2025-03-24T17:46:09Z","title":"Video SimpleQA: Towards Factuality Evaluation in Large Video Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18923","snapshot_observed_at":"2026-08-07T10:35:43.167178Z","title":"Video simpleqa: Towards factuality evaluation in large video language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:43.167178Z"},"links":{"cited_paper":"/paper/2503.18923","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:66138f5285a7c276d013683cd1ee9ccedec4fa6765136f2eac0ebe20d3457ea0","observation_id":"bef3366d-d986-4a23-ad57-4dd43c100369","resolution":{"observed_at":"2026-08-07T10:35:43.167178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:43.253445Z","title":"Inst-it: Boosting multimodal instance understanding via explicit visual prompt instruction tuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:43.253445Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:0543cf619d5423956715980809947ff4603afa64ece53d5b72729a096fe9d3a1","observation_id":"76b335eb-4e55-4c8a-8f85-d8fcba66c3b4","resolution":{"observed_at":"2026-08-07T10:35:43.253445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:43.336669Z","title":"Lvlm-count: Enhancing the counting ability of large vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:43.336669Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:e3757e79810ca864d4e03c67b19255f779a13f385f89cff08ce8c9bd0858037c","observation_id":"d5dd899c-b52d-40f1-970e-71f55c8f0382","resolution":{"observed_at":"2026-08-07T10:35:43.336669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:54.116530Z","title":"Countgd: Multi-modal open-world counting,","venue":null,"work_id":"cd5557d6-1d25-46bc-b52f-2d5f9c02a50a","year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:43.450268Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:14d29620c8bc5c9234e2b5fc346da8762dd53d36128d4e9898ec270089556a72","observation_id":"2346d8d3-942b-4089-a9a4-0944cc30390e","resolution":{"observed_at":"2026-08-07T10:35:54.198197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:53.903272Z","title":"Mutually-aware feature learning for few-shot object counting,","venue":null,"work_id":"fd81e9e3-d318-4207-b02f-253f182d2c8c","year":2025},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:43.534416Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:7d9b64e2930f2a39c455631fd57e660ca225fc262b633a20b96e92310c39ee4f","observation_id":"2c341945-1a06-40ae-b78b-f6d0eb76d961","resolution":{"observed_at":"2026-08-07T10:35:54.011104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:53.679202Z","title":"Point segment and count: A generalized framework for object counting,","venue":null,"work_id":"ad518e1a-bed9-4015-a913-267ecbe9e846","year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:43.622316Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:9e0325d88cdddd14be6153b5157d8f027b42eb4d67c7caa441bff80bfb9530ae","observation_id":"8c0c95e2-0056-4772-b6f7-f7940a896872","resolution":{"observed_at":"2026-08-07T10:35:53.787828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19707","last_updated":"2025-03-25T14:34:06Z","snapshot_observed_at":"2026-08-07T16:38:11.702011Z","submitted_at":"2025-03-25T14:34:06Z","title":"Mind the Gap: Benchmarking Spatial Reasoning in Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19707","snapshot_observed_at":"2026-08-07T10:35:43.691323Z","title":"Mind the gap: Benchmarking spatial reasoning in vision-language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:43.691323Z"},"links":{"cited_paper":"/paper/2503.19707","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:775d3f4e3953a8e32a32ae629cf582eff82be9f04b6390fab4bcfe83581bab37","observation_id":"0cd3df1a-b09a-4cb4-b3a5-a6eaa402bac7","resolution":{"observed_at":"2026-08-07T10:35:43.691323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:53.515146Z","title":"Tallyqa: Answering complex counting questions,","venue":null,"work_id":"ea30cef6-3296-4866-afe0-7db054336b20","year":2019},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:43.763071Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:a9a89fa91d4e296e568ebadc9a69138ca28d788d6279300562ef48f836394bb0","observation_id":"332a7eb4-7a85-4d22-99b8-daabd9206de5","resolution":{"observed_at":"2026-08-07T10:35:53.589079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:53.354072Z","title":"Counting everyday objects in everyday scenes,","venue":null,"work_id":"68394d44-817a-4251-af35-746884938174","year":2017},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:43.840002Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:89bc02c0e2ff203fe2896108b5bf8ac15f2e7acfdd28e0e3ee7d6cd59ca0478c","observation_id":"ffd9d218-205a-4628-9721-cc2eae846a7c","resolution":{"observed_at":"2026-08-07T10:35:53.434334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:53.135771Z","title":"Pixel-wise crowd understanding via synthetic data,","venue":null,"work_id":"c4c3f3bf-c6a2-4a1c-8ccd-f2aaf4fa9a9f","year":2021},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:43.933217Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:7f7984b9c64bbc135d05b03be03af3e92b8df4e2ecadaef17f0cbbc8b0ce682b","observation_id":"11207b17-0230-4abb-8952-74b945e601ff","resolution":{"observed_at":"2026-08-07T10:35:53.240946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:52.935362Z","title":"Nwpu-moc: a benchmark for fine-grained multicategory object counting in aerial images,","venue":null,"work_id":"f40d564f-54cc-4c3d-b43a-c7b9f1941ec4","year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:44.029175Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:0a841f6b9769d9c104d1a790ba25caee2e2cf4f4ea3fb2e48dc57dbe7fc281cc","observation_id":"2db4891d-c71b-4b55-a394-126750cb2bec","resolution":{"observed_at":"2026-08-07T10:35:53.030822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06048","last_updated":"2024-11-09T03:07:33Z","snapshot_observed_at":"2026-08-10T11:17:09.108844Z","submitted_at":"2024-11-09T03:07:33Z","title":"An Empirical Analysis on Spatial Reasoning Capabilities of Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.06048","snapshot_observed_at":"2026-08-07T10:35:44.119016Z","title":"An empirical analysis on spatial reasoning capabilities of large multimodal models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:44.119016Z"},"links":{"cited_paper":"/paper/2411.06048","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:129adc595e18a922cfaec02a8ee946c70d22d484e8129f98511d8eafae9592bb","observation_id":"0ea5f7f5-25b9-4990-8352-8fe4af0d8431","resolution":{"observed_at":"2026-08-07T10:35:44.119016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01584","last_updated":"2024-10-15T01:16:20Z","snapshot_observed_at":"2026-08-09T16:58:20.916397Z","submitted_at":"2024-06-03T17:59:06Z","title":"SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01584","snapshot_observed_at":"2026-08-07T10:35:44.249542Z","title":"Spatialrgpt: Grounded spatial reasoning in vision language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:44.249542Z"},"links":{"cited_paper":"/paper/2406.01584","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:a8ef715afaf5c3b83f60f919958cecfaa815d16ef36ac757e26b7e27dee506c3","observation_id":"61d2f55d-3e29-4091-92b3-383a5c5938ae","resolution":{"observed_at":"2026-08-07T10:35:44.249542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21259","last_updated":"2025-03-06T03:31:32Z","snapshot_observed_at":"2026-07-06T19:40:57.049203Z","submitted_at":"2024-10-28T17:55:08Z","title":"AutoBench-V: Can Large Vision-Language Models Benchmark Themselves?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21259","snapshot_observed_at":"2026-08-07T10:35:44.349157Z","title":"Autobench-v: Can large vision-language models benchmark themselves?,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:44.349157Z"},"links":{"cited_paper":"/paper/2410.21259","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:a1c8ce1efd8c60aad63dbac633370390f394e240b0ae9c94f73a3deab0865ea7","observation_id":"ef369034-fb0f-4a96-8549-ffb33799306d","resolution":{"observed_at":"2026-08-07T10:35:44.349157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11631","last_updated":"2024-01-21T23:54:05Z","snapshot_observed_at":"2026-08-11T12:00:07.951042Z","submitted_at":"2024-01-21T23:54:05Z","title":"Text-to-Image Cross-Modal Generation: A Systematic Review","version":1},"cited_work":{"arxiv_id":"2401.11631","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.11631","snapshot_observed_at":"2026-08-07T10:35:47.718916Z","title":"Text-to-Image Cross-Modal Generation: A Systematic Review","venue":"cs.CV","work_id":"7ab72ceb-9bf9-4eff-b22e-c92fa193a826","year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:44.443168Z"},"links":{"cited_paper":"/paper/2401.11631","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:05aef948d260a8c76807c4a46dc73963aa23fd017216ca529ef4d7ba425fdb70","observation_id":"823ada39-8eba-41a3-8437-542e6c3aacf1","resolution":{"observed_at":"2026-08-07T10:35:47.774922Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00253","last_updated":"2024-05-06T01:10:01Z","snapshot_observed_at":"2026-08-11T03:31:28.001151Z","submitted_at":"2024-02-01T00:33:21Z","title":"A Survey on Hallucination in Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00253","snapshot_observed_at":"2026-08-07T10:35:44.536971Z","title":"A survey on hallucination in large vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:44.536971Z"},"links":{"cited_paper":"/paper/2402.00253","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:cf3164c0248f26b0a65a19a155865c05001cfe387e6e3bfcd1896cf5c5e81770","observation_id":"89735524-0b96-4f22-8318-7b852d34b7ce","resolution":{"observed_at":"2026-08-07T10:35:44.536971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11775","last_updated":"2025-01-27T06:25:11Z","snapshot_observed_at":"2026-08-07T07:54:21.393889Z","submitted_at":"2024-06-17T17:32:42Z","title":"Task Me Anything","version":2},"cited_work":{"arxiv_id":"2406.11775","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.11775","snapshot_observed_at":"2026-08-07T10:35:47.544677Z","title":"Task Me Anything","venue":"cs.CV","work_id":"4b08a860-3166-48df-9713-31603a28fcbf","year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:44.636749Z"},"links":{"cited_paper":"/paper/2406.11775","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:29aaeae6ce730ce3a4c110ea742e0f03991775d60ef4a434248f173478d4ff94","observation_id":"54da10d8-9089-4e01-a6e2-12d0846bc6e2","resolution":{"observed_at":"2026-08-07T10:35:47.618630Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07012","last_updated":"2024-12-29T03:52:23Z","snapshot_observed_at":"2026-08-10T04:07:09.147209Z","submitted_at":"2024-12-09T21:44:02Z","title":"ProVision: Programmatically Scaling Vision-centric Instruction Data for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07012","snapshot_observed_at":"2026-08-07T10:35:44.712242Z","title":"Provision: Programmatically scaling vision-centric instruction data for multimodal language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:44.712242Z"},"links":{"cited_paper":"/paper/2412.07012","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:00bc2606978d2b02d63219867bed3740ac7a1ce5271743039568b8b0fa68586d","observation_id":"816c111e-c13c-4b08-a45c-7ce7ba3fbb20","resolution":{"observed_at":"2026-08-07T10:35:44.712242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:52.716626Z","title":"A new benchmark: On the utility of synthetic data with blender for bare supervised learning and downstream domain adaptation,","venue":null,"work_id":"8b1a83c1-ef23-4837-a647-bc57de056339","year":2023},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:44.798631Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:2457233b300810c58112918983fd83834bfe5bfdeb8e52b4a98136bc57a8e476","observation_id":"80a0f0c5-2036-4c6f-85be-c78e0e6a84f2","resolution":{"observed_at":"2026-08-07T10:35:52.822487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-07T23:47:53.537198Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13180","snapshot_observed_at":"2026-08-07T10:35:44.870369Z","title":"Perceptionlm: Open-access data and models for detailed visual understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:44.870369Z"},"links":{"cited_paper":"/paper/2504.13180","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:f117c60c96c7e10b37a38a834b903a1e579e1d25e13fabf22faf9400587a6e19","observation_id":"feb10324-1938-47ff-a4ff-fc8f6981218f","resolution":{"observed_at":"2026-08-07T10:35:44.870369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:52.514968Z","title":"A survey of synthetic data augmentation methods in machine vision,","venue":null,"work_id":"1ccb59a1-df57-4ace-82b5-362477ddf003","year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:44.941184Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:fdb2ff031157653e32d583e21787d2aad8373b4f8d6a81861fa345e3b786a195","observation_id":"44e4c400-def7-4953-afee-b2e14ea5c6b2","resolution":{"observed_at":"2026-08-07T10:35:52.600624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16411","last_updated":"2025-01-29T03:52:39Z","snapshot_observed_at":"2026-08-10T13:26:57.540152Z","submitted_at":"2025-01-27T18:59:58Z","title":"PhysBench: Benchmarking and Enhancing Vision-Language Models for Physical World Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16411","snapshot_observed_at":"2026-08-07T10:35:45.016934Z","title":"Physbench: Benchmarking and enhancing vision-language models for physical world understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:45.016934Z"},"links":{"cited_paper":"/paper/2501.16411","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:08fa58f4552b3aa8c80161925af6af0007cf2f2fa400a4c138030004a0398ae6","observation_id":"436010c1-1f0f-436c-b484-c25ccb20e378","resolution":{"observed_at":"2026-08-07T10:35:45.016934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13543","last_updated":"2025-04-01T14:45:22Z","snapshot_observed_at":"2026-08-10T17:42:21.198695Z","submitted_at":"2024-11-20T18:54:32Z","title":"BALROG: Benchmarking Agentic LLM and VLM Reasoning On Games","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13543","snapshot_observed_at":"2026-08-07T10:35:45.109989Z","title":"Balrog: Benchmarking agentic llm and vlm reasoning on games,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:45.109989Z"},"links":{"cited_paper":"/paper/2411.13543","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:bb9277cfbe35bd62514c4ac59a9943221d80e1a7632dd636f09b4e3518dcfc6e","observation_id":"1309fa9b-8503-40c2-9b3a-5df24b3b0822","resolution":{"observed_at":"2026-08-07T10:35:45.109989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:52.353947Z","title":"Mistral small 3.1","venue":null,"work_id":"a567e05e-cf3d-444f-8839-4c3be46afd1b","year":2025},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:45.202319Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:192c789eca3e6cecec3709afc7fadea2241043413b3b6b986512c57778fcbfe5","observation_id":"5777d1c2-26d9-4cd0-a2f6-e16c98c6cd54","resolution":{"observed_at":"2026-08-07T10:35:52.424049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-07T10:35:45.263462Z","title":"Gemma 3 technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:45.263462Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:6c04ea0826bc3122000d00bea1d61186976e1f778293b589ae5c44f6744ff518","observation_id":"86609e18-cab3-47a0-b940-6f4bf3136bd3","resolution":{"observed_at":"2026-08-07T10:35:45.263462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:52.175034Z","title":"Llama 3.2,","venue":null,"work_id":"9df212ff-cca6-439d-bef7-10d2fb7eb7ff","year":2025},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:45.395650Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:d8e71db11542c0509c4d4c2c0040c4985645e37831225eeee2da49bf2d965eeb","observation_id":"9c685f14-5840-4255-8c6e-953948571938","resolution":{"observed_at":"2026-08-07T10:35:52.256547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T10:35:45.491843Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:45.491843Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:b883a7c587eed85a99b36955103915ac0c481ea38531d223ce9b47ca1b43636a","observation_id":"07d4cc45-0d05-423d-9c60-cbc933a7ab9c","resolution":{"observed_at":"2026-08-07T10:35:45.491843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:51.952553Z","title":"Mapping global dynamics of benchmark creation and saturation in artificial intelligence,","venue":null,"work_id":"6d55aba5-dbd8-4c50-957b-ac304dd69a8b","year":2022},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:45.588423Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:ccaf341649e28002398deae8e36e42410dd632a6609a046fa6d42411b2ed9e93","observation_id":"49732c18-27a4-4994-a5ca-36b5f169232d","resolution":{"observed_at":"2026-08-07T10:35:52.093931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12990","last_updated":"2024-11-20T02:38:24Z","snapshot_observed_at":"2026-08-10T19:59:19.704052Z","submitted_at":"2024-11-20T02:38:24Z","title":"BetterBench: Assessing AI Benchmarks, Uncovering Issues, and Establishing Best Practices","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12990","snapshot_observed_at":"2026-08-07T10:35:45.662254Z","title":"Betterbench: Assessing ai benchmarks, uncovering issues, and establishing best practices,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:45.662254Z"},"links":{"cited_paper":"/paper/2411.12990","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:726e0a32b297cc2987d1ed8f6af39cc22e4c1c4d3d1057f67ef49a5943d90c80","observation_id":"ceeea004-4522-4026-a064-3187b96cf508","resolution":{"observed_at":"2026-08-07T10:35:45.662254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:51.699801Z","title":"Hypersim: A photorealistic synthetic dataset for holistic indoor scene understanding,","venue":null,"work_id":"6d319139-1512-45fc-844a-58ffe72bf543","year":2021},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:45.743564Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:695519bd11ea9a71594a1b109c2d7d4fa7fd3e68ebc330b0f285bfd2ee86ad29","observation_id":"3fee4364-e1ed-499b-b648-7b78947c080b","resolution":{"observed_at":"2026-08-07T10:35:51.802884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:51.516056Z","title":"Blenderproc2: A procedural pipeline for photorealistic rendering,","venue":null,"work_id":"98091cd3-688a-4dcc-887b-9c3c06c630c5","year":2023},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:45.839830Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:48309cc5066d00a13ab6c20dfbcbab0d5507edd62685585baa4ae08bb1cc756d","observation_id":"8b25eb22-564f-4091-ae8d-e13710a38801","resolution":{"observed_at":"2026-08-07T10:35:51.622054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:51.314076Z","title":"Chain-of- thought prompting elicits reasoning in large language models,","venue":null,"work_id":"53fd9599-968e-4c60-aa1d-88a86a4564d6","year":2022},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:45.958601Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:f4fbdb63a4fe4c21f37d77bc0290c38c18c40aaff4627e1240f2a2f10e2dd570","observation_id":"b47f366a-5f70-4f68-9b28-f2a57c844510","resolution":{"observed_at":"2026-08-07T10:35:51.403411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:51.139454Z","title":null,"venue":null,"work_id":"929c2044-19ac-464f-9437-9a7c930bd234","year":null},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:46.051142Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:d490c7b8e70fb1cc5dae93cfb4b32d7558a552ad41c7714d4592382ce30deedf","observation_id":"e72e3bfb-d623-4c35-b677-bf78f7bfb926","resolution":{"observed_at":"2026-08-07T10:35:51.221846Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:50.919264Z","title":null,"venue":null,"work_id":"58d2c27a-2fd9-4138-a592-0b49b034132f","year":null},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:46.151798Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:32a3b5648b0d6a970922f3120c2cd202cd6e1372aae7e3a32a813a559b38c9b8","observation_id":"74083242-191c-457c-b57f-e3e08d747067","resolution":{"observed_at":"2026-08-07T10:35:51.026369Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:50.711550Z","title":null,"venue":null,"work_id":"ab251215-400b-40ce-8e9e-ecacc7ebc95a","year":null},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:46.265895Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:acf289851ab048affc88ef7e6c07b4546a78657e753850ea5cb0205d36e697c2","observation_id":"52fbb103-68ee-4980-9796-5c2d496162a2","resolution":{"observed_at":"2026-08-07T10:35:50.802898Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:50.336721Z","title":null,"venue":null,"work_id":"39d18b7d-9de2-44a7-a355-7430093df0c7","year":null},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:46.352110Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:3bcff9e303d30460916672c98d5a2da9df4260a49c23b3bb0b70ebd257c0212a","observation_id":"f7d78d32-2fb2-447f-abca-f06843419468","resolution":{"observed_at":"2026-08-07T10:35:50.596450Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:49.861146Z","title":"The number of pieces in the image is:","venue":null,"work_id":"da35c02e-cf3f-424d-b3ee-4a0bcfd5a1c7","year":null},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:46.462367Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:09319c801808cd29d51707b7226de84e7a9c5033abee3438d29ebd79885b3778","observation_id":"85f99d90-d911-4c2e-a058-9c655de839cb","resolution":{"observed_at":"2026-08-07T10:35:50.084264Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:49.581577Z","title":null,"venue":null,"work_id":"6262fbfb-8d1d-4c7d-990a-37e725a53d56","year":null},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:46.555286Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:9baea1709d298e10cc8b991092220f07da781b8cd1d73959a2dd48a61f720751","observation_id":"ad7a809f-4d1f-4aa6-afa6-b115628456b3","resolution":{"observed_at":"2026-08-07T10:35:49.717958Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:49.360861Z","title":null,"venue":null,"work_id":"cf73414a-0e4d-4952-b0f6-31765b2555aa","year":null},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:46.700401Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:25cb375b94bf391e79198cc65d545ad36f0805a13a290fa8a6607fd765370735","observation_id":"c18c16d5-c1fa-4e08-93e7-5c39fb09c8e0","resolution":{"observed_at":"2026-08-07T10:35:49.437797Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:49.197749Z","title":null,"venue":null,"work_id":"b41e64be-a3ff-4332-a362-b2176564e00a","year":null},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:46.780680Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:e6bbedbcc2ab4c737aea3cb5476ad0e5ec64095fafa654efa07ff43f199f4b73","observation_id":"35149dde-52d6-4daf-ba1f-4fd8c8821565","resolution":{"observed_at":"2026-08-07T10:35:49.271660Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:49.035610Z","title":null,"venue":null,"work_id":"78d2f9f8-d0a9-497d-b0f3-74c07bb7f639","year":null},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:46.867764Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:8e99a571d3770f15c0373adba62ed13c794ff7fe6132d1d31acb475ecb47dd92","observation_id":"043c2210-f07d-4cd5-ab43-a5debabaae8e","resolution":{"observed_at":"2026-08-07T10:35:49.101727Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:48.854632Z","title":"base_pile_config","venue":null,"work_id":"7108b422-d949-4fe4-8b62-db54f23ae4ef","year":null},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:46.962466Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:1daa10dc3cdc70ccab7d38a2907d0045212c583d82cfaca523d9dd59327bff48","observation_id":"203d8c50-9dde-4cfd-95cc-7b73e850ef25","resolution":{"observed_at":"2026-08-07T10:35:48.957617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:48.660907Z","title":null,"venue":null,"work_id":"0b645b58-f5eb-46ef-b9a6-8f88d9bb2da7","year":null},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:47.032695Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:537d45aa13a2b0fe419ec5573be82f92683f134556314242f63d2196c2a1f1f8","observation_id":"c8be7de6-96ee-4304-bf8a-6d2b47a710e5","resolution":{"observed_at":"2026-08-07T10:35:48.729607Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:48.471669Z","title":null,"venue":null,"work_id":"b0f9a994-9fa0-4734-9cd3-b0be1755e230","year":null},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:47.126972Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:976e71e910df2eab6556fa94f1f78a9f80eeb40c018b17edb3bd821469f08230","observation_id":"dfdb1b10-7a28-4e95-a9da-2ef007d99477","resolution":{"observed_at":"2026-08-07T10:35:48.560472Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:48.312664Z","title":null,"venue":null,"work_id":"979655fd-9b81-4ff7-aa5c-27345b3b090c","year":null},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:47.228549Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:c05bf06fd8e3610f76bb2b6c0c81aa2926329c600c51984c87cb38f889b3b338","observation_id":"b00bbe77-9d72-47ef-9626-39c7706fe46f","resolution":{"observed_at":"2026-08-07T10:35:48.380569Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:48.168405Z","title":null,"venue":null,"work_id":"2da2b814-67de-45f2-ab56-45eb961bb6e8","year":null},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:47.354401Z"},"links":{"citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:45719374b4fc44141cf47c227c087ae75c2e13e1f6bcb60926e8ffb6eeca9476","observation_id":"2ecdd454-bcc9-4298-aa46-4a2174b5754a","resolution":{"observed_at":"2026-08-07T10:35:48.221264Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models"},"reference_resolution":{"displayed":74,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":2,"verified_fuzzy":29},"total_outbound_references":74},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 74 of 74 outbound references and 0 inbound Pith citation observations for arXiv:2506.05440."}