{"as_of":"2026-08-10T04:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9fbd9afe9b45a23d748426656b4b085e4aa700976efc83f6d5391c962531783b","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:41:13.655335Z","state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T04:01:48.251493Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T18:33:50.200070Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.13405","last_updated":"2025-07-17T04:47:47Z","snapshot_observed_at":"2026-08-09T07:59:53.314166Z","submitted_at":"2025-07-17T04:47:47Z","title":"COREVQA: A Crowd Observation and Reasoning Entailment Visual Question Answering Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13405","snapshot_observed_at":"2026-08-03T04:01:48.251493Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.06223","last_updated":"2026-07-08T21:07:11Z","snapshot_observed_at":"2026-08-08T17:56:58.097991Z","submitted_at":"2026-02-05T22:01:50Z","title":"Scaling Mobile Chaos Testing with AI-Driven Test Execution","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T04:01:48.251493Z"},"links":{"cited_paper":"/paper/2507.13405","citing_paper":"/paper/2602.06223"},"observation_digest":"sha256:163830bbfd3a4296494a5f2adf8c073273a1282e2730ab0dd0311e6276aff0b5","observation_id":"4340bbb5-e9ee-4e65-a263-2a16a363cfbe","resolution":{"observed_at":"2026-08-03T04:01:48.251493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13405","last_updated":"2025-07-17T04:47:47Z","snapshot_observed_at":"2026-08-09T07:59:53.314166Z","submitted_at":"2025-07-17T04:47:47Z","title":"COREVQA: A Crowd Observation and Reasoning Entailment Visual Question Answering Benchmark","version":1},"cited_work":{"arxiv_id":"2507.13405","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.13405","snapshot_observed_at":"2026-06-29T18:33:50.200070Z","title":"Alexis Conneau, Kartikay Khandelwal, Naman Goyal, Vishrav Chaudhary, Guillaume Wenzek, Francisco Guzmán, Edouard Grave, Myle Ott, Luke Zettle- moyer, and Veselin Stoyanov","venue":null,"work_id":"dcd3d1bf-4b59-4487-b738-e6e6a3e7c198","year":null},"citing_paper":{"arxiv_id":"2605.26601","last_updated":"2026-05-26T06:36:27Z","snapshot_observed_at":"2026-07-06T23:36:25.432687Z","submitted_at":"2026-05-26T06:36:27Z","title":"FTibSuite: A Comprehensive Resource Suite for Tibetan Vision-Language Modeling","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T18:32:41.348880Z"},"links":{"cited_paper":"/paper/2507.13405","citing_paper":"/paper/2605.26601"},"observation_digest":"sha256:536e90a7784562b4e95e7ab1b8fce36a69eeb96d998452b9a6b55ffe4c3fb15e","observation_id":"b651095a-580d-412d-a407-a5cb8419b22e","resolution":{"observed_at":"2026-06-29T18:33:50.201757Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.13405/citation-record","integrity":"/paper/2507.13405/integrity","json":"/paper/2507.13405/citation-record.json","paper":"/paper/2507.13405"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T16:41:12.166689Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13405","last_updated":"2025-07-17T04:47:47Z","snapshot_observed_at":"2026-08-09T07:59:53.314166Z","submitted_at":"2025-07-17T04:47:47Z","title":"COREVQA: A Crowd Observation and Reasoning Entailment Visual Question Answering Benchmark","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:12.166689Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.13405"},"observation_digest":"sha256:132935d11345275d569baa6e198391d066c61bbffd6956794d6866f79c4092e2","observation_id":"9ecf877d-c8c4-4b1a-8c1f-99a4d8bd3e9c","resolution":{"observed_at":"2026-08-06T16:41:12.166689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-06T16:41:12.409602Z","title":"Janus-pro: Unified multimodal understand- ing and generation with data and model scaling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13405","last_updated":"2025-07-17T04:47:47Z","snapshot_observed_at":"2026-08-09T07:59:53.314166Z","submitted_at":"2025-07-17T04:47:47Z","title":"COREVQA: A Crowd Observation and Reasoning Entailment Visual Question Answering Benchmark","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:12.409602Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2507.13405"},"observation_digest":"sha256:e00538a687a32aef01c2052c93b4b5867227e4777c8bddc134f1c4186b875e72","observation_id":"39f49f9f-7fe3-4f23-afa7-7c5ebae49050","resolution":{"observed_at":"2026-08-06T16:41:12.409602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14669","last_updated":"2025-06-10T09:47:04Z","snapshot_observed_at":"2026-07-06T19:36:05.879892Z","submitted_at":"2024-10-18T17:58:21Z","title":"NaturalBench: Evaluating Vision-Language Models on Natural Adversarial Samples","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14669","snapshot_observed_at":"2026-08-06T16:41:12.639417Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13405","last_updated":"2025-07-17T04:47:47Z","snapshot_observed_at":"2026-08-09T07:59:53.314166Z","submitted_at":"2025-07-17T04:47:47Z","title":"COREVQA: A Crowd Observation and Reasoning Entailment Visual Question Answering Benchmark","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:12.639417Z"},"links":{"cited_paper":"/paper/2410.14669","citing_paper":"/paper/2507.13405"},"observation_digest":"sha256:54c1881661446d006ef9b560a74d713c6f935ee35c69175c368211bceeed7fc4","observation_id":"284bbb27-812a-4401-b4af-d444e8cf7cde","resolution":{"observed_at":"2026-08-06T16:41:12.639417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02189","last_updated":"2025-04-06T03:12:51Z","snapshot_observed_at":"2026-07-06T20:16:27.318761Z","submitted_at":"2025-01-04T04:59:33Z","title":"A Survey of State of the Art Large Vision Language Models: Alignment, Benchmark, Evaluations and Challenges","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02189","snapshot_observed_at":"2026-08-06T16:41:12.716870Z","title":"Bench- mark evaluations, applications, and challenges of large vision language models: A survey","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13405","last_updated":"2025-07-17T04:47:47Z","snapshot_observed_at":"2026-08-09T07:59:53.314166Z","submitted_at":"2025-07-17T04:47:47Z","title":"COREVQA: A Crowd Observation and Reasoning Entailment Visual Question Answering Benchmark","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:12.716870Z"},"links":{"cited_paper":"/paper/2501.02189","citing_paper":"/paper/2507.13405"},"observation_digest":"sha256:67938c13eec42a2afd240df4b58659c7ed7d5e37c2f092a171fa5888ce1fa19f","observation_id":"bad059c7-b2ee-4e1c-ab95-768d91d5a10d","resolution":{"observed_at":"2026-08-06T16:41:12.716870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:14.713128Z","title":null,"venue":null,"work_id":"7927b98d-8ce4-47d7-8007-1e4f16975f1e","year":2024},"citing_paper":{"arxiv_id":"2507.13405","last_updated":"2025-07-17T04:47:47Z","snapshot_observed_at":"2026-08-09T07:59:53.314166Z","submitted_at":"2025-07-17T04:47:47Z","title":"COREVQA: A Crowd Observation and Reasoning Entailment Visual Question Answering Benchmark","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:12.809200Z"},"links":{"citing_paper":"/paper/2507.13405"},"observation_digest":"sha256:52db055b182d1d235e137c7735eb8bf1882f63841a985b6241a401d5c54b620c","observation_id":"1720286c-ee3f-4044-bbb9-3943b9585fb8","resolution":{"observed_at":"2026-08-06T16:41:14.859133Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10380","last_updated":"2025-04-01T17:25:53Z","snapshot_observed_at":"2026-08-09T20:13:08.253197Z","submitted_at":"2024-07-15T01:21:56Z","title":"NTSEBENCH: Cognitive Reasoning Benchmark for Vision Language Models","version":3},"cited_work":{"arxiv_id":"2407.10380","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.10380","snapshot_observed_at":"2026-08-06T16:41:14.084744Z","title":"NTSEBENCH: Cognitive Reasoning Benchmark for Vision Language Models","venue":"cs.CV","work_id":"eb0bc349-ab0a-4f68-b0b8-6e2931a6d45d","year":2024},"citing_paper":{"arxiv_id":"2507.13405","last_updated":"2025-07-17T04:47:47Z","snapshot_observed_at":"2026-08-09T07:59:53.314166Z","submitted_at":"2025-07-17T04:47:47Z","title":"COREVQA: A Crowd Observation and Reasoning Entailment Visual Question Answering Benchmark","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:12.884118Z"},"links":{"cited_paper":"/paper/2407.10380","citing_paper":"/paper/2507.13405"},"observation_digest":"sha256:84b0968a9d0b62ab4f10008832c0fb9c58b08864cd4e49fe2f5605e19693cf6c","observation_id":"66eaf9cf-7123-4b91-bd8d-f881b07038ea","resolution":{"observed_at":"2026-08-06T16:41:14.160149Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.07566","last_updated":"2022-03-14T15:08:08Z","snapshot_observed_at":"2026-08-09T16:57:52.860988Z","submitted_at":"2021-12-14T17:15:04Z","title":"VALSE: A Task-Independent Benchmark for Vision and Language Models Centered on Linguistic Phenomena","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.07566","snapshot_observed_at":"2026-08-06T16:41:13.007547Z","title":"Valse: A task-independent bench- mark for vision and language models centered on lin- guistic phenomena","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13405","last_updated":"2025-07-17T04:47:47Z","snapshot_observed_at":"2026-08-09T07:59:53.314166Z","submitted_at":"2025-07-17T04:47:47Z","title":"COREVQA: A Crowd Observation and Reasoning Entailment Visual Question Answering Benchmark","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:13.007547Z"},"links":{"cited_paper":"/paper/2112.07566","citing_paper":"/paper/2507.13405"},"observation_digest":"sha256:4a681cd91e16a0d71cb11bdcb696412a523de60fe38325e82e722716bcd3df59","observation_id":"aeac34aa-ad93-4f30-a0da-a40b4b5066b8","resolution":{"observed_at":"2026-08-06T16:41:13.007547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.00123","last_updated":"2018-04-30T22:49:54Z","snapshot_observed_at":"2026-07-06T06:36:33.930118Z","submitted_at":"2018-04-30T22:49:54Z","title":"CrowdHuman: A Benchmark for Detecting Human in a Crowd","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.00123","snapshot_observed_at":"2026-08-06T16:41:13.138030Z","title":"Crowdhuman: A benchmark for detecting human in a crowd","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13405","last_updated":"2025-07-17T04:47:47Z","snapshot_observed_at":"2026-08-09T07:59:53.314166Z","submitted_at":"2025-07-17T04:47:47Z","title":"COREVQA: A Crowd Observation and Reasoning Entailment Visual Question Answering Benchmark","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:13.138030Z"},"links":{"cited_paper":"/paper/1805.00123","citing_paper":"/paper/2507.13405"},"observation_digest":"sha256:ab057782b93996fc86342353c52c3f7f493c2128dac91c61bf121349a6303837","observation_id":"13202050-d695-432d-b7a4-79bdccf119ae","resolution":{"observed_at":"2026-08-06T16:41:13.138030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.06706","last_updated":"2019-01-20T17:55:05Z","snapshot_observed_at":"2026-08-08T23:17:13.003005Z","submitted_at":"2019-01-20T17:55:05Z","title":"Visual Entailment: A Novel Task for Fine-Grained Image Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.06706","snapshot_observed_at":"2026-08-06T16:41:13.278562Z","title":"Nwpu-crowd: A large-scale benchmark for crowd counting and localiza- tion","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2507.13405","last_updated":"2025-07-17T04:47:47Z","snapshot_observed_at":"2026-08-09T07:59:53.314166Z","submitted_at":"2025-07-17T04:47:47Z","title":"COREVQA: A Crowd Observation and Reasoning Entailment Visual Question Answering Benchmark","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:13.278562Z"},"links":{"cited_paper":"/paper/1901.06706","citing_paper":"/paper/2507.13405"},"observation_digest":"sha256:9ba72b09c0ac2c5ad2378afcf3090b068a6fdc8cb3dccf006d2029feb3b42212","observation_id":"f3215973-2793-40bc-82db-132191999531","resolution":{"observed_at":"2026-08-06T16:41:13.278562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16006","last_updated":"2024-04-24T17:37:05Z","snapshot_observed_at":"2026-07-06T18:05:03.284784Z","submitted_at":"2024-04-24T17:37:05Z","title":"MMT-Bench: A Comprehensive Multimodal Benchmark for Evaluating Large Vision-Language Models Towards Multitask AGI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16006","snapshot_observed_at":"2026-08-06T16:41:13.357316Z","title":"Mmt- bench: A comprehensive multimodal benchmark for eval- uating large vision-language models towards multitask agi","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13405","last_updated":"2025-07-17T04:47:47Z","snapshot_observed_at":"2026-08-09T07:59:53.314166Z","submitted_at":"2025-07-17T04:47:47Z","title":"COREVQA: A Crowd Observation and Reasoning Entailment Visual Question Answering Benchmark","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:13.357316Z"},"links":{"cited_paper":"/paper/2404.16006","citing_paper":"/paper/2507.13405"},"observation_digest":"sha256:3b69eeebb12342ebc355515df54dd8c7ffe2817af4fb1d7c20db1504c1098c17","observation_id":"49b1b18b-a872-47ff-8655-2e2f8a63c8c1","resolution":{"observed_at":"2026-08-06T16:41:13.357316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-08T03:31:37.699253Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-06T16:41:13.436572Z","title":"Mm-vet: Evaluating large multi- modal models for integrated capabilities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13405","last_updated":"2025-07-17T04:47:47Z","snapshot_observed_at":"2026-08-09T07:59:53.314166Z","submitted_at":"2025-07-17T04:47:47Z","title":"COREVQA: A Crowd Observation and Reasoning Entailment Visual Question Answering Benchmark","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:13.436572Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2507.13405"},"observation_digest":"sha256:c793fea84cb7654350aa463232c7079b934df92693eb62036bbfbd171629d2b7","observation_id":"3cb4cf62-8367-4010-a1de-5c6103ea2db4","resolution":{"observed_at":"2026-08-06T16:41:13.436572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-06T16:41:13.513227Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13405","last_updated":"2025-07-17T04:47:47Z","snapshot_observed_at":"2026-08-09T07:59:53.314166Z","submitted_at":"2025-07-17T04:47:47Z","title":"COREVQA: A Crowd Observation and Reasoning Entailment Visual Question Answering Benchmark","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:13.513227Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2507.13405"},"observation_digest":"sha256:296bbfa2caab6ae3118d36867ed1ede8123d296f147627991cbb4452e1325627","observation_id":"f0c63bf0-9da3-404b-a112-d41aa3f3a32e","resolution":{"observed_at":"2026-08-06T16:41:13.513227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:14.552555Z","title":"When in doubt, use more conserva- tive qualifiers","venue":null,"work_id":"006d995b-67ec-40c7-ab9f-b8abb9267759","year":2024},"citing_paper":{"arxiv_id":"2507.13405","last_updated":"2025-07-17T04:47:47Z","snapshot_observed_at":"2026-08-09T07:59:53.314166Z","submitted_at":"2025-07-17T04:47:47Z","title":"COREVQA: A Crowd Observation and Reasoning Entailment Visual Question Answering Benchmark","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:13.590449Z"},"links":{"citing_paper":"/paper/2507.13405"},"observation_digest":"sha256:2b631651e05dbd96c32149ff71480630d334a64fce2f813fab5b164f0b6fb57e","observation_id":"09201af8-cbf8-45e1-bfca-4b3e0b1d79d0","resolution":{"observed_at":"2026-08-06T16:41:14.620596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:14.392599Z","title":"COREVQA requires models to perform multi-step verification by decomposing complex claims and meticu- lously verifying each component against visual evidence","venue":null,"work_id":"88527e56-b528-4d62-8eef-8a4fdb9b1c02","year":2019},"citing_paper":{"arxiv_id":"2507.13405","last_updated":"2025-07-17T04:47:47Z","snapshot_observed_at":"2026-08-09T07:59:53.314166Z","submitted_at":"2025-07-17T04:47:47Z","title":"COREVQA: A Crowd Observation and Reasoning Entailment Visual Question Answering Benchmark","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:13.655335Z"},"links":{"citing_paper":"/paper/2507.13405"},"observation_digest":"sha256:8d6573d784f26591b3c36ca62d99021e2325d240524911e02cfe50be5d0f768f","observation_id":"28ff9e58-16a6-4a6a-beb9-2db731eed007","resolution":{"observed_at":"2026-08-06T16:41:14.459868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12483","last_updated":"2024-06-07T23:11:14Z","snapshot_observed_at":"2026-08-09T14:35:23.326295Z","submitted_at":"2024-02-19T19:38:58Z","title":"Artifacts or Abduction: How Do LLMs Answer Multiple-Choice Questions Without the Question?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12483","snapshot_observed_at":"2026-08-06T16:41:12.234673Z","title":"Ar- tifacts or abduction: How do llms answer multiple- choice questions without the question? arXiv preprint arXiv:2402.12483,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13405","last_updated":"2025-07-17T04:47:47Z","snapshot_observed_at":"2026-08-09T07:59:53.314166Z","submitted_at":"2025-07-17T04:47:47Z","title":"COREVQA: A Crowd Observation and Reasoning Entailment Visual Question Answering Benchmark","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:12.234673Z"},"links":{"cited_paper":"/paper/2402.12483","citing_paper":"/paper/2507.13405"},"observation_digest":"sha256:26bf021420dc11b00e6e1b0581887e8124df9a7712fd066a023555cfac06f9de","observation_id":"94ee7c5c-6f97-4031-9c8b-b618516ea93f","resolution":{"observed_at":"2026-08-06T16:41:12.234673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05343","last_updated":"2024-06-14T08:35:06Z","snapshot_observed_at":"2026-07-06T18:27:28.886692Z","submitted_at":"2024-06-08T04:07:09Z","title":"M3GIA: A Cognition Inspired Multilingual and Multimodal General Intelligence Ability Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05343","snapshot_observed_at":"2026-08-06T16:41:13.203791Z","title":"M3gia: A cognition inspired multilingual and multimodal general intelligence ability benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13405","last_updated":"2025-07-17T04:47:47Z","snapshot_observed_at":"2026-08-09T07:59:53.314166Z","submitted_at":"2025-07-17T04:47:47Z","title":"COREVQA: A Crowd Observation and Reasoning Entailment Visual Question Answering Benchmark","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:13.203791Z"},"links":{"cited_paper":"/paper/2406.05343","citing_paper":"/paper/2507.13405"},"observation_digest":"sha256:e0fb132749fc1a2573c794e0411fa64f56c288c3af78f14af7dcf12fa3257091","observation_id":"01a7d63e-f7dd-4c42-8484-267f692b0260","resolution":{"observed_at":"2026-08-06T16:41:13.203791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.11361","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:13.918486Z","title":"R., Bashir, S","venue":null,"work_id":"be7e7864-cae4-48b2-91db-d870dc685c7d","year":null},"citing_paper":{"arxiv_id":"2507.13405","last_updated":"2025-07-17T04:47:47Z","snapshot_observed_at":"2026-08-09T07:59:53.314166Z","submitted_at":"2025-07-17T04:47:47Z","title":"COREVQA: A Crowd Observation and Reasoning Entailment Visual Question Answering Benchmark","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:13.076746Z"},"links":{"citing_paper":"/paper/2507.13405"},"observation_digest":"sha256:cfca878f3790b00e0821a2fef22999c91d497f7d11383737150111c349dc73a8","observation_id":"8c717dd3-edca-4384-b167-0a529f19c289","resolution":{"observed_at":"2026-08-06T16:41:13.982818Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-06T16:41:12.553911Z","title":"Seed-bench: Benchmarking multimodal llms with gener- ative comprehension","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13405","last_updated":"2025-07-17T04:47:47Z","snapshot_observed_at":"2026-08-09T07:59:53.314166Z","submitted_at":"2025-07-17T04:47:47Z","title":"COREVQA: A Crowd Observation and Reasoning Entailment Visual Question Answering Benchmark","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:12.553911Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2507.13405"},"observation_digest":"sha256:606285d45ea20debd62f2d1bb90ab59ab9d841d78bb958f8fdd7dc5317cf9d8c","observation_id":"3d466147-a3f3-4582-81cc-cf2bfb5d755d","resolution":{"observed_at":"2026-08-06T16:41:12.553911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-06T16:41:12.321982Z","title":"Are we on the right way for evaluating large vision-language models? arXiv preprint arXiv:2403.20330,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13405","last_updated":"2025-07-17T04:47:47Z","snapshot_observed_at":"2026-08-09T07:59:53.314166Z","submitted_at":"2025-07-17T04:47:47Z","title":"COREVQA: A Crowd Observation and Reasoning Entailment Visual Question Answering Benchmark","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:12.321982Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2507.13405"},"observation_digest":"sha256:6b3a40eb3f7be06b6b77f8ab39cb49dcae8b948c3a86f8f9f56874241a58e2db","observation_id":"97e4749f-3741-47c9-840e-643562c7864e","resolution":{"observed_at":"2026-08-06T16:41:12.321982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15296","last_updated":"2024-12-08T04:24:31Z","snapshot_observed_at":"2026-08-07T09:14:56.498818Z","submitted_at":"2024-11-22T18:59:54Z","title":"MME-Survey: A Comprehensive Survey on Evaluation of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15296","snapshot_observed_at":"2026-08-06T16:41:12.474596Z","title":"Mme-survey: A comprehensive survey on evaluation of multimodal llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13405","last_updated":"2025-07-17T04:47:47Z","snapshot_observed_at":"2026-08-09T07:59:53.314166Z","submitted_at":"2025-07-17T04:47:47Z","title":"COREVQA: A Crowd Observation and Reasoning Entailment Visual Question Answering Benchmark","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:12.474596Z"},"links":{"cited_paper":"/paper/2411.15296","citing_paper":"/paper/2507.13405"},"observation_digest":"sha256:68ce1d81e7d0c663046f9928fa3079f14b04b97ab6a4fd3b835e5c8a972a4a39","observation_id":"b305033a-7bc9-47a0-86da-c716cee83a57","resolution":{"observed_at":"2026-08-06T16:41:12.474596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.13405","last_updated":"2025-07-17T04:47:47Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T07:59:53.314166Z","submitted_at":"2025-07-17T04:47:47Z","title":"COREVQA: A Crowd Observation and Reasoning Entailment Visual Question Answering Benchmark"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":16,"verified_exact":1,"verified_fuzzy":2},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 2 inbound Pith citation observations for arXiv:2507.13405."}