{"as_of":"2026-08-11T14:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:eac7b8aff695007c21ca765e129137569c4a81638e32e6c90bfe61a448f5b6bc","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T19:51:25.887796Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.09672/citation-record","integrity":"/paper/2501.09672/integrity","json":"/paper/2501.09672/citation-record.json","paper":"/paper/2501.09672"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:51:25.601135Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.09672","last_updated":"2025-08-05T04:04:22Z","snapshot_observed_at":"2026-08-10T19:44:01.944297Z","submitted_at":"2025-01-16T17:08:12Z","title":"CHIRP: A Fine-Grained Benchmark for Open-Ended Response Evaluation in Vision-Language Models","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T19:51:25.601135Z"},"links":{"citing_paper":"/paper/2501.09672"},"observation_digest":"sha256:b97d7f2265e9c8d4a1e7c5403623ce593aca437e8078fc0c463481b8a310cc9e","observation_id":"8c55e834-d644-4453-8609-4029da6d3356","resolution":{"observed_at":"2026-08-10T19:51:25.601135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:51:25.609109Z","title":"Scaling laws for generative mixed-modal language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09672","last_updated":"2025-08-05T04:04:22Z","snapshot_observed_at":"2026-08-10T19:44:01.944297Z","submitted_at":"2025-01-16T17:08:12Z","title":"CHIRP: A Fine-Grained Benchmark for Open-Ended Response Evaluation in Vision-Language Models","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T19:51:25.609109Z"},"links":{"citing_paper":"/paper/2501.09672"},"observation_digest":"sha256:25683ec4ffd1ed67a0df5512c23c6f41e00ed8710996fd4d44d39defcb5ec9ed","observation_id":"e5e8a8d6-36d6-4fbd-932d-ce30f36737e1","resolution":{"observed_at":"2026-08-10T19:51:25.609109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:51:27.085596Z","title":"Lawrence Zitnick, Dhruv Batra, and Devi Parikh","venue":null,"work_id":"cb636087-818b-420a-a58f-a34fb0064686","year":2016},"citing_paper":{"arxiv_id":"2501.09672","last_updated":"2025-08-05T04:04:22Z","snapshot_observed_at":"2026-08-10T19:44:01.944297Z","submitted_at":"2025-01-16T17:08:12Z","title":"CHIRP: A Fine-Grained Benchmark for Open-Ended Response Evaluation in Vision-Language Models","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T19:51:25.614692Z"},"links":{"citing_paper":"/paper/2501.09672"},"observation_digest":"sha256:498a5f9613b805545b7c84adca81915f202eef818e9c4dfdb36b9ad33c71edef","observation_id":"965ccf86-cf63-490a-897b-12180214a7c0","resolution":{"observed_at":"2026-08-10T19:51:27.092949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:51:27.059859Z","title":"Pythia: A suite for analyzing large language models across training and scaling","venue":null,"work_id":"0cd62f85-e487-4020-a9e3-e1edcef6e65c","year":2023},"citing_paper":{"arxiv_id":"2501.09672","last_updated":"2025-08-05T04:04:22Z","snapshot_observed_at":"2026-08-10T19:44:01.944297Z","submitted_at":"2025-01-16T17:08:12Z","title":"CHIRP: A Fine-Grained Benchmark for Open-Ended Response Evaluation in Vision-Language Models","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T19:51:25.626791Z"},"links":{"citing_paper":"/paper/2501.09672"},"observation_digest":"sha256:df539a4cdd71d46888be11d6e10f150e9fc570e27f56f7fda91c71312a3ac2a9","observation_id":"6d0c078c-27ad-407d-a6ed-4e6ece8b1d9c","resolution":{"observed_at":"2026-08-10T19:51:27.070866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.06794","last_updated":"2023-06-05T17:55:12Z","snapshot_observed_at":"2026-08-10T09:03:43.940864Z","submitted_at":"2022-09-14T17:24:07Z","title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.06794","snapshot_observed_at":"2026-08-10T19:51:25.633642Z","title":"Pali: A jointly-scaled multilingual language-image model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.09672","last_updated":"2025-08-05T04:04:22Z","snapshot_observed_at":"2026-08-10T19:44:01.944297Z","submitted_at":"2025-01-16T17:08:12Z","title":"CHIRP: A Fine-Grained Benchmark for Open-Ended Response Evaluation in Vision-Language Models","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T19:51:25.633642Z"},"links":{"cited_paper":"/paper/2209.06794","citing_paper":"/paper/2501.09672"},"observation_digest":"sha256:5fa86398a78027955d985b977a77e6272b53b713ee52b2cd14c0e21f56ff66bc","observation_id":"c1e84e37-393c-4d22-8f32-ba5994008391","resolution":{"observed_at":"2026-08-10T19:51:25.633642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:51:27.005806Z","title":"Reproducible scaling laws for contrastive language-image learning","venue":null,"work_id":"79231683-0916-4ed0-9751-9a2944301667","year":2023},"citing_paper":{"arxiv_id":"2501.09672","last_updated":"2025-08-05T04:04:22Z","snapshot_observed_at":"2026-08-10T19:44:01.944297Z","submitted_at":"2025-01-16T17:08:12Z","title":"CHIRP: A Fine-Grained Benchmark for Open-Ended Response Evaluation in Vision-Language Models","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T19:51:25.639573Z"},"links":{"citing_paper":"/paper/2501.09672"},"observation_digest":"sha256:dca090edcc8b0d76220a16159611dc9d50a681d92934809c921b8ec635025ab6","observation_id":"4a69c8f5-4d07-41d0-a6df-3c0be1f202f7","resolution":{"observed_at":"2026-08-10T19:51:27.024753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:51:25.645192Z","title":"A coefficient of agreement for nominal scales","venue":null,"work_id":null,"year":1960},"citing_paper":{"arxiv_id":"2501.09672","last_updated":"2025-08-05T04:04:22Z","snapshot_observed_at":"2026-08-10T19:44:01.944297Z","submitted_at":"2025-01-16T17:08:12Z","title":"CHIRP: A Fine-Grained Benchmark for Open-Ended Response Evaluation in Vision-Language Models","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T19:51:25.645192Z"},"links":{"citing_paper":"/paper/2501.09672"},"observation_digest":"sha256:6074f92c40ff76cc554076a8b4cfb255090eafde89684dff4e33f1e0eefe133a","observation_id":"071960fb-a29d-496e-8816-80874bbf38f9","resolution":{"observed_at":"2026-08-10T19:51:25.645192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:51:26.976388Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":"904eac45-ebdc-4538-8815-bd12e434cdc9","year":2017},"citing_paper":{"arxiv_id":"2501.09672","last_updated":"2025-08-05T04:04:22Z","snapshot_observed_at":"2026-08-10T19:44:01.944297Z","submitted_at":"2025-01-16T17:08:12Z","title":"CHIRP: A Fine-Grained Benchmark for Open-Ended Response Evaluation in Vision-Language Models","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T19:51:25.659470Z"},"links":{"citing_paper":"/paper/2501.09672"},"observation_digest":"sha256:f801c89961f24341d06d185423202ddf569ec47f1aca317a8028af8a299b9c98","observation_id":"988c5c71-494e-4961-830f-8d3f9587a9b7","resolution":{"observed_at":"2026-08-10T19:51:26.985702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:51:26.953766Z","title":"Sugarcrepe: Fixing hackable benchmarks for vision-language compositionality","venue":null,"work_id":"65528f14-0554-49d3-b09f-05f2d9d0028e","year":2024},"citing_paper":{"arxiv_id":"2501.09672","last_updated":"2025-08-05T04:04:22Z","snapshot_observed_at":"2026-08-10T19:44:01.944297Z","submitted_at":"2025-01-16T17:08:12Z","title":"CHIRP: A Fine-Grained Benchmark for Open-Ended Response Evaluation in Vision-Language Models","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T19:51:25.665895Z"},"links":{"citing_paper":"/paper/2501.09672"},"observation_digest":"sha256:27d888f8d2ed21e5ae2d884f5fd6951c5dbb5e477139636d6647e06af19781f9","observation_id":"c6eb6c26-6232-4cd0-9d38-a5c1ee17599a","resolution":{"observed_at":"2026-08-10T19:51:26.963085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:51:26.916490Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":"0a1b50a8-c95e-486c-a085-ee61615a32d4","year":2021},"citing_paper":{"arxiv_id":"2501.09672","last_updated":"2025-08-05T04:04:22Z","snapshot_observed_at":"2026-08-10T19:44:01.944297Z","submitted_at":"2025-01-16T17:08:12Z","title":"CHIRP: A Fine-Grained Benchmark for Open-Ended Response Evaluation in Vision-Language Models","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T19:51:25.671507Z"},"links":{"citing_paper":"/paper/2501.09672"},"observation_digest":"sha256:d00164b4b26bfe86bbdd80e787ef14ba471e0a5d14ae3d7755c8aaf0f6e356d2","observation_id":"6c988c71-d243-4fc3-9eef-0e37e0e2f402","resolution":{"observed_at":"2026-08-10T19:51:26.924608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:51:26.877120Z","title":"Hudson and Christopher D","venue":null,"work_id":"2bf9aa47-b4b2-47aa-a37c-03f185025b1a","year":2019},"citing_paper":{"arxiv_id":"2501.09672","last_updated":"2025-08-05T04:04:22Z","snapshot_observed_at":"2026-08-10T19:44:01.944297Z","submitted_at":"2025-01-16T17:08:12Z","title":"CHIRP: A Fine-Grained Benchmark for Open-Ended Response Evaluation in Vision-Language Models","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T19:51:25.679340Z"},"links":{"citing_paper":"/paper/2501.09672"},"observation_digest":"sha256:953ebdc5353c61d4e5fff5f8960a90debec51fb62dd7f681ea266037dac65d4c","observation_id":"774765d2-7178-4461-83e5-b0083ccf2e89","resolution":{"observed_at":"2026-08-10T19:51:26.884643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:51:25.695590Z","title":"Scaling laws for downstream task performance of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09672","last_updated":"2025-08-05T04:04:22Z","snapshot_observed_at":"2026-08-10T19:44:01.944297Z","submitted_at":"2025-01-16T17:08:12Z","title":"CHIRP: A Fine-Grained Benchmark for Open-Ended Response Evaluation in Vision-Language Models","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T19:51:25.695590Z"},"links":{"citing_paper":"/paper/2501.09672"},"observation_digest":"sha256:f95ceb957296900d5a3735b3a931e9366e287db2775a089889b0b9aae9dd490c","observation_id":"8db6cee1-d9a2-4de2-87ea-42797afbda03","resolution":{"observed_at":"2026-08-10T19:51:25.695590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14580","last_updated":"2023-11-24T16:12:05Z","snapshot_observed_at":"2026-08-11T02:58:24.232299Z","submitted_at":"2023-11-24T16:12:05Z","title":"Large Language Models as Automated Aligners for benchmarking Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.14580","snapshot_observed_at":"2026-08-10T19:51:25.705056Z","title":"Large language models as automated aligners for benchmarking vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09672","last_updated":"2025-08-05T04:04:22Z","snapshot_observed_at":"2026-08-10T19:44:01.944297Z","submitted_at":"2025-01-16T17:08:12Z","title":"CHIRP: A Fine-Grained Benchmark for Open-Ended Response Evaluation in Vision-Language Models","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T19:51:25.705056Z"},"links":{"cited_paper":"/paper/2311.14580","citing_paper":"/paper/2501.09672"},"observation_digest":"sha256:6ea499246c95d8507b73e4dad436d90a1033465c991ef179f6fea4e0a68941d7","observation_id":"3b5fe3cc-cb98-4dd6-aad3-c45194caa9b6","resolution":{"observed_at":"2026-08-10T19:51:25.705056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:51:26.848931Z","title":"Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, and Dario Amodei","venue":null,"work_id":"2352ce25-c48d-4add-bf56-df24acfb6209","year":2020},"citing_paper":{"arxiv_id":"2501.09672","last_updated":"2025-08-05T04:04:22Z","snapshot_observed_at":"2026-08-10T19:44:01.944297Z","submitted_at":"2025-01-16T17:08:12Z","title":"CHIRP: A Fine-Grained Benchmark for Open-Ended Response Evaluation in Vision-Language Models","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T19:51:25.715803Z"},"links":{"citing_paper":"/paper/2501.09672"},"observation_digest":"sha256:d333ddac7efe309577d91aa926d25cb21adfb00967f2202202297676f3bf98e2","observation_id":"8ef415a1-fb34-4b4f-abe4-43da84becfff","resolution":{"observed_at":"2026-08-10T19:51:26.857063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17012","last_updated":"2024-09-25T16:57:20Z","snapshot_observed_at":"2026-07-06T16:25:21.571679Z","submitted_at":"2023-09-29T06:53:10Z","title":"Benchmarking Cognitive Biases in Large Language Models as Evaluators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17012","snapshot_observed_at":"2026-08-10T19:51:25.722030Z","title":"BENCHMARKING COGNITIVE BIASES IN LARGE LANGUAGE MODELS AS EVALUATORS , 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09672","last_updated":"2025-08-05T04:04:22Z","snapshot_observed_at":"2026-08-10T19:44:01.944297Z","submitted_at":"2025-01-16T17:08:12Z","title":"CHIRP: A Fine-Grained Benchmark for Open-Ended Response Evaluation in Vision-Language Models","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T19:51:25.722030Z"},"links":{"cited_paper":"/paper/2309.17012","citing_paper":"/paper/2501.09672"},"observation_digest":"sha256:8929d28e4688da3ef15ccc081c0e8e702f7652a1634cea1b01146135efab8413","observation_id":"6b7b52ec-d510-4b2a-ae3e-41f8d6522a8a","resolution":{"observed_at":"2026-08-10T19:51:25.722030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:51:26.826361Z","title":"Shamma, Michael S","venue":null,"work_id":"b9f71019-6663-468c-a165-35092c2c20d3","year":2016},"citing_paper":{"arxiv_id":"2501.09672","last_updated":"2025-08-05T04:04:22Z","snapshot_observed_at":"2026-08-10T19:44:01.944297Z","submitted_at":"2025-01-16T17:08:12Z","title":"CHIRP: A Fine-Grained Benchmark for Open-Ended Response Evaluation in Vision-Language Models","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T19:51:25.727861Z"},"links":{"citing_paper":"/paper/2501.09672"},"observation_digest":"sha256:777ee18836fbde3a4720c4c3c8f67a045dad870d52933f3c03f79023eb461f20","observation_id":"e27249bc-83bf-4033-be89-10cf8fb087ee","resolution":{"observed_at":"2026-08-10T19:51:26.835213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:51:25.732913Z","title":"Richard Landis and Gary G","venue":null,"work_id":null,"year":1977},"citing_paper":{"arxiv_id":"2501.09672","last_updated":"2025-08-05T04:04:22Z","snapshot_observed_at":"2026-08-10T19:44:01.944297Z","submitted_at":"2025-01-16T17:08:12Z","title":"CHIRP: A Fine-Grained Benchmark for Open-Ended Response Evaluation in Vision-Language Models","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T19:51:25.732913Z"},"links":{"citing_paper":"/paper/2501.09672"},"observation_digest":"sha256:d0574984f45e3b6e532ff47d53640f943e546a1836ed72b5c2a0caa654660aa1","observation_id":"467e27ca-f6fd-446c-abb4-d96ef405a73f","resolution":{"observed_at":"2026-08-10T19:51:25.732913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06591","last_updated":"2024-01-12T14:19:23Z","snapshot_observed_at":"2026-08-10T07:33:06.680315Z","submitted_at":"2024-01-12T14:19:23Z","title":"Prometheus-Vision: Vision-Language Model as a Judge for Fine-Grained Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06591","snapshot_observed_at":"2026-08-10T19:51:25.740068Z","title":"Prometheus-vision: Vision-language model as a judge for fine-grained evaluation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09672","last_updated":"2025-08-05T04:04:22Z","snapshot_observed_at":"2026-08-10T19:44:01.944297Z","submitted_at":"2025-01-16T17:08:12Z","title":"CHIRP: A Fine-Grained Benchmark for Open-Ended Response Evaluation in Vision-Language Models","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T19:51:25.740068Z"},"links":{"cited_paper":"/paper/2401.06591","citing_paper":"/paper/2501.09672"},"observation_digest":"sha256:5bb21d3b696035b4e01c834edf9c23ca02dc123b449b596fb6cdf9402f4368a6","observation_id":"295d2df2-2f49-4ca0-9b70-0c7fd212d330","resolution":{"observed_at":"2026-08-10T19:51:25.740068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:51:26.805417Z","title":"Hashimoto","venue":null,"work_id":"f8134282-0831-4c46-91f7-19c1977498e5","year":2023},"citing_paper":{"arxiv_id":"2501.09672","last_updated":"2025-08-05T04:04:22Z","snapshot_observed_at":"2026-08-10T19:44:01.944297Z","submitted_at":"2025-01-16T17:08:12Z","title":"CHIRP: A Fine-Grained Benchmark for Open-Ended Response Evaluation in Vision-Language Models","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T19:51:25.746643Z"},"links":{"citing_paper":"/paper/2501.09672"},"observation_digest":"sha256:c5a0bea50a1218bbefab181b23292fe7dc8d21757c4ba1b7028ad3141351c071","observation_id":"832ef200-8aa7-41d0-b0c2-4e95a6ee8bcc","resolution":{"observed_at":"2026-08-10T19:51:26.813110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.06607","last_updated":"2024-08-26T06:57:51Z","snapshot_observed_at":"2026-08-05T16:46:37.436149Z","submitted_at":"2023-11-11T16:37:41Z","title":"Monkey: Image Resolution and Text Label Are Important Things for Large Multi-modal Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.06607","snapshot_observed_at":"2026-08-10T19:51:25.758465Z","title":"Monkey: Image resolution and text label are important things for large multi-modal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09672","last_updated":"2025-08-05T04:04:22Z","snapshot_observed_at":"2026-08-10T19:44:01.944297Z","submitted_at":"2025-01-16T17:08:12Z","title":"CHIRP: A Fine-Grained Benchmark for Open-Ended Response Evaluation in Vision-Language Models","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T19:51:25.758465Z"},"links":{"cited_paper":"/paper/2311.06607","citing_paper":"/paper/2501.09672"},"observation_digest":"sha256:2c491b594df6658fe3d26d0dbb78ef5ebbb1aeddb216e452c7f0d28ed8f22cac","observation_id":"42bc1c55-1abe-433d-827b-4849628fe22f","resolution":{"observed_at":"2026-08-10T19:51:25.758465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:51:26.780199Z","title":"Lawrence Zitnick, and Piotr Dollár","venue":null,"work_id":"337b4e33-fb7e-4cd9-918e-8e59df52cf04","year":2015},"citing_paper":{"arxiv_id":"2501.09672","last_updated":"2025-08-05T04:04:22Z","snapshot_observed_at":"2026-08-10T19:44:01.944297Z","submitted_at":"2025-01-16T17:08:12Z","title":"CHIRP: A Fine-Grained Benchmark for Open-Ended Response Evaluation in Vision-Language Models","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T19:51:25.764824Z"},"links":{"citing_paper":"/paper/2501.09672"},"observation_digest":"sha256:de5349cff4a65daa64585d0f67070699509159046ffaeed4942e5c3f7a3249bf","observation_id":"f93b1673-c777-4a6a-804c-9f1346b0fbe6","resolution":{"observed_at":"2026-08-10T19:51:26.785676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:51:26.762236Z","title":"Improved Baselines with Visual Instruction Tuning , 2023 a","venue":null,"work_id":"77701ba0-3736-45ad-b92c-248fd62c0c24","year":2023},"citing_paper":{"arxiv_id":"2501.09672","last_updated":"2025-08-05T04:04:22Z","snapshot_observed_at":"2026-08-10T19:44:01.944297Z","submitted_at":"2025-01-16T17:08:12Z","title":"CHIRP: A Fine-Grained Benchmark for Open-Ended Response Evaluation in Vision-Language Models","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T19:51:25.769256Z"},"links":{"citing_paper":"/paper/2501.09672"},"observation_digest":"sha256:17de16278c3e63631fef378c84aefe17a42cb811b4e4b1d4120fc898f17d5783","observation_id":"f734faa6-9cdb-458f-896e-ed141fc023fb","resolution":{"observed_at":"2026-08-10T19:51:26.768831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:51:26.738809Z","title":"Visual Instruction Tuning , 2023 b","venue":null,"work_id":"cb5c83f6-d28d-4e09-8026-fdded179bde9","year":2023},"citing_paper":{"arxiv_id":"2501.09672","last_updated":"2025-08-05T04:04:22Z","snapshot_observed_at":"2026-08-10T19:44:01.944297Z","submitted_at":"2025-01-16T17:08:12Z","title":"CHIRP: A Fine-Grained Benchmark for Open-Ended Response Evaluation in Vision-Language Models","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T19:51:25.774490Z"},"links":{"citing_paper":"/paper/2501.09672"},"observation_digest":"sha256:bd6041af7abb6edbfa8d699ba7b510c29d30f4a0c3d425bf432de8c65c9608c3","observation_id":"2334d8b9-6bf9-41b2-a240-d44b5099203c","resolution":{"observed_at":"2026-08-10T19:51:26.743919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:51:26.713524Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":"6f05ba51-92b9-4b03-aa42-6864bf6337ea","year":2022},"citing_paper":{"arxiv_id":"2501.09672","last_updated":"2025-08-05T04:04:22Z","snapshot_observed_at":"2026-08-10T19:44:01.944297Z","submitted_at":"2025-01-16T17:08:12Z","title":"CHIRP: A Fine-Grained Benchmark for Open-Ended Response Evaluation in Vision-Language Models","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T19:51:25.780485Z"},"links":{"citing_paper":"/paper/2501.09672"},"observation_digest":"sha256:475a47b2cd5757e8069c3d14f24895e17d77b0f404327c9979fda73f70dba12b","observation_id":"02fdbc1d-1582-4b13-afc6-ae23afd06637","resolution":{"observed_at":"2026-08-10T19:51:26.724928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:51:25.788155Z","title":"OCR-VQA: Visual Question Answering by Reading Text in Images","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.09672","last_updated":"2025-08-05T04:04:22Z","snapshot_observed_at":"2026-08-10T19:44:01.944297Z","submitted_at":"2025-01-16T17:08:12Z","title":"CHIRP: A Fine-Grained Benchmark for Open-Ended Response Evaluation in Vision-Language Models","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T19:51:25.788155Z"},"links":{"citing_paper":"/paper/2501.09672"},"observation_digest":"sha256:aaed206df3a710a27edd1147d3a485c3bb6e5b3af787644ffe9d1cd041c1dab0","observation_id":"ea1380d3-e1ef-4445-b172-78babf8c9908","resolution":{"observed_at":"2026-08-10T19:51:25.788155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:51:26.690981Z","title":"Gpt-4v(ision) system card","venue":null,"work_id":"bece4a08-daaa-4bd3-9d4f-ac7ea2c8b2f8","year":2023},"citing_paper":{"arxiv_id":"2501.09672","last_updated":"2025-08-05T04:04:22Z","snapshot_observed_at":"2026-08-10T19:44:01.944297Z","submitted_at":"2025-01-16T17:08:12Z","title":"CHIRP: A Fine-Grained Benchmark for Open-Ended Response Evaluation in Vision-Language Models","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T19:51:25.799891Z"},"links":{"citing_paper":"/paper/2501.09672"},"observation_digest":"sha256:49f890a42e72c03adeeb09b57be81264636f94d4c37943091e9d8e3735187069","observation_id":"ee15cd68-f4a2-422f-953d-733d0c764825","resolution":{"observed_at":"2026-08-10T19:51:26.699551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:51:26.663347Z","title":"Openai model documentation","venue":null,"work_id":"a57d459f-6e6e-4f8e-baf4-3c8ff49e7661","year":2024},"citing_paper":{"arxiv_id":"2501.09672","last_updated":"2025-08-05T04:04:22Z","snapshot_observed_at":"2026-08-10T19:44:01.944297Z","submitted_at":"2025-01-16T17:08:12Z","title":"CHIRP: A Fine-Grained Benchmark for Open-Ended Response Evaluation in Vision-Language Models","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T19:51:25.807624Z"},"links":{"citing_paper":"/paper/2501.09672"},"observation_digest":"sha256:878a3fa6d22fe3270748f8335d614356bde65bd626fed54919984bec8f61cb0e","observation_id":"4899d78b-0e84-4e0c-bf73-8b28a0560d7b","resolution":{"observed_at":"2026-08-10T19:51:26.669145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:51:26.638738Z","title":"Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, Gretchen Krueger, and Ilya Sutskever","venue":null,"work_id":"3d4fdebb-dd4e-4af8-9fcc-3e9776258753","year":2021},"citing_paper":{"arxiv_id":"2501.09672","last_updated":"2025-08-05T04:04:22Z","snapshot_observed_at":"2026-08-10T19:44:01.944297Z","submitted_at":"2025-01-16T17:08:12Z","title":"CHIRP: A Fine-Grained Benchmark for Open-Ended Response Evaluation in Vision-Language Models","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-10T19:51:25.820188Z"},"links":{"citing_paper":"/paper/2501.09672"},"observation_digest":"sha256:4369b1560bcdab7f06c551ad30a807cfb9a3b2a3304bdefbae32d5d7ff8c8b84","observation_id":"85cee05d-d53c-48d8-804c-823981f7e093","resolution":{"observed_at":"2026-08-10T19:51:26.645480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:51:25.827746Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09672","last_updated":"2025-08-05T04:04:22Z","snapshot_observed_at":"2026-08-10T19:44:01.944297Z","submitted_at":"2025-01-16T17:08:12Z","title":"CHIRP: A Fine-Grained Benchmark for Open-Ended Response Evaluation in Vision-Language Models","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T19:51:25.827746Z"},"links":{"citing_paper":"/paper/2501.09672"},"observation_digest":"sha256:412ea79134b212e9f2905ad557a29141ba3218df40ba003767fa645409b3093d","observation_id":"5520d006-a753-4346-baf9-c42044b301bb","resolution":{"observed_at":"2026-08-10T19:51:25.827746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:51:26.587919Z","title":"Revisiting the train loss: an efficient performance estimator for neural architecture search, 06 2020","venue":null,"work_id":"f93f3fd4-f299-4ce1-be83-4045e15e0006","year":2020},"citing_paper":{"arxiv_id":"2501.09672","last_updated":"2025-08-05T04:04:22Z","snapshot_observed_at":"2026-08-10T19:44:01.944297Z","submitted_at":"2025-01-16T17:08:12Z","title":"CHIRP: A Fine-Grained Benchmark for Open-Ended Response Evaluation in Vision-Language Models","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-10T19:51:25.833267Z"},"links":{"citing_paper":"/paper/2501.09672"},"observation_digest":"sha256:725eb00d1181e325eea2f869ec6ea2461e98b30743b17f3d84c8cdea98022a8e","observation_id":"a6f9c3a3-9ba9-439d-9ba8-d1b2ac43344c","resolution":{"observed_at":"2026-08-10T19:51:26.595617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:51:25.841536Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.09672","last_updated":"2025-08-05T04:04:22Z","snapshot_observed_at":"2026-08-10T19:44:01.944297Z","submitted_at":"2025-01-16T17:08:12Z","title":"CHIRP: A Fine-Grained Benchmark for Open-Ended Response Evaluation in Vision-Language Models","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-10T19:51:25.841536Z"},"links":{"citing_paper":"/paper/2501.09672"},"observation_digest":"sha256:e43492c510c5adf43c1d4f585d6a551d5b2c93dcd93d05f2241abbad13617ffc","observation_id":"2671ea9d-312b-46c0-9bf5-8dc13fd2d1c5","resolution":{"observed_at":"2026-08-10T19:51:25.841536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13286","last_updated":"2024-05-08T03:09:22Z","snapshot_observed_at":"2026-08-10T12:19:42.891683Z","submitted_at":"2023-12-20T18:59:58Z","title":"Generative Multimodal Models are In-Context Learners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13286","snapshot_observed_at":"2026-08-10T19:51:25.852957Z","title":"Generative multimodal models are in-context learners","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09672","last_updated":"2025-08-05T04:04:22Z","snapshot_observed_at":"2026-08-10T19:44:01.944297Z","submitted_at":"2025-01-16T17:08:12Z","title":"CHIRP: A Fine-Grained Benchmark for Open-Ended Response Evaluation in Vision-Language Models","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-10T19:51:25.852957Z"},"links":{"cited_paper":"/paper/2312.13286","citing_paper":"/paper/2501.09672"},"observation_digest":"sha256:1cb167062d1faebb499691288f8a33a8863cf946df6ceaeec26dd375147f302d","observation_id":"20c47a55-3e47-4ebe-9ece-ddbf32f870df","resolution":{"observed_at":"2026-08-10T19:51:25.852957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:51:25.866465Z","title":"Székely, Maria L","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2501.09672","last_updated":"2025-08-05T04:04:22Z","snapshot_observed_at":"2026-08-10T19:44:01.944297Z","submitted_at":"2025-01-16T17:08:12Z","title":"CHIRP: A Fine-Grained Benchmark for Open-Ended Response Evaluation in Vision-Language Models","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-10T19:51:25.866465Z"},"links":{"citing_paper":"/paper/2501.09672"},"observation_digest":"sha256:ed633eedcb8a5a978fde7b541e339939423a4d546e3d482fb79ea881fba1a1e7","observation_id":"85d87149-19c4-45c4-bece-1d2d06fd2cbb","resolution":{"observed_at":"2026-08-10T19:51:25.866465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03025","last_updated":"2023-11-12T06:25:32Z","snapshot_observed_at":"2026-08-09T22:31:08.379987Z","submitted_at":"2023-07-06T14:42:01Z","title":"Style Over Substance: Evaluation Biases for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03025","snapshot_observed_at":"2026-08-10T19:51:25.872740Z","title":"Style Over Substance: Evaluation Biases for Large Language Models , 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09672","last_updated":"2025-08-05T04:04:22Z","snapshot_observed_at":"2026-08-10T19:44:01.944297Z","submitted_at":"2025-01-16T17:08:12Z","title":"CHIRP: A Fine-Grained Benchmark for Open-Ended Response Evaluation in Vision-Language Models","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-10T19:51:25.872740Z"},"links":{"cited_paper":"/paper/2307.03025","citing_paper":"/paper/2501.09672"},"observation_digest":"sha256:84f2c18fc3ec0e5168f273a29dbc25b0317b82504754dd34b02b8a52a4479a23","observation_id":"454a078a-a3e9-4704-9f36-cc8df588f1eb","resolution":{"observed_at":"2026-08-10T19:51:25.872740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:51:26.535877Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities , 2023","venue":null,"work_id":"612ac23e-901e-42b7-8c8d-51c7713855b8","year":2023},"citing_paper":{"arxiv_id":"2501.09672","last_updated":"2025-08-05T04:04:22Z","snapshot_observed_at":"2026-08-10T19:44:01.944297Z","submitted_at":"2025-01-16T17:08:12Z","title":"CHIRP: A Fine-Grained Benchmark for Open-Ended Response Evaluation in Vision-Language Models","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-10T19:51:25.880433Z"},"links":{"citing_paper":"/paper/2501.09672"},"observation_digest":"sha256:d3a52ee6a1721885ccaf307898814228da9d928da5fd94a7b3839f1989ca859b","observation_id":"223c606b-c254-4773-86a6-2f50624c24d7","resolution":{"observed_at":"2026-08-10T19:51:26.542116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:51:26.488458Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":"64833572-bee0-4422-87e0-e3bf50e78d04","year":2023},"citing_paper":{"arxiv_id":"2501.09672","last_updated":"2025-08-05T04:04:22Z","snapshot_observed_at":"2026-08-10T19:44:01.944297Z","submitted_at":"2025-01-16T17:08:12Z","title":"CHIRP: A Fine-Grained Benchmark for Open-Ended Response Evaluation in Vision-Language Models","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-10T19:51:25.887796Z"},"links":{"citing_paper":"/paper/2501.09672"},"observation_digest":"sha256:7e64f64339017fd739f8dbeb85648b90f032722fad51042ec3026068ada87de3","observation_id":"7f77c188-126e-456f-9203-a7c136f166a3","resolution":{"observed_at":"2026-08-10T19:51:26.500908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.09672","last_updated":"2025-08-05T04:04:22Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T19:44:01.944297Z","submitted_at":"2025-01-16T17:08:12Z","title":"CHIRP: A Fine-Grained Benchmark for Open-Ended Response Evaluation in Vision-Language Models"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":20},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2501.09672."}