{"as_of":"2026-08-15T01:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8b0958b1fd70d458ff392d2f1dcbe32a8d505dc2ef492b06db8da993aa31c2e4","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T19:24:17.901468Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-22T21:09:30.462709Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-22T21:12:08.583301Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.06745","last_updated":"2025-06-17T15:57:52Z","snapshot_observed_at":"2026-08-14T07:51:15.470825Z","submitted_at":"2024-12-09T18:37:14Z","title":"ONEBench to Test Them All: Sample-Level Benchmarking Over Open-Ended Capabilities","version":2},"cited_work":{"arxiv_id":"2412.06745","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.06745","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ghosh, S","venue":null,"work_id":"dfc57486-8844-4475-968b-4e400e41f73e","year":2024},"citing_paper":{"arxiv_id":"2504.16093","last_updated":"2025-04-06T23:16:30Z","snapshot_observed_at":"2026-08-09T23:09:41.882365Z","submitted_at":"2025-04-06T23:16:30Z","title":"Efficient Portfolio Selection through Preference Aggregation with Quicksort and the Bradley--Terry Model","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-22T21:09:30.462709Z"},"links":{"cited_paper":"/paper/2412.06745","citing_paper":"/paper/2504.16093"},"observation_digest":"sha256:d3ee6c86799f7b17b60c6984b8594011c636695037df0e58e8c8edc00a5b337a","observation_id":"82bba862-11c9-4694-8553-0fa2e4bc86c0","resolution":{"observed_at":"2026-05-22T21:12:08.585633Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.06745/citation-record","integrity":"/paper/2412.06745/integrity","json":"/paper/2412.06745/citation-record.json","paper":"/paper/2412.06745"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:24:18.261489Z","title":"llava-7b 3","venue":null,"work_id":"058f88f0-b53b-44d6-9dd7-832173bef419","year":null},"citing_paper":{"arxiv_id":"2412.06745","last_updated":"2025-06-17T15:57:52Z","snapshot_observed_at":"2026-08-14T07:51:15.470825Z","submitted_at":"2024-12-09T18:37:14Z","title":"ONEBench to Test Them All: Sample-Level Benchmarking Over Open-Ended Capabilities","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T19:24:17.733490Z"},"links":{"citing_paper":"/paper/2412.06745"},"observation_digest":"sha256:edd3c399a76dfb5fee3bcb5034deeec1e1155c351d8d910283ac86d333cabee6","observation_id":"c9971c8b-1223-4725-a55e-fad83c9db937","resolution":{"observed_at":"2026-08-11T19:24:18.264742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:24:18.107865Z","title":"A comprehensive evaluation of these alternatives could offer new insight for aggregating model performance","venue":null,"work_id":"ccb829f5-1652-4e27-b7a7-360132c387e4","year":null},"citing_paper":{"arxiv_id":"2412.06745","last_updated":"2025-06-17T15:57:52Z","snapshot_observed_at":"2026-08-14T07:51:15.470825Z","submitted_at":"2024-12-09T18:37:14Z","title":"ONEBench to Test Them All: Sample-Level Benchmarking Over Open-Ended Capabilities","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T19:24:17.894669Z"},"links":{"citing_paper":"/paper/2412.06745"},"observation_digest":"sha256:a735cdffd1b03c38ac26aca56d18140654d6c8af78a7ab07fc89bb56d22c66fe","observation_id":"24ae2197-60bb-4d1a-96e5-c76da6fe78af","resolution":{"observed_at":"2026-08-11T19:24:18.111732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:24:18.097197Z","title":null,"venue":null,"work_id":"d57102c0-e986-4bfb-80f0-2bc32ccbcd21","year":2020},"citing_paper":{"arxiv_id":"2412.06745","last_updated":"2025-06-17T15:57:52Z","snapshot_observed_at":"2026-08-14T07:51:15.470825Z","submitted_at":"2024-12-09T18:37:14Z","title":"ONEBench to Test Them All: Sample-Level Benchmarking Over Open-Ended Capabilities","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T19:24:17.898103Z"},"links":{"citing_paper":"/paper/2412.06745"},"observation_digest":"sha256:f7eab52016cc473b45fa87d47d88ff9ef3002ec3f7a4d9fd746e286cdd509827","observation_id":"fdcd4fad-ad4c-4133-9df6-9b3e23eefa6b","resolution":{"observed_at":"2026-08-11T19:24:18.100731Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:24:18.086173Z","title":null,"venue":null,"work_id":"0568edf3-82cb-483c-9c3a-c93496791751","year":2023},"citing_paper":{"arxiv_id":"2412.06745","last_updated":"2025-06-17T15:57:52Z","snapshot_observed_at":"2026-08-14T07:51:15.470825Z","submitted_at":"2024-12-09T18:37:14Z","title":"ONEBench to Test Them All: Sample-Level Benchmarking Over Open-Ended Capabilities","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T19:24:17.901468Z"},"links":{"citing_paper":"/paper/2412.06745"},"observation_digest":"sha256:851469ee6c5fa1b76f298492c6afac01d1339c813e532a21444791d0133512d9","observation_id":"03900b93-7987-4443-9004-1852de35bb7c","resolution":{"observed_at":"2026-08-11T19:24:18.090126Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05229","last_updated":"2025-08-27T16:24:39Z","snapshot_observed_at":"2026-08-15T01:09:53.276153Z","submitted_at":"2024-10-07T17:36:37Z","title":"GSM-Symbolic: Understanding the Limitations of Mathematical Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05229","snapshot_observed_at":"2026-08-11T19:24:17.693587Z","title":"arXiv preprint arXiv:2410.05229","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.06745","last_updated":"2025-06-17T15:57:52Z","snapshot_observed_at":"2026-08-14T07:51:15.470825Z","submitted_at":"2024-12-09T18:37:14Z","title":"ONEBench to Test Them All: Sample-Level Benchmarking Over Open-Ended Capabilities","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T19:24:17.693587Z"},"links":{"cited_paper":"/paper/2410.05229","citing_paper":"/paper/2412.06745"},"observation_digest":"sha256:51c05c86f59764cd0c66019b2c0b925733e86c858d0c1ff296503db45aaa91cc","observation_id":"a73e2cf4-f347-4d47-9b62-aabc3282662f","resolution":{"observed_at":"2026-08-11T19:24:17.693587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14992","last_updated":"2024-05-26T22:27:23Z","snapshot_observed_at":"2026-08-14T07:50:45.743715Z","submitted_at":"2024-02-22T22:05:23Z","title":"tinyBenchmarks: evaluating LLMs with fewer examples","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14992","snapshot_observed_at":"2026-08-11T19:24:17.697517Z","title":"Angéline Pouget, Lucas Beyer, Emanuele Bugliarello, Xiao Wang, Andreas Peter Steiner, Xiaohua Zhai, and Ibrahim Alabdulmohsin","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06745","last_updated":"2025-06-17T15:57:52Z","snapshot_observed_at":"2026-08-14T07:51:15.470825Z","submitted_at":"2024-12-09T18:37:14Z","title":"ONEBench to Test Them All: Sample-Level Benchmarking Over Open-Ended Capabilities","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T19:24:17.697517Z"},"links":{"cited_paper":"/paper/2402.14992","citing_paper":"/paper/2412.06745"},"observation_digest":"sha256:b0474bed3e7a09cd0f79137777451121d4d980677ec99e2c1e5d97892edf75bd","observation_id":"61dd9087-020f-4142-9b45-bfd8f4805819","resolution":{"observed_at":"2026-08-11T19:24:17.697517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19472","last_updated":"2024-11-23T22:30:55Z","snapshot_observed_at":"2026-08-14T07:51:51.610760Z","submitted_at":"2024-02-29T18:58:26Z","title":"Efficient Lifelong Model Evaluation in an Era of Rapid Progress","version":2},"cited_work":{"arxiv_id":"2402.19472","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.19472","snapshot_observed_at":"2026-08-11T19:24:18.002342Z","title":"Efficient Lifelong Model Evaluation in an Era of Rapid Progress","venue":"cs.LG","work_id":"89b39d7b-4b13-4003-8d5a-dff409067613","year":2024},"citing_paper":{"arxiv_id":"2412.06745","last_updated":"2025-06-17T15:57:52Z","snapshot_observed_at":"2026-08-14T07:51:15.470825Z","submitted_at":"2024-12-09T18:37:14Z","title":"ONEBench to Test Them All: Sample-Level Benchmarking Over Open-Ended Capabilities","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T19:24:17.701768Z"},"links":{"cited_paper":"/paper/2402.19472","citing_paper":"/paper/2412.06745"},"observation_digest":"sha256:4184e973d1dde8fd9d6462998ee628ab77a67c2ad48fd1b78b886afa2bc7f9e7","observation_id":"e589acc7-12b6-4795-a779-6ffc28164486","resolution":{"observed_at":"2026-08-11T19:24:18.008433Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1406.6618","last_updated":"2014-06-25T15:48:41Z","snapshot_observed_at":"2026-08-14T23:29:05.890871Z","submitted_at":"2014-06-25T15:48:41Z","title":"When is it Better to Compare than to Score?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1406.6618","snapshot_observed_at":"2026-08-11T19:24:17.709449Z","title":"Dustin Schwenk, Apoorv Khandelwal, Christopher Clark, Kenneth Marino, and Roozbeh Mottaghi","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.06745","last_updated":"2025-06-17T15:57:52Z","snapshot_observed_at":"2026-08-14T07:51:15.470825Z","submitted_at":"2024-12-09T18:37:14Z","title":"ONEBench to Test Them All: Sample-Level Benchmarking Over Open-Ended Capabilities","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T19:24:17.709449Z"},"links":{"cited_paper":"/paper/1406.6618","citing_paper":"/paper/2412.06745"},"observation_digest":"sha256:1f4e2446ba4e92e29173aaed1741e27d1dc3bd4bdeae420b0c5427d699c58c63","observation_id":"c1183266-9857-418a-a685-8f5b28542b99","resolution":{"observed_at":"2026-08-11T19:24:17.709449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16101","last_updated":"2023-11-27T18:59:42Z","snapshot_observed_at":"2026-08-14T06:58:55.081639Z","submitted_at":"2023-11-27T18:59:42Z","title":"How Many Unicorns Are in This Image? A Safety Evaluation Benchmark for Vision LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16101","snapshot_observed_at":"2026-08-11T19:24:17.717055Z","title":"zero-shot","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06745","last_updated":"2025-06-17T15:57:52Z","snapshot_observed_at":"2026-08-14T07:51:15.470825Z","submitted_at":"2024-12-09T18:37:14Z","title":"ONEBench to Test Them All: Sample-Level Benchmarking Over Open-Ended Capabilities","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T19:24:17.717055Z"},"links":{"cited_paper":"/paper/2311.16101","citing_paper":"/paper/2412.06745"},"observation_digest":"sha256:6a842ff0ac190e3f2f08d9b25a083265f66288f64e4735a0abe53a8a658c97d6","observation_id":"0a0c7732-bf17-4a9b-a8d5-76da4ebe76bf","resolution":{"observed_at":"2026-08-11T19:24:17.717055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11443","last_updated":"2024-02-18T03:40:06Z","snapshot_observed_at":"2026-08-14T11:30:48.153581Z","submitted_at":"2024-02-18T03:40:06Z","title":"Benchmark Self-Evolving: A Multi-Agent Framework for Dynamic LLM Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11443","snapshot_observed_at":"2026-08-11T19:24:17.721018Z","title":"InProceedings of the 60th Annual Meet- ing of the Association for Computational Linguistics (Volume 1: Long Papers), pages 3412–3425","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06745","last_updated":"2025-06-17T15:57:52Z","snapshot_observed_at":"2026-08-14T07:51:15.470825Z","submitted_at":"2024-12-09T18:37:14Z","title":"ONEBench to Test Them All: Sample-Level Benchmarking Over Open-Ended Capabilities","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T19:24:17.721018Z"},"links":{"cited_paper":"/paper/2402.11443","citing_paper":"/paper/2412.06745"},"observation_digest":"sha256:0450fbdc84ac433a9124bc2e0413387880306c0893ca4bc66d4dc930c09dfeff","observation_id":"1e01ed4f-49e3-4e02-820c-b462d300196d","resolution":{"observed_at":"2026-08-11T19:24:17.721018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19114","last_updated":"2024-03-28T03:10:39Z","snapshot_observed_at":"2026-08-14T10:51:56.592549Z","submitted_at":"2024-03-28T03:10:39Z","title":"Top Leaderboard Ranking = Top Coding Proficiency, Always? EvoEval: Evolving Coding Benchmarks via LLM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19114","snapshot_observed_at":"2026-08-11T19:24:17.725599Z","title":"Lirong Xia","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.06745","last_updated":"2025-06-17T15:57:52Z","snapshot_observed_at":"2026-08-14T07:51:15.470825Z","submitted_at":"2024-12-09T18:37:14Z","title":"ONEBench to Test Them All: Sample-Level Benchmarking Over Open-Ended Capabilities","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T19:24:17.725599Z"},"links":{"cited_paper":"/paper/2403.19114","citing_paper":"/paper/2412.06745"},"observation_digest":"sha256:d3e611b1a18724e0f39d563d601b576a265bf4f36d08732691b99e4118dcfc19","observation_id":"ee0eebcf-5173-4998-9590-78a7c320bf4e","resolution":{"observed_at":"2026-08-11T19:24:17.725599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17567","last_updated":"2023-10-26T16:55:05Z","snapshot_observed_at":"2026-08-14T09:29:06.512962Z","submitted_at":"2023-10-26T16:55:05Z","title":"Skill-Mix: a Flexible and Expandable Family of Evaluations for AI models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17567","snapshot_observed_at":"2026-08-11T19:24:17.729268Z","title":"to promote transparent and reproducible evaluations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06745","last_updated":"2025-06-17T15:57:52Z","snapshot_observed_at":"2026-08-14T07:51:15.470825Z","submitted_at":"2024-12-09T18:37:14Z","title":"ONEBench to Test Them All: Sample-Level Benchmarking Over Open-Ended Capabilities","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T19:24:17.729268Z"},"links":{"cited_paper":"/paper/2310.17567","citing_paper":"/paper/2412.06745"},"observation_digest":"sha256:91cfab12a04833d59a925527d059912ea21eef2e3de63a9721536f8d52627524","observation_id":"f212106c-a053-4858-99fc-9fc7dff01d6e","resolution":{"observed_at":"2026-08-11T19:24:17.729268Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:24:18.251934Z","title":"internlm-xcomposer 3","venue":null,"work_id":"f613bec0-edd2-45b6-a98c-4d6e0030f5af","year":null},"citing_paper":{"arxiv_id":"2412.06745","last_updated":"2025-06-17T15:57:52Z","snapshot_observed_at":"2026-08-14T07:51:15.470825Z","submitted_at":"2024-12-09T18:37:14Z","title":"ONEBench to Test Them All: Sample-Level Benchmarking Over Open-Ended Capabilities","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T19:24:17.737268Z"},"links":{"citing_paper":"/paper/2412.06745"},"observation_digest":"sha256:6952ec1d7b1512007ea6d3b8464586a7b4f676264fb18035ca7d0515ec0e99fa","observation_id":"6051a52e-b1f5-4209-ba17-827c9e4d50ec","resolution":{"observed_at":"2026-08-11T19:24:18.255171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:24:18.242070Z","title":"idefics_80b_instruct3","venue":null,"work_id":"ca6ffd07-5883-4ed1-855e-87ac3bb7c1ed","year":null},"citing_paper":{"arxiv_id":"2412.06745","last_updated":"2025-06-17T15:57:52Z","snapshot_observed_at":"2026-08-14T07:51:15.470825Z","submitted_at":"2024-12-09T18:37:14Z","title":"ONEBench to Test Them All: Sample-Level Benchmarking Over Open-Ended Capabilities","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T19:24:17.740911Z"},"links":{"citing_paper":"/paper/2412.06745"},"observation_digest":"sha256:1bb06ca1a40ed4e85d59cf87f1170f02de9764b657ad6405e0525d3ccbd3c982","observation_id":"a0ea9fba-5106-4252-beda-39ee94da3414","resolution":{"observed_at":"2026-08-11T19:24:18.245573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:24:18.229736Z","title":"idefics-80b3","venue":null,"work_id":"75e6c5c0-a397-43bd-9221-c234c7ffc182","year":null},"citing_paper":{"arxiv_id":"2412.06745","last_updated":"2025-06-17T15:57:52Z","snapshot_observed_at":"2026-08-14T07:51:15.470825Z","submitted_at":"2024-12-09T18:37:14Z","title":"ONEBench to Test Them All: Sample-Level Benchmarking Over Open-Ended Capabilities","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T19:24:17.744497Z"},"links":{"citing_paper":"/paper/2412.06745"},"observation_digest":"sha256:1b159d5d1f9e37df7ad6946afb6c04c982cbfb497e31ca2e6fcf2946d9a3606b","observation_id":"cd287553-a19d-42ad-bac6-52eef6bc42d5","resolution":{"observed_at":"2026-08-11T19:24:18.235013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:24:18.219431Z","title":"claude3_sonnet3","venue":null,"work_id":"d6743dbd-9094-4e5a-9c43-7db1fbce9620","year":null},"citing_paper":{"arxiv_id":"2412.06745","last_updated":"2025-06-17T15:57:52Z","snapshot_observed_at":"2026-08-14T07:51:15.470825Z","submitted_at":"2024-12-09T18:37:14Z","title":"ONEBench to Test Them All: Sample-Level Benchmarking Over Open-Ended Capabilities","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T19:24:17.748186Z"},"links":{"citing_paper":"/paper/2412.06745"},"observation_digest":"sha256:ad846ccfe46bbd668c911ec100718dc7e10b9d74c5cafaedfde3abc5c36c8746","observation_id":"dde5673d-dbd5-4dcc-b881-a5277231c45c","resolution":{"observed_at":"2026-08-11T19:24:18.223053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:24:18.208269Z","title":null,"venue":null,"work_id":"774f92fc-c3d1-4f4f-aa07-02f60669571c","year":null},"citing_paper":{"arxiv_id":"2412.06745","last_updated":"2025-06-17T15:57:52Z","snapshot_observed_at":"2026-08-14T07:51:15.470825Z","submitted_at":"2024-12-09T18:37:14Z","title":"ONEBench to Test Them All: Sample-Level Benchmarking Over Open-Ended Capabilities","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T19:24:17.752064Z"},"links":{"citing_paper":"/paper/2412.06745"},"observation_digest":"sha256:59a4ffd4b692f7e218acf5dddc8afd8edb4bd4e42f63d0b2b12771dce9ef0119","observation_id":"3a770b11-7318-4ed6-a2a8-462d5ce5f172","resolution":{"observed_at":"2026-08-11T19:24:18.212567Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:24:18.187308Z","title":null,"venue":null,"work_id":"b0548a8d-1a08-4b0c-b8a4-c2792f005e49","year":null},"citing_paper":{"arxiv_id":"2412.06745","last_updated":"2025-06-17T15:57:52Z","snapshot_observed_at":"2026-08-14T07:51:15.470825Z","submitted_at":"2024-12-09T18:37:14Z","title":"ONEBench to Test Them All: Sample-Level Benchmarking Over Open-Ended Capabilities","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T19:24:17.760166Z"},"links":{"citing_paper":"/paper/2412.06745"},"observation_digest":"sha256:91deedef61f1153f0f21f29e7b7a50209ae0a841083948081c000c237741bfca","observation_id":"51a05230-5484-440f-94a9-8464647a9396","resolution":{"observed_at":"2026-08-11T19:24:18.190924Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:24:18.176208Z","title":"Who is the Byronic hero?","venue":null,"work_id":"6befd0cc-b086-4ea1-8000-d12a65752762","year":null},"citing_paper":{"arxiv_id":"2412.06745","last_updated":"2025-06-17T15:57:52Z","snapshot_observed_at":"2026-08-14T07:51:15.470825Z","submitted_at":"2024-12-09T18:37:14Z","title":"ONEBench to Test Them All: Sample-Level Benchmarking Over Open-Ended Capabilities","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T19:24:17.763565Z"},"links":{"citing_paper":"/paper/2412.06745"},"observation_digest":"sha256:515957a3274a12253ded28a3b36883c7ac945d8d88c9a909f80be7f56c424ca2","observation_id":"48f12b08-3461-42bd-8a28-ac6ab2969a12","resolution":{"observed_at":"2026-08-11T19:24:18.180056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:24:18.165702Z","title":"palmyra-vision-3 3","venue":null,"work_id":"f5581cc3-c4cc-4a86-9125-3c57efc7ed89","year":null},"citing_paper":{"arxiv_id":"2412.06745","last_updated":"2025-06-17T15:57:52Z","snapshot_observed_at":"2026-08-14T07:51:15.470825Z","submitted_at":"2024-12-09T18:37:14Z","title":"ONEBench to Test Them All: Sample-Level Benchmarking Over Open-Ended Capabilities","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T19:24:17.766901Z"},"links":{"citing_paper":"/paper/2412.06745"},"observation_digest":"sha256:8276c23a94f7751b44799d91f75bc977f3643af225c09ea8f0cfcff939e61cc3","observation_id":"d3ce9320-7062-4fa4-a463-8a6d5331f4dc","resolution":{"observed_at":"2026-08-11T19:24:18.169222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:24:18.154658Z","title":"_ bought a…","venue":null,"work_id":"ed201ffc-0497-44b8-9a73-d38f9e973f78","year":null},"citing_paper":{"arxiv_id":"2412.06745","last_updated":"2025-06-17T15:57:52Z","snapshot_observed_at":"2026-08-14T07:51:15.470825Z","submitted_at":"2024-12-09T18:37:14Z","title":"ONEBench to Test Them All: Sample-Level Benchmarking Over Open-Ended Capabilities","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T19:24:17.770148Z"},"links":{"citing_paper":"/paper/2412.06745"},"observation_digest":"sha256:ec45910a573a98ff45b8c11900539019cce3be86eb8138cd8a1f9746094f335f","observation_id":"6e757455-8564-43db-b8f6-733c7f5dec94","resolution":{"observed_at":"2026-08-11T19:24:18.158438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:24:18.197889Z","title":null,"venue":null,"work_id":"0e2a464a-5d88-4beb-90b4-f57b8d90b41d","year":null},"citing_paper":{"arxiv_id":"2412.06745","last_updated":"2025-06-17T15:57:52Z","snapshot_observed_at":"2026-08-14T07:51:15.470825Z","submitted_at":"2024-12-09T18:37:14Z","title":"ONEBench to Test Them All: Sample-Level Benchmarking Over Open-Ended Capabilities","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T19:24:17.773522Z"},"links":{"citing_paper":"/paper/2412.06745"},"observation_digest":"sha256:115ac18f6968179c0a08f0241a393ddb57be72214b31be8ba7194b4f334ee272","observation_id":"2209fb4d-30d5-4d2c-86d2-de1240b84379","resolution":{"observed_at":"2026-08-11T19:24:18.201532Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:24:18.143162Z","title":"decreasing the heat energy of a gas? During an isothermal expansion, a confined ideal gas does 150 J of work","venue":null,"work_id":"95439c81-62f5-4563-81d9-8a5ee054d3be","year":null},"citing_paper":{"arxiv_id":"2412.06745","last_updated":"2025-06-17T15:57:52Z","snapshot_observed_at":"2026-08-14T07:51:15.470825Z","submitted_at":"2024-12-09T18:37:14Z","title":"ONEBench to Test Them All: Sample-Level Benchmarking Over Open-Ended Capabilities","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T19:24:17.776707Z"},"links":{"citing_paper":"/paper/2412.06745"},"observation_digest":"sha256:49846773eefcbb310d777c5f0b51634a53baaad53a19c333289094a7ade714ab","observation_id":"39b74299-4a1e-4453-b2f9-95d8a1c956b2","resolution":{"observed_at":"2026-08-11T19:24:18.147195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:24:18.131540Z","title":"high-quality","venue":null,"work_id":"a83f47ce-0433-479e-9293-f737b7237a40","year":2024},"citing_paper":{"arxiv_id":"2412.06745","last_updated":"2025-06-17T15:57:52Z","snapshot_observed_at":"2026-08-14T07:51:15.470825Z","submitted_at":"2024-12-09T18:37:14Z","title":"ONEBench to Test Them All: Sample-Level Benchmarking Over Open-Ended Capabilities","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T19:24:17.883115Z"},"links":{"citing_paper":"/paper/2412.06745"},"observation_digest":"sha256:75ab4831cf5442dbc485c387409ebffc08c786c4df844729698bc4882a663679","observation_id":"aa7140e3-5b19-462e-b605-662464a3b8c0","resolution":{"observed_at":"2026-08-11T19:24:18.135343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:24:18.119185Z","title":"These pools can be greatly expanded and diversified by expanding to incorporatingall existingLLM and LMM benchmarks","venue":null,"work_id":"a280804d-720e-4648-84c9-a7e09225e66c","year":null},"citing_paper":{"arxiv_id":"2412.06745","last_updated":"2025-06-17T15:57:52Z","snapshot_observed_at":"2026-08-14T07:51:15.470825Z","submitted_at":"2024-12-09T18:37:14Z","title":"ONEBench to Test Them All: Sample-Level Benchmarking Over Open-Ended Capabilities","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T19:24:17.891223Z"},"links":{"citing_paper":"/paper/2412.06745"},"observation_digest":"sha256:1488bed7c6118950db0776cf400320632114b83e0f855a7f6522bcebabf93ae9","observation_id":"7d46f22b-a73f-4e5a-891b-c4695d6d0f8f","resolution":{"observed_at":"2026-08-11T19:24:18.123424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19450","last_updated":"2024-02-29T18:48:18Z","snapshot_observed_at":"2026-08-13T04:06:49.278627Z","submitted_at":"2024-02-29T18:48:18Z","title":"Functional Benchmarks for Robust Evaluation of Reasoning Performance, and the Reasoning Gap","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19450","snapshot_observed_at":"2026-08-11T19:24:17.713429Z","title":"InInternational Conference on Ma- chine Learning, pages 360–368","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06745","last_updated":"2025-06-17T15:57:52Z","snapshot_observed_at":"2026-08-14T07:51:15.470825Z","submitted_at":"2024-12-09T18:37:14Z","title":"ONEBench to Test Them All: Sample-Level Benchmarking Over Open-Ended Capabilities","version":2},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-11T19:24:17.713429Z"},"links":{"cited_paper":"/paper/2402.19450","citing_paper":"/paper/2412.06745"},"observation_digest":"sha256:71966b34e4dd9a5fdf125b0432ef6dc5e1f358fabe11340fc1777aad781b1c74","observation_id":"7b64b2cd-5d17-4a7c-9983-a194ef74fa47","resolution":{"observed_at":"2026-08-11T19:24:17.713429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03714","last_updated":"2023-10-05T17:37:25Z","snapshot_observed_at":"2026-08-04T05:21:05.846165Z","submitted_at":"2023-10-05T17:37:25Z","title":"DSPy: Compiling Declarative Language Model Calls into Self-Improving Pipelines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03714","snapshot_observed_at":"2026-08-11T19:24:17.689075Z","title":"In Computer Vision–ECCV 2016: 14th European Con- ference, Amsterdam, The Netherlands, October 11– 14, 2016, Proceedings, Part IV 14, pages 235–251","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.06745","last_updated":"2025-06-17T15:57:52Z","snapshot_observed_at":"2026-08-14T07:51:15.470825Z","submitted_at":"2024-12-09T18:37:14Z","title":"ONEBench to Test Them All: Sample-Level Benchmarking Over Open-Ended Capabilities","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-11T19:24:17.689075Z"},"links":{"cited_paper":"/paper/2310.03714","citing_paper":"/paper/2412.06745"},"observation_digest":"sha256:a119915bdb2d78b4216f7ebb1c601e28a10a9d306a0aefcef6a31c4466e48f8c","observation_id":"50460282-d1c5-4bbb-818c-f5cb97887a06","resolution":{"observed_at":"2026-08-11T19:24:17.689075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.01818","last_updated":"2021-02-03T00:58:45Z","snapshot_observed_at":"2026-08-11T03:09:26.374884Z","submitted_at":"2021-02-03T00:58:45Z","title":"Memorization vs. Generalization: Quantifying Data Leakage in NLP Performance Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.01818","snapshot_observed_at":"2026-08-11T19:24:17.676182Z","title":"generalization: Quantifying data leakage in nlp performance evaluation.arXiv preprint arXiv:2102.01818","venue":null,"work_id":null,"year":1967},"citing_paper":{"arxiv_id":"2412.06745","last_updated":"2025-06-17T15:57:52Z","snapshot_observed_at":"2026-08-14T07:51:15.470825Z","submitted_at":"2024-12-09T18:37:14Z","title":"ONEBench to Test Them All: Sample-Level Benchmarking Over Open-Ended Capabilities","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-11T19:24:17.676182Z"},"links":{"cited_paper":"/paper/2102.01818","citing_paper":"/paper/2412.06745"},"observation_digest":"sha256:75375e7c2719615e56c935d5848bdb2312c8bc2e886e1c6f788304254a64bc7d","observation_id":"ab076295-4cb9-4034-a2f6-215f70230b11","resolution":{"observed_at":"2026-08-11T19:24:17.676182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21530","last_updated":"2024-08-04T05:53:25Z","snapshot_observed_at":"2026-08-12T23:11:15.343619Z","submitted_at":"2024-07-31T11:26:57Z","title":"Data Contamination Report from the 2024 CONDA Shared Task","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21530","snapshot_observed_at":"2026-08-11T19:24:17.705665Z","title":"Oscar Sainz, Iker García-Ferrero, Alon Jacovi, Jon An- der Campos, Yanai Elazar, Eneko Agirre, Yoav Gold- berg, Wei-Lin Chen, Jenny Chim, Leshem Choshen, and 1 others","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06745","last_updated":"2025-06-17T15:57:52Z","snapshot_observed_at":"2026-08-14T07:51:15.470825Z","submitted_at":"2024-12-09T18:37:14Z","title":"ONEBench to Test Them All: Sample-Level Benchmarking Over Open-Ended Capabilities","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-11T19:24:17.705665Z"},"links":{"cited_paper":"/paper/2407.21530","citing_paper":"/paper/2412.06745"},"observation_digest":"sha256:587e2b739c20f1268de355b81c689881abf2e3ce15befbe7427cf662e704e53c","observation_id":"4ae36895-c721-44f3-bfd2-e0190f64c863","resolution":{"observed_at":"2026-08-11T19:24:17.705665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-11T19:24:17.680849Z","title":"Samir Yitzhak Gadre, Gabriel Ilharco, Alex Fang, Jonathan Hayase, Georgios Smyrnis, Thao Nguyen, Ryan Marten, Mitchell Wortsman, Dhruba Ghosh, Jieyu Zhang, and 1 others","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06745","last_updated":"2025-06-17T15:57:52Z","snapshot_observed_at":"2026-08-14T07:51:15.470825Z","submitted_at":"2024-12-09T18:37:14Z","title":"ONEBench to Test Them All: Sample-Level Benchmarking Over Open-Ended Capabilities","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T19:24:17.680849Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2412.06745"},"observation_digest":"sha256:0f8d51b40d209528ba4536dc91e850d6227cc175bee77c2a4e55d8a5b55f6577","observation_id":"a964547f-d5ea-47ed-bef3-e0f263c30130","resolution":{"observed_at":"2026-08-11T19:24:17.680849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.08572","last_updated":"2023-02-16T20:34:54Z","snapshot_observed_at":"2026-08-14T06:36:56.698346Z","submitted_at":"2023-02-16T20:34:54Z","title":"Towards Reliable Assessments of Demographic Disparities in Multi-Label Image Classifiers","version":1},"cited_work":{"arxiv_id":"2302.08572","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.08572","snapshot_observed_at":"2026-08-11T19:24:18.051883Z","title":"Towards Reliable Assessments of Demographic Disparities in Multi-Label Image Classifiers","venue":"cs.CV","work_id":"47f50687-5585-426e-8886-097f1621602b","year":2023},"citing_paper":{"arxiv_id":"2412.06745","last_updated":"2025-06-17T15:57:52Z","snapshot_observed_at":"2026-08-14T07:51:15.470825Z","submitted_at":"2024-12-09T18:37:14Z","title":"ONEBench to Test Them All: Sample-Level Benchmarking Over Open-Ended Capabilities","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T19:24:17.684622Z"},"links":{"cited_paper":"/paper/2302.08572","citing_paper":"/paper/2412.06745"},"observation_digest":"sha256:38e7d183070681032105b78d655c562da1bbcbb6ee91f28c55683e725bb80de8","observation_id":"c8bc9018-c127-4fa4-aca2-b78c1748846f","resolution":{"observed_at":"2026-08-11T19:24:18.057411Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.06745","last_updated":"2025-06-17T15:57:52Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T07:51:15.470825Z","submitted_at":"2024-12-09T18:37:14Z","title":"ONEBench to Test Them All: Sample-Level Benchmarking Over Open-Ended Capabilities"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":1,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":12},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 1 inbound Pith citation observation for arXiv:2412.06745."}