{"as_of":"2026-08-09T23:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:04527bbd4f16e4357d77a958d94f3f84a09adaa6675e406f20634b4b545bb637","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":40,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T22:35:45.144387Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":18,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":"2311.01964","doi":"10.48550/arxiv.2311.01964","metadata_source":"pith","pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Don't make your llm an evaluation benchmark cheater","venue":"cs.CL","work_id":"7ea5a199-3c68-4578-a9b4-22b8573dcaa3","year":2023},"citing_paper":{"arxiv_id":"2403.03952","last_updated":"2026-04-20T06:05:54Z","snapshot_observed_at":"2026-08-03T00:56:47.399756Z","submitted_at":"2024-03-06T18:56:36Z","title":"Bridging Language and Items for Retrieval and Recommendation: Benchmarking LLMs as Semantic Encoders","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-24T03:03:51.053556Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2403.03952"},"observation_digest":"sha256:9b2d25935ea6185f9c5eef835af4079181742120e7f8a51e366965e7d1471bd9","observation_id":"3aaa96ce-fe7c-4b16-930d-13eb3909db90","resolution":{"observed_at":"2026-05-24T03:05:56.990257Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":"2311.01964","doi":"10.48550/arxiv.2311.01964","metadata_source":"pith","pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Don't make your llm an evaluation benchmark cheater","venue":"cs.CL","work_id":"7ea5a199-3c68-4578-a9b4-22b8573dcaa3","year":2023},"citing_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"reference_index":223,"source":"arxiv_source","source_observed_at":"2026-05-10T17:34:42.565806Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2403.07974"},"observation_digest":"sha256:3ed987f78d49cfad3fe7218ef56e069ffa10c057e5888f8565f6e569c9019ff6","observation_id":"09a21ebc-9711-4355-941f-f7a01f2d0c76","resolution":{"observed_at":"2026-05-10T17:34:42.839749Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":"2311.01964","doi":"10.48550/arxiv.2311.01964","metadata_source":"pith","pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Don't make your llm an evaluation benchmark cheater","venue":"cs.CL","work_id":"7ea5a199-3c68-4578-a9b4-22b8573dcaa3","year":2023},"citing_paper":{"arxiv_id":"2406.04244","last_updated":"2024-06-06T16:41:39Z","snapshot_observed_at":"2026-07-30T15:43:06.151242Z","submitted_at":"2024-06-06T16:41:39Z","title":"Benchmark Data Contamination of Large Language Models: A Survey","version":1},"reference_index":187,"source":"pdf_text","source_observed_at":"2026-05-22T23:10:40.420241Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2406.04244"},"observation_digest":"sha256:2fb69801174b336278ba03f50f1737b160efbb5bec6aec3a4b6376907c2d9b57","observation_id":"01ef215d-f693-4a35-a813-56451877a25c","resolution":{"observed_at":"2026-05-22T23:10:41.160577Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":"2311.01964","doi":"10.48550/arxiv.2311.01964","metadata_source":"pith","pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Don't make your llm an evaluation benchmark cheater","venue":"cs.CL","work_id":"7ea5a199-3c68-4578-a9b4-22b8573dcaa3","year":2023},"citing_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"reference_index":155,"source":"pdf_text","source_observed_at":"2026-05-17T00:05:03.547664Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2406.16860"},"observation_digest":"sha256:0cf7971943650eca026adc6ac1a4d497d87a7546f91772e58078d7bd2156b414","observation_id":"6e87ec1d-90ca-4af7-9894-a408d1a97434","resolution":{"observed_at":"2026-05-17T00:05:03.901359Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":"2311.01964","doi":"10.48550/arxiv.2311.01964","metadata_source":"pith","pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Don't make your llm an evaluation benchmark cheater","venue":"cs.CL","work_id":"7ea5a199-3c68-4578-a9b4-22b8573dcaa3","year":2023},"citing_paper":{"arxiv_id":"2412.14164","last_updated":"2024-12-18T18:58:50Z","snapshot_observed_at":"2026-08-08T15:05:21.947334Z","submitted_at":"2024-12-18T18:58:50Z","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","version":1},"reference_index":197,"source":"arxiv_source","source_observed_at":"2026-05-17T07:51:12.953777Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2412.14164"},"observation_digest":"sha256:bb27f3c66508627ad7afc9e1a0541b08392f09d1fb358aea0b263ea704dea933","observation_id":"11e37873-e86e-4360-8c9d-92532dc29dd4","resolution":{"observed_at":"2026-05-17T07:51:13.131940Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-09T22:35:45.144387Z","title":"X., Chen, X., Lin, Y., Wen, J.-R., and Han, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18771","last_updated":"2025-01-30T21:51:18Z","snapshot_observed_at":"2026-08-09T22:28:37.617865Z","submitted_at":"2025-01-30T21:51:18Z","title":"Overestimation in LLM Evaluation: A Controlled Large-Scale Study on Data Contamination's Impact on Machine Translation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-09T22:35:45.144387Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2501.18771"},"observation_digest":"sha256:67a9ef9f92388411c5d1d1d4b2aade0196bad90b947eae73391d8b1d716fb6b3","observation_id":"11b8b444-9008-475b-97b5-361819185eb7","resolution":{"observed_at":"2026-08-09T22:35:45.144387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-09T10:26:07.046518Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02988","last_updated":"2025-02-05T08:35:55Z","snapshot_observed_at":"2026-08-09T19:33:12.301428Z","submitted_at":"2025-02-05T08:35:55Z","title":"Training an LLM-as-a-Judge Model: Pipeline, Insights, and Practical Lessons","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-09T10:26:07.046518Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2502.02988"},"observation_digest":"sha256:45a0c78dd9887a198cdfb022495795a39ebb456c4ade8da3bf4ceb8fb206f0f5","observation_id":"baffcdb0-75e8-4e3c-ba63-4cef2ebc7c87","resolution":{"observed_at":"2026-08-09T10:26:07.046518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-08T14:51:15.499571Z","title":"X., Chen, X., Lin, Y ., Wen, J.-R., and Han, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06655","last_updated":"2025-05-12T14:34:05Z","snapshot_observed_at":"2026-08-09T21:31:57.433219Z","submitted_at":"2025-02-10T16:45:18Z","title":"Unbiased Evaluation of Large Language Models from a Causal Perspective","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T14:51:15.499571Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2502.06655"},"observation_digest":"sha256:8b0924ee9ead8247eee0859e4601cceb50b4e3925d7bf577fe5c3cd14f5ebae8","observation_id":"a45fb792-6052-4f45-a804-274711e4840e","resolution":{"observed_at":"2026-08-08T14:51:15.499571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-08T14:47:07.948894Z","title":"Don’t make your llm an evaluation benchmark cheater,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06664","last_updated":"2025-02-24T10:07:54Z","snapshot_observed_at":"2026-08-08T14:41:57.380685Z","submitted_at":"2025-02-10T16:51:11Z","title":"Evaluation of Deep Audio Representations for Hearables","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T14:47:07.948894Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2502.06664"},"observation_digest":"sha256:fb858f8bc0f8c1749729ebf2444b9ccd711d646e97c056c061279f4cfcc8a409","observation_id":"da61f099-43c0-4391-b0e5-9c8fdf2484e3","resolution":{"observed_at":"2026-08-08T14:47:07.948894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-07T14:13:41.882888Z","title":"arXiv preprint arXiv:2311.01964 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19658","last_updated":"2025-05-26T08:18:30Z","snapshot_observed_at":"2026-08-07T14:06:58.090431Z","submitted_at":"2025-05-26T08:18:30Z","title":"Large Language Models in Code Co-generation for Safe Autonomous Vehicles","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:41.882888Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2505.19658"},"observation_digest":"sha256:f3378070b9cc2282d253c911cf1df44c986940ad625c24666f559e2e826dc4ca","observation_id":"34222d53-6312-45f7-80db-5a4f47696879","resolution":{"observed_at":"2026-08-07T14:13:41.882888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-07T10:54:26.413010Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04142","last_updated":"2025-06-04T16:33:44Z","snapshot_observed_at":"2026-08-07T21:43:19.257599Z","submitted_at":"2025-06-04T16:33:44Z","title":"Establishing Trustworthy LLM Evaluation via Shortcut Neuron Analysis","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:26.413010Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2506.04142"},"observation_digest":"sha256:9413115bb8a1097502212b0c4e615c4c5556871546aa08d960bf831df8c9a501","observation_id":"5e2361a0-1672-422d-8945-2dc470f45371","resolution":{"observed_at":"2026-08-07T10:54:26.413010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-06T23:25:53.137574Z","title":"X., Chen, X., Lin, Y., Wen, J.-R., and Han, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18213","last_updated":"2025-06-23T00:19:27Z","snapshot_observed_at":"2026-08-07T10:41:05.932475Z","submitted_at":"2025-06-23T00:19:27Z","title":"A Conceptual Framework for AI Capability Evaluations","version":1},"reference_index":103,"source":"arxiv_source","source_observed_at":"2026-08-06T23:25:53.137574Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2506.18213"},"observation_digest":"sha256:d7230bc969ed45f71f8ec8d5714c4203ec3f7662856eb2de3668daa29ce51146","observation_id":"3983b9a3-1339-405a-8c93-7ae58305dce3","resolution":{"observed_at":"2026-08-06T23:25:53.137574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-07T00:23:50.793745Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-09T17:21:22.313358Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:50.793745Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:9d2e6427b4663002b2e30fe27f207104b41176a877da33409d6b33cebcf77830","observation_id":"c201a5ad-d818-43c7-b7a5-0128eba0b6ae","resolution":{"observed_at":"2026-08-07T00:23:50.793745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-06T20:24:28.438581Z","title":"Don’t make your llm an evaluation benchmark cheater","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02825","last_updated":"2025-08-07T06:58:08Z","snapshot_observed_at":"2026-08-09T13:14:30.968472Z","submitted_at":"2025-07-03T17:35:31Z","title":"Establishing Best Practices for Building Rigorous Agentic Benchmarks","version":5},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:28.438581Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2507.02825"},"observation_digest":"sha256:4ac6cee011478fb3d11962d7d47e4731413a933c519b0654a7d23d9263cee8f7","observation_id":"11652142-6a23-4b3c-b5d8-bee15e27fe51","resolution":{"observed_at":"2026-08-06T20:24:28.438581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-06T19:47:49.856525Z","title":"X.; Chen, X.; Lin, Y.; Wen, J.-R.; and Han, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04641","last_updated":"2025-07-07T03:49:58Z","snapshot_observed_at":"2026-08-07T22:35:20.197323Z","submitted_at":"2025-07-07T03:49:58Z","title":"Toward Valid Measurement Of (Un)fairness For Generative AI: A Proposal For Systematization Through The Lens Of Fair Equality of Chances","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-06T19:47:49.856525Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2507.04641"},"observation_digest":"sha256:9653d7cf00bf3ed66750a6ca26282d5d8edbd363a3fefd152920fac4537e10a3","observation_id":"5a5eeb3d-ad4e-4eb4-807a-a8526dd0d0aa","resolution":{"observed_at":"2026-08-06T19:47:49.856525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-06T21:43:41.764235Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05266","last_updated":"2025-06-30T06:14:32Z","snapshot_observed_at":"2026-08-09T18:08:17.943936Z","submitted_at":"2025-06-30T06:14:32Z","title":"User Behavior Prediction as a Generic, Robust, Scalable, and Low-Cost Evaluation Strategy for Estimating Generalization in LLMs","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-06T21:43:41.764235Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2507.05266"},"observation_digest":"sha256:84d7ac2f8fae7ad47e176f3e738a66a3bd397aabd82de7f73933a06e352d1acc","observation_id":"5ecc2e53-7f59-435d-afc4-b5bb1194e4e6","resolution":{"observed_at":"2026-08-06T21:43:41.764235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-06T19:07:40.530184Z","title":"X., Chen, X., Lin, Y., Wen, J.-R., and Han, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06434","last_updated":"2025-07-08T22:29:06Z","snapshot_observed_at":"2026-08-08T23:28:38.307914Z","submitted_at":"2025-07-08T22:29:06Z","title":"Deprecating Benchmarks: Criteria and Framework","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T19:07:40.530184Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2507.06434"},"observation_digest":"sha256:a221674d229faddc4e53f6e95408ac8432a194357cd0585a7ec1cd7c3e9856fd","observation_id":"a680c7fb-277d-4b9c-a183-19a2afd2d214","resolution":{"observed_at":"2026-08-06T19:07:40.530184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-05T16:50:28.964070Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17767","last_updated":"2025-09-13T01:49:58Z","snapshot_observed_at":"2026-08-09T14:04:06.593076Z","submitted_at":"2025-08-25T08:04:20Z","title":"ISACL: Internal State Analyzer for Copyrighted Training Data Leakage","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-05T16:50:28.964070Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2508.17767"},"observation_digest":"sha256:8a46fc89e453fed32436e22060cb20cb0413c735c3d2b53c294aed2b4af76f7b","observation_id":"97aa3bc0-878f-47d6-8b62-1e86e5b135dd","resolution":{"observed_at":"2026-08-05T16:50:28.964070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-05T14:44:28.055272Z","title":"Don’t make your llm an evaluation benchmark cheater,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21003","last_updated":"2025-08-28T17:04:43Z","snapshot_observed_at":"2026-08-07T20:33:39.576182Z","submitted_at":"2025-08-28T17:04:43Z","title":"InSQuAD: In-Context Learning for Efficient Retrieval via Submodular Mutual Information to Enforce Quality and Diversity","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T14:44:28.055272Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2508.21003"},"observation_digest":"sha256:b114053855ab561fbd366daa331c7cfb67293810bf9bb07bf9e28830ca861ce8","observation_id":"814f58bc-4f4b-435d-92ee-04ac5bae3038","resolution":{"observed_at":"2026-08-05T14:44:28.055272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":"2311.01964","doi":"10.48550/arxiv.2311.01964","metadata_source":"pith","pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Don't make your llm an evaluation benchmark cheater","venue":"cs.CL","work_id":"7ea5a199-3c68-4578-a9b4-22b8573dcaa3","year":2023},"citing_paper":{"arxiv_id":"2509.20909","last_updated":"2026-05-09T19:01:47Z","snapshot_observed_at":"2026-08-02T22:05:17.866277Z","submitted_at":"2025-09-25T08:55:18Z","title":"LogitTrace: Detecting Benchmark Contamination via Layerwise Logit Trajectories","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-18T14:32:57.426996Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2509.20909"},"observation_digest":"sha256:a5ee7275b536e4e157eb279911effa2e566ddd14a954b3f02799add504577569","observation_id":"ca9ba4eb-c67c-4ba0-94b8-5b5319d0bcc5","resolution":{"observed_at":"2026-05-18T14:36:28.964642Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-04T13:29:04.649764Z","title":"X., CHEN, X., LIN, Y., WEN, J.-R.,ANDHAN, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.00481","last_updated":"2026-05-30T15:21:07Z","snapshot_observed_at":"2026-08-08T11:19:05.561387Z","submitted_at":"2025-10-01T04:03:51Z","title":"Make a Video Call with LLM: A Measurement Campaign over Six Mainstream Apps","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-04T13:29:04.649764Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2510.00481"},"observation_digest":"sha256:54ec4f877165e5a25227436cafe93fab7dd92d4db03d86a713ed115a16cf42af","observation_id":"62e80328-de9e-46ef-8346-c51a5dec4830","resolution":{"observed_at":"2026-08-04T13:29:04.649764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":"2311.01964","doi":"10.48550/arxiv.2311.01964","metadata_source":"pith","pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Don't make your llm an evaluation benchmark cheater","venue":"cs.CL","work_id":"7ea5a199-3c68-4578-a9b4-22b8573dcaa3","year":2023},"citing_paper":{"arxiv_id":"2601.12910","last_updated":"2026-04-22T09:40:34Z","snapshot_observed_at":"2026-08-02T17:38:14.873275Z","submitted_at":"2026-01-19T10:04:33Z","title":"SciCoQA: Quality Assurance for Scientific Paper--Code Alignment","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T13:20:07.741347Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2601.12910"},"observation_digest":"sha256:ff8912cd3155d65298a8b40fded1e06fbf7955f4384cf7aeacfebf822ae28c8b","observation_id":"13edee3e-fa11-45a1-a31e-00ca70fb6dd7","resolution":{"observed_at":"2026-05-16T13:20:57.867847Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-02T23:32:09.809875Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.13626","last_updated":"2026-05-26T14:18:40Z","snapshot_observed_at":"2026-08-02T23:32:06.387048Z","submitted_at":"2026-02-14T06:34:19Z","title":"Benchmark Leakage Trap: Can We Trust LLM-based Recommendation?","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-02T23:32:09.809875Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2602.13626"},"observation_digest":"sha256:0922145c8d09f7580914e6a276e04c107f43f752da1a5f553998aef93e94dd1e","observation_id":"0be77a86-62d8-4578-a0e6-0e23617115be","resolution":{"observed_at":"2026-08-02T23:32:09.809875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":"2311.01964","doi":"10.48550/arxiv.2311.01964","metadata_source":"pith","pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Don't make your llm an evaluation benchmark cheater","venue":"cs.CL","work_id":"7ea5a199-3c68-4578-a9b4-22b8573dcaa3","year":2023},"citing_paper":{"arxiv_id":"2603.18916","last_updated":"2026-04-12T07:45:59Z","snapshot_observed_at":"2026-07-06T22:49:42.664225Z","submitted_at":"2026-03-19T13:52:17Z","title":"Agentic Business Process Management: A Research Manifesto","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-15T08:24:56.763438Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2603.18916"},"observation_digest":"sha256:f6a3e3b6f80220c9797bcd3aa164264b1cf26606bf7b49018cee9e87efe9bf38","observation_id":"fb03d784-d5ec-47bb-b80b-073e1a2b49b2","resolution":{"observed_at":"2026-05-15T08:25:18.811678Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":"2311.01964","doi":"10.48550/arxiv.2311.01964","metadata_source":"pith","pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Don't make your llm an evaluation benchmark cheater","venue":"cs.CL","work_id":"7ea5a199-3c68-4578-a9b4-22b8573dcaa3","year":2023},"citing_paper":{"arxiv_id":"2604.04815","last_updated":"2026-04-20T15:33:20Z","snapshot_observed_at":"2026-08-03T13:56:37.976114Z","submitted_at":"2026-04-06T16:20:47Z","title":"LiveFact: A Dynamic, Time-Aware Benchmark for LLM-Driven Fake News Detection","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T20:30:53.094207Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2604.04815"},"observation_digest":"sha256:7123f45063e1de4621459efe4ffb767938fa853f9beeda5f8db6c1d49d4c8f67","observation_id":"22ed82ce-384d-4802-8fd1-d4c1ae345d65","resolution":{"observed_at":"2026-05-10T21:55:49.393337Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":"2311.01964","doi":"10.48550/arxiv.2311.01964","metadata_source":"pith","pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Don't make your llm an evaluation benchmark cheater","venue":"cs.CL","work_id":"7ea5a199-3c68-4578-a9b4-22b8573dcaa3","year":2023},"citing_paper":{"arxiv_id":"2604.06802","last_updated":"2026-06-23T06:45:36Z","snapshot_observed_at":"2026-07-13T08:50:52.244397Z","submitted_at":"2026-04-08T08:16:37Z","title":"Riemann-Bench: A Benchmark for Moonshot Mathematics","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T18:02:42.607682Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2604.06802"},"observation_digest":"sha256:9792628b9a85c7ab502cb3bc6df4efca272d3381c5666c236510622c9e87607e","observation_id":"a69ccd46-f3ac-4193-967f-d2b183c8a583","resolution":{"observed_at":"2026-05-11T05:36:00.811359Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":"2311.01964","doi":"10.48550/arxiv.2311.01964","metadata_source":"pith","pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Don't make your llm an evaluation benchmark cheater","venue":"cs.CL","work_id":"7ea5a199-3c68-4578-a9b4-22b8573dcaa3","year":2023},"citing_paper":{"arxiv_id":"2604.07650","last_updated":"2026-04-08T23:32:06Z","snapshot_observed_at":"2026-08-09T16:26:14.685053Z","submitted_at":"2026-04-08T23:32:06Z","title":"How Independent are Large Language Models? A Statistical Framework for Auditing Behavioral Entanglement and Reweighting Verifier Ensembles","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T17:13:04.305435Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2604.07650"},"observation_digest":"sha256:9b951363551e5c509661506bda2ecc5387243cb0c5a4e22a2577bcc49269cc0a","observation_id":"227c3cac-82a2-40f0-be47-0d92e3231ded","resolution":{"observed_at":"2026-05-11T07:20:58.932401Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":"2311.01964","doi":"10.48550/arxiv.2311.01964","metadata_source":"pith","pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Don't make your llm an evaluation benchmark cheater","venue":"cs.CL","work_id":"7ea5a199-3c68-4578-a9b4-22b8573dcaa3","year":2023},"citing_paper":{"arxiv_id":"2604.20273","last_updated":"2026-04-22T07:20:03Z","snapshot_observed_at":"2026-07-06T23:06:44.624357Z","submitted_at":"2026-04-22T07:20:03Z","title":"ActuBench: A Multi-Agent LLM Pipeline for Generation and Evaluation of Actuarial Reasoning Tasks","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T00:35:24.397273Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2604.20273"},"observation_digest":"sha256:b6b74412fe799c33657e7436d3c049c58f5b756c37670dfa0e08b174e0120183","observation_id":"5d80a5c7-a48b-4c8f-831f-22fbfb20d00a","resolution":{"observed_at":"2026-05-11T13:46:05.207324Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":"2311.01964","doi":"10.48550/arxiv.2311.01964","metadata_source":"pith","pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Don't make your llm an evaluation benchmark cheater","venue":"cs.CL","work_id":"7ea5a199-3c68-4578-a9b4-22b8573dcaa3","year":2023},"citing_paper":{"arxiv_id":"2604.23067","last_updated":"2026-04-24T23:37:17Z","snapshot_observed_at":"2026-08-02T12:00:10.017635Z","submitted_at":"2026-04-24T23:37:17Z","title":"Training a General Purpose Automated Red Teaming Model","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-08T11:20:09.224745Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2604.23067"},"observation_digest":"sha256:ba4d2a26445a0e24ff1f2026b8031ae9fd8ef9d071d7223334a153e05eeddff2","observation_id":"d1555bcf-9371-468c-b0c0-4efe0b8c70e2","resolution":{"observed_at":"2026-05-11T19:41:08.319868Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":"2311.01964","doi":"10.48550/arxiv.2311.01964","metadata_source":"pith","pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Don't make your llm an evaluation benchmark cheater","venue":"cs.CL","work_id":"7ea5a199-3c68-4578-a9b4-22b8573dcaa3","year":2023},"citing_paper":{"arxiv_id":"2604.24544","last_updated":"2026-04-27T14:39:41Z","snapshot_observed_at":"2026-07-06T23:10:33.821313Z","submitted_at":"2026-04-27T14:39:41Z","title":"STELLAR-E: a Synthetic, Tailored, End-to-end LLM Application Rigorous Evaluator","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-08T03:39:30.528601Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2604.24544"},"observation_digest":"sha256:0bbf935c2e3010002e687128835666118ec9f1e906280e21c7884fb8032634eb","observation_id":"dbdfad1f-74b3-4fa4-9dc4-5dd2f0084784","resolution":{"observed_at":"2026-05-11T22:01:10.945701Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":"2311.01964","doi":"10.48550/arxiv.2311.01964","metadata_source":"pith","pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Don't make your llm an evaluation benchmark cheater","venue":"cs.CL","work_id":"7ea5a199-3c68-4578-a9b4-22b8573dcaa3","year":2023},"citing_paper":{"arxiv_id":"2604.24819","last_updated":"2026-04-27T14:05:18Z","snapshot_observed_at":"2026-08-03T03:44:08.503208Z","submitted_at":"2026-04-27T14:05:18Z","title":"Programming with Data: Test-Driven Data Engineering for Self-Improving LLMs from Raw Corpora","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-08T03:13:30.648190Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2604.24819"},"observation_digest":"sha256:64297becc1f9751081b3e50bf224fd6104e2d30fa8f98f53b7160f514641010c","observation_id":"2e23b564-b627-4049-8ba4-b2fd10035453","resolution":{"observed_at":"2026-05-11T22:11:16.280192Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":"2311.01964","doi":"10.48550/arxiv.2311.01964","metadata_source":"pith","pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Don't make your llm an evaluation benchmark cheater","venue":"cs.CL","work_id":"7ea5a199-3c68-4578-a9b4-22b8573dcaa3","year":2023},"citing_paper":{"arxiv_id":"2605.08838","last_updated":"2026-05-09T09:48:50Z","snapshot_observed_at":"2026-07-06T23:21:02.177557Z","submitted_at":"2026-05-09T09:48:50Z","title":"Generating Leakage-Free Benchmarks for Robust RAG Evaluation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T03:04:39.253429Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2605.08838"},"observation_digest":"sha256:29a816068fdb0f78c49a8bc0eae123d269f32b18814c65dc885354a2a6f0380b","observation_id":"f8720662-6515-4a69-bcce-5408c93bda67","resolution":{"observed_at":"2026-05-12T03:06:18.948679Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":"2311.01964","doi":"10.48550/arxiv.2311.01964","metadata_source":"pith","pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Don't make your llm an evaluation benchmark cheater","venue":"cs.CL","work_id":"7ea5a199-3c68-4578-a9b4-22b8573dcaa3","year":2023},"citing_paper":{"arxiv_id":"2605.21543","last_updated":"2026-05-20T09:16:39Z","snapshot_observed_at":"2026-08-01T19:04:50.092578Z","submitted_at":"2026-05-20T09:16:39Z","title":"Provable Joint Decontamination for Benchmarking Multiple Large Language Models","version":1},"reference_index":181,"source":"arxiv_source","source_observed_at":"2026-05-22T00:40:54.038367Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2605.21543"},"observation_digest":"sha256:cedf0c19f65afc203503038b6f63b5f176cf287c595a2d9b2441985b0f14ba3d","observation_id":"d5bf708a-2ecb-4cc9-8afa-52f0f61be15f","resolution":{"observed_at":"2026-05-22T00:44:29.503089Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":"2311.01964","doi":"10.48550/arxiv.2311.01964","metadata_source":"pith","pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Don't make your llm an evaluation benchmark cheater","venue":"cs.CL","work_id":"7ea5a199-3c68-4578-a9b4-22b8573dcaa3","year":2023},"citing_paper":{"arxiv_id":"2605.23628","last_updated":"2026-05-22T13:40:00Z","snapshot_observed_at":"2026-07-06T23:33:49.013121Z","submitted_at":"2026-05-22T13:40:00Z","title":"How Hard is it to Rig a Benchmark? A Social Choice Analysis of Leaderboard Robustness","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-25T04:37:01.537128Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2605.23628"},"observation_digest":"sha256:3063874e940ee84d2a648bb77bfe6edf4d79c579ab5de34cecd7da5472c73c67","observation_id":"6ac7c5d0-9059-4a44-9a04-cdcff63d2890","resolution":{"observed_at":"2026-05-25T04:40:24.435108Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":"2311.01964","doi":"10.48550/arxiv.2311.01964","metadata_source":"pith","pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Don't make your llm an evaluation benchmark cheater","venue":"cs.CL","work_id":"7ea5a199-3c68-4578-a9b4-22b8573dcaa3","year":2023},"citing_paper":{"arxiv_id":"2605.26133","last_updated":"2026-05-21T10:32:33Z","snapshot_observed_at":"2026-08-07T10:44:40.983544Z","submitted_at":"2026-05-21T10:32:33Z","title":"Pretraining Data Exposure in Large Language Models: A Survey of Membership Inference, Data Contamination, and Security Implications","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-30T17:20:16.735285Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2605.26133"},"observation_digest":"sha256:437259af7f1e4a4dd6f885f5b449f58255afac52bf0695dc8b8bc2fa15d2166c","observation_id":"7feb40be-8f95-4344-97f7-80e1ed66da49","resolution":{"observed_at":"2026-06-30T17:24:56.540890Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":"2311.01964","doi":"10.48550/arxiv.2311.01964","metadata_source":"pith","pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Don't make your llm an evaluation benchmark cheater","venue":"cs.CL","work_id":"7ea5a199-3c68-4578-a9b4-22b8573dcaa3","year":2023},"citing_paper":{"arxiv_id":"2605.30916","last_updated":"2026-05-29T07:01:38Z","snapshot_observed_at":"2026-08-06T11:05:12.049404Z","submitted_at":"2026-05-29T07:01:38Z","title":"Welfare, Improvability, and Variance: A Principal-Agent Approach to Optimal Benchmark Item Aggregation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-06-28T23:49:57.580051Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2605.30916"},"observation_digest":"sha256:1c36f01b2dde2443b84ea4ac476f1679952894eaf9ae126ff985719ec8a8daf8","observation_id":"3f65e975-0d9d-4cb3-a563-06e43cae517f","resolution":{"observed_at":"2026-06-28T23:52:49.465940Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":"2311.01964","doi":"10.48550/arxiv.2311.01964","metadata_source":"pith","pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Don't make your llm an evaluation benchmark cheater","venue":"cs.CL","work_id":"7ea5a199-3c68-4578-a9b4-22b8573dcaa3","year":2023},"citing_paper":{"arxiv_id":"2606.11166","last_updated":"2026-06-09T17:46:10Z","snapshot_observed_at":"2026-08-07T21:17:06.825949Z","submitted_at":"2026-06-09T17:46:10Z","title":"Flaws in the LLM Automation Narrative","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T10:52:36.252919Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2606.11166"},"observation_digest":"sha256:ff28ce4015f538fda4fd5df6a11dc31b48fdf85651ce84e1ef69625ae132bdca","observation_id":"119018cb-5232-4f83-8943-cac3dbc2a450","resolution":{"observed_at":"2026-07-03T08:17:45.290264Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":"2311.01964","doi":"10.48550/arxiv.2311.01964","metadata_source":"pith","pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Don't make your llm an evaluation benchmark cheater","venue":"cs.CL","work_id":"7ea5a199-3c68-4578-a9b4-22b8573dcaa3","year":2023},"citing_paper":{"arxiv_id":"2606.28863","last_updated":"2026-06-27T11:12:17Z","snapshot_observed_at":"2026-07-07T00:02:52.539331Z","submitted_at":"2026-06-27T11:12:17Z","title":"Defeat Devices in AI Systems","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-06-30T08:34:58.879346Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2606.28863"},"observation_digest":"sha256:a216b61e15283fb0a8265744c09172c38d636b0fe68605535969ca9fa2d19a45","observation_id":"c4eb3bdd-b34a-46fb-aca3-ecf7dea39295","resolution":{"observed_at":"2026-06-30T08:44:27.875364Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":"2311.01964","doi":"10.48550/arxiv.2311.01964","metadata_source":"pith","pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Don't make your llm an evaluation benchmark cheater","venue":"cs.CL","work_id":"7ea5a199-3c68-4578-a9b4-22b8573dcaa3","year":2023},"citing_paper":{"arxiv_id":"2607.08009","last_updated":"2026-07-09T00:27:07Z","snapshot_observed_at":"2026-08-03T01:18:12.663488Z","submitted_at":"2026-07-09T00:27:07Z","title":"From Execution to Education: A Bloom-Aligned Framework for Measuring Educational Control in LLMs","version":1},"reference_index":208,"source":"arxiv_source","source_observed_at":"2026-07-10T13:49:17.343893Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2607.08009"},"observation_digest":"sha256:c943815497158504a4f5ea154b34690e7d1910e9757e37f142eef8af0ce8494d","observation_id":"be1c851b-6620-4735-9841-8d4ecfb0c51c","resolution":{"observed_at":"2026-07-10T13:57:06.719623Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-06T17:07:02.934623Z","title":"arXiv preprint arXiv:2311.01964 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04772","last_updated":"2026-08-05T12:37:31Z","snapshot_observed_at":"2026-08-09T16:50:45.958967Z","submitted_at":"2026-08-05T12:37:31Z","title":"Guideline-as-Oracle: Zero-Annotation Training of an Ophthalmic Telephone Triage Agent","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T17:07:02.934623Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2608.04772"},"observation_digest":"sha256:2f9bd0d255d9db99278b3881ac8d0b4c7a5d0197a1342e6281766c9bccd05336","observation_id":"4bd18683-eceb-42fc-acc7-3c6ea3c4f451","resolution":{"observed_at":"2026-08-06T17:07:02.934623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2311.01964/citation-record","integrity":"/paper/2311.01964/integrity","json":"/paper/2311.01964/citation-record.json","paper":"/paper/2311.01964"},"outbound":[],"paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 40 inbound Pith citation observations for arXiv:2311.01964."}