{"as_of":"2026-08-16T17:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1e3b2b0f6e52c1ab253f2de6071e06927f15159965d190cc903880962d52490d","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:04:24.060625Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.02786/citation-record","integrity":"/paper/2608.02786/integrity","json":"/paper/2608.02786/citation-record.json","paper":"/paper/2608.02786"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:04:26.223282Z","title":"AI, algorithmic, and automa- tion incidents and controversies (AIAAIC)","venue":null,"work_id":"c0d51cf9-b9af-4f83-bba0-6ac06c70ba89","year":2023},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T16:58:21.791264Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:23.583205Z"},"links":{"citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:0325207b113ee5b9df5ce31c66274102e97612e2621abf45abb1bcbf515b0d20","observation_id":"2f35660b-2527-48d6-a312-425aad65e843","resolution":{"observed_at":"2026-08-15T15:04:26.230100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:04:26.168120Z","title":"Amershi, A","venue":null,"work_id":"374ded95-347a-469f-ad0d-73168e29f806","year":2019},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T16:58:21.791264Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:23.615655Z"},"links":{"citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:e728b5d1e426b18875bcebb4e7024f4d9286a2a3cf93a4fde61a6626c0a29b89","observation_id":"479a26f6-5d22-4eeb-98b5-ae8f76ca2e57","resolution":{"observed_at":"2026-08-15T15:04:26.188822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-16T03:49:00.703994Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-15T15:04:23.627074Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T16:58:21.791264Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:23.627074Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:88284de8094db7e8744e747128370373c08673150e8f3bb1a14a6c8bfcbffc5c","observation_id":"946d5e6c-6ccd-400c-bf53-f37308b2cd25","resolution":{"observed_at":"2026-08-15T15:04:23.627074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:04:26.112472Z","title":null,"venue":null,"work_id":"7fe71cb6-b7b5-4cac-b594-ed48994bb417","year":2021},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T16:58:21.791264Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:23.635747Z"},"links":{"citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:48b87934ed8a01564a75e28d2f4de156125a255ae12c89ec3595d61cb16af3b1","observation_id":"1a3e2fa3-0649-4a46-a5b7-c6696cc4c56e","resolution":{"observed_at":"2026-08-15T15:04:26.118990Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:04:26.072866Z","title":"Air canada chatbot liable for misin- formation on bereavement fares","venue":null,"work_id":"a2ee9760-72cc-4bdc-bf9f-f95aba5c894c","year":2023},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T16:58:21.791264Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:23.656764Z"},"links":{"citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:1aa7d8cc9d9641b00355a4ca3d9700ec2b84b12f4b3194e31110793d79aa8462","observation_id":"30c17db6-ca0f-41bc-9d90-4ac7a3cdd516","resolution":{"observed_at":"2026-08-15T15:04:26.088370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:04:26.028220Z","title":"Reg- ulation (EU) 2022/2554 on digital oper- ational resilience for the financial sector (DORA)","venue":null,"work_id":"361198b9-58ba-49df-8514-786a517cb658","year":2022},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T16:58:21.791264Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:23.697745Z"},"links":{"citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:4b59291e20233b5e5c961df5ad533d80f0fe80770bf651e2dba7acf00bb1d08d","observation_id":"08c7f2d2-ff2d-481a-9a88-a8dba037ecf3","resolution":{"observed_at":"2026-08-15T15:04:26.044760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:04:25.991013Z","title":"Reg- ulation (EU) 2024/1689 of the european parliament and of the council laying down harmonised rules on artificial intelligence (Artificial Intelligence Act)","venue":null,"work_id":"639ed128-f1cb-4e87-abb4-27208e5a169c","year":2024},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T16:58:21.791264Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:23.703996Z"},"links":{"citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:8d6281f28d40735c8780c1c81968bd330a52c0075ecb6f04381505f63c5afef0","observation_id":"73173ad7-777a-4743-b13a-3951cde5be8d","resolution":{"observed_at":"2026-08-15T15:04:26.009590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:04:25.920709Z","title":"Artificial in- telligence in financial services: Review of firms’ approaches to consumer duty com- pliance","venue":null,"work_id":"0a0640a4-d4c7-4f03-8881-c3b2c1f99017","year":2024},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T16:58:21.791264Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:23.715153Z"},"links":{"citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:4cc1ba814922e77b41174bbbfac0192ad878cd51749be49f58273c50e941d514","observation_id":"fd5e9466-f582-4561-a164-a36cf9df61c0","resolution":{"observed_at":"2026-08-15T15:04:25.931900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.03238","last_updated":"2026-07-09T16:49:37Z","snapshot_observed_at":"2026-08-13T16:47:09.190218Z","submitted_at":"2026-06-02T06:55:52Z","title":"When RLHF Fails: A Mechanistic Taxonomy of Reward Hacking, Collapse, and Evaluator Gaming","version":2},"cited_work":{"arxiv_id":"2606.03238","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.03238","snapshot_observed_at":"2026-08-15T15:04:25.106719Z","title":"When RLHF Fails: A Mechanistic Taxonomy of Reward Hacking, Collapse, and Evaluator Gaming","venue":"cs.LG","work_id":"1158f860-e09e-47c7-8d40-f01c13b94fc0","year":2026},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T16:58:21.791264Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:23.722499Z"},"links":{"cited_paper":"/paper/2606.03238","citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:7cb0f7f907c9fa10147d40fd758d9b6942d5d7edeb6a9003706683d9eaf6b987","observation_id":"3868427a-af40-4d44-b434-ca88c54d0745","resolution":{"observed_at":"2026-08-15T15:04:25.121819Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12173","last_updated":"2023-05-05T14:26:17Z","snapshot_observed_at":"2026-08-12T14:45:22.117576Z","submitted_at":"2023-02-23T17:14:38Z","title":"Not what you've signed up for: Compromising Real-World LLM-Integrated Applications with Indirect Prompt Injection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12173","snapshot_observed_at":"2026-08-15T15:04:23.732184Z","title":"Greshake, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T16:58:21.791264Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:23.732184Z"},"links":{"cited_paper":"/paper/2302.12173","citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:d65f3aa7f13f84d2f073f5498bc6b41dc4be5b18cffbf8b29b694eacb61c7a7c","observation_id":"6e003452-1c2d-4d95-92bf-4921e4227ea0","resolution":{"observed_at":"2026-08-15T15:04:23.732184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05232","last_updated":"2024-11-19T12:42:45Z","snapshot_observed_at":"2026-07-06T16:45:07.733095Z","submitted_at":"2023-11-09T09:25:37Z","title":"A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05232","snapshot_observed_at":"2026-08-15T15:04:23.751900Z","title":"Huang, W","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T16:58:21.791264Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:23.751900Z"},"links":{"cited_paper":"/paper/2311.05232","citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:a32e63f8ca1c174d62b5cf48c4522a377eb98d55c76a51a9dfe53a7730144a2f","observation_id":"dcce6e00-c871-4bc3-b890-26316eb67ae8","resolution":{"observed_at":"2026-08-15T15:04:23.751900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:04:25.879486Z","title":"Fix GRPO importance sampling ratio: Replace per-token with sequence-mean in KL bias correction (PR #6594)","venue":null,"work_id":"1e1109e6-1563-4abf-9977-1de9e1d9ba15","year":2024},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T16:58:21.791264Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:23.771184Z"},"links":{"citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:44b28b39324684b34b65f476c80b8866325b352b68cd58e43f66f6b3af94db9d","observation_id":"e6ae260f-227d-4d24-9c09-04f4a1e07920","resolution":{"observed_at":"2026-08-15T15:04:25.890032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:04:25.854964Z","title":null,"venue":null,"work_id":"830e10b5-987f-4bd5-8d0b-4c469f918417","year":2023},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T16:58:21.791264Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:23.778382Z"},"links":{"citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:bd2b076e29147577bd3b2a89af62fc71b6cf750e6b447107a06ec3426a84a61c","observation_id":"8ea11412-17b1-48bb-8b1d-54037b74223c","resolution":{"observed_at":"2026-08-15T15:04:25.862065Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2607.09999","last_updated":"2026-07-23T13:41:45Z","snapshot_observed_at":"2026-08-10T15:58:03.209700Z","submitted_at":"2026-07-10T21:55:05Z","title":"Silent Failures in Quantized LLM Reasoning: A Taxonomy-Based Analysis of Hollow Convergence and Failure Mode Shifts","version":2},"cited_work":{"arxiv_id":"2607.09999","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.09999","snapshot_observed_at":"2026-08-15T15:04:24.888530Z","title":"Silent Failures in Quantized LLM Reasoning: A Taxonomy-Based Analysis of Hollow Convergence and Failure Mode Shifts","venue":"cs.CL","work_id":"6b594e4a-9baa-4a47-90c4-3e53043572fa","year":2026},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T16:58:21.791264Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:23.787393Z"},"links":{"cited_paper":"/paper/2607.09999","citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:151967a08467eb5c9181ba7a0e3a68b1685ca29c17eb770f906ab8b64e12cf3e","observation_id":"1e9592bc-eaf7-484e-8a31-af869452f654","resolution":{"observed_at":"2026-08-15T15:04:24.898299Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:04:25.820190Z","title":null,"venue":null,"work_id":"65786ef7-c818-495f-b89f-b19c46d0500a","year":2023},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T16:58:21.791264Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:23.811590Z"},"links":{"citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:0a7cae99eec4e2f7ba2ab36efa8e8f9ef83fa2ba6369aad535017750d1ca30bd","observation_id":"7e93ba4a-09b0-49f6-8880-cefa28039590","resolution":{"observed_at":"2026-08-15T15:04:25.836662Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-15T15:04:23.826890Z","title":"Liang, R","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T16:58:21.791264Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:23.826890Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:8b329a4feb3819b63f2d77ca20c1ee526fc27556decaf1799571a75b8d2ed991","observation_id":"7188c347-094e-4816-9492-cfde6cdb6ca5","resolution":{"observed_at":"2026-08-15T15:04:23.826890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.09863","last_updated":"2026-06-01T00:13:23Z","snapshot_observed_at":"2026-08-16T01:26:19.355671Z","submitted_at":"2026-06-01T00:13:23Z","title":"From Confident Closing to Silent Failure: Characterizing False Success in LLM Agents","version":1},"cited_work":{"arxiv_id":"2606.09863","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.09863","snapshot_observed_at":"2026-08-15T15:04:24.757452Z","title":"From Confident Closing to Silent Failure: Characterizing False Success in LLM Agents","venue":"cs.LG","work_id":"e6a046d8-2d15-4107-98e9-b32016234d39","year":2026},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T16:58:21.791264Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:23.835249Z"},"links":{"cited_paper":"/paper/2606.09863","citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:5ef5ccbe037fdecb57a32c12f87d897d7900940bb9d74138e903494755644c42","observation_id":"0bf4dc3b-8337-4205-a0d8-964c4a3ee2fc","resolution":{"observed_at":"2026-08-15T15:04:24.778735Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:04:25.767456Z","title":"McGregor","venue":null,"work_id":"6edec65a-4d75-417a-96c7-5c824185d7ef","year":2021},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T16:58:21.791264Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:23.852165Z"},"links":{"citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:afb45398cdc642186140f70b24ce32eaffb49444763493ac52804e9283053e85","observation_id":"2ad2f21b-f61a-4bfb-89ec-e7bc1e67c88e","resolution":{"observed_at":"2026-08-15T15:04:25.783024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:04:25.700255Z","title":"Ouyang, J","venue":null,"work_id":"8d3e0bfd-bd9d-4dde-9218-4a8a988e9340","year":2022},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T16:58:21.791264Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:23.878401Z"},"links":{"citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:2027da7440c3645c4a19f2d5f856617b5310eca70b4b17dd5ca6a852205c2690","observation_id":"ff4080ba-0505-4e6c-96b2-e36dbdbafa8c","resolution":{"observed_at":"2026-08-15T15:04:25.723267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:04:25.642801Z","title":"Paleyes, R.-G","venue":null,"work_id":"8d561ba1-b841-40bb-91d4-81d67472ab2b","year":2022},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T16:58:21.791264Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:23.885274Z"},"links":{"citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:b2ca89e96cd14414428ce9b44bca6e43f6f9c342075caf77c677a0d0e5ccaa13","observation_id":"645fc9e2-ba59-4820-a3fb-d9520b6b5da2","resolution":{"observed_at":"2026-08-15T15:04:25.655400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:04:25.597348Z","title":null,"venue":null,"work_id":"ba45c56f-07c2-4c53-ba4e-19c9a6231986","year":null},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T16:58:21.791264Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:23.922457Z"},"links":{"citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:9e5878f10bfa1b0ab9060e200f8f5023679d30724472241976643893b54d52ca","observation_id":"abfa905d-fb2e-466a-9b37-5a9e903819d5","resolution":{"observed_at":"2026-08-15T15:04:25.616113Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:04:25.561276Z","title":"Perez and I","venue":null,"work_id":"45892b29-6c18-4927-aaa8-7d4ff08c2d6a","year":2022},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T16:58:21.791264Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:23.933902Z"},"links":{"citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:0e47fabf8bdc67d420b4ce15775eb8daa2346a54fd26ce5bb668def194934d55","observation_id":"ac80d417-8ba3-4c16-89fc-5543f03d4a0d","resolution":{"observed_at":"2026-08-15T15:04:25.568302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:04:25.498261Z","title":"Post office Horizon IT inquiry: In- terim report","venue":null,"work_id":"c7a15a39-a2d4-4d28-9af9-ff5d779bb579","year":2024},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T16:58:21.791264Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:23.943056Z"},"links":{"citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:a4886f6ba873cd11c4ed24f0125c171e9ffd8cd12b7a13b4a1ee890a95482b9d","observation_id":"49e793f6-9d2d-4c04-8085-3fafaff01997","resolution":{"observed_at":"2026-08-15T15:04:25.514508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:04:25.466004Z","title":null,"venue":null,"work_id":"8f0a7949-00ce-4816-b8bb-64d479348239","year":2020},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T16:58:21.791264Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:23.955095Z"},"links":{"citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:493e8c4bd4ff66edf7092de2cb75a179192679b51c342291051e9f54520e7dd2","observation_id":"54f32853-4833-4d07-9f12-3a6b47588d45","resolution":{"observed_at":"2026-08-15T15:04:25.471782Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:04:25.410337Z","title":"Sculley, G","venue":null,"work_id":"e6a3a85f-b634-45d3-8e2f-e2422bcebf60","year":2015},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T16:58:21.791264Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:23.975336Z"},"links":{"citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:efc39c248240432b3db5b5332814655279d2da2e51f6f171454e1073a161bb6a","observation_id":"a523d257-e314-4f0c-b8b2-406b5a44572c","resolution":{"observed_at":"2026-08-15T15:04:25.437970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05051","last_updated":"2021-06-06T03:30:29Z","snapshot_observed_at":"2026-08-16T15:10:49.944250Z","submitted_at":"2020-06-09T05:02:44Z","title":"Constrained episodic reinforcement learning in concave-convex and knapsack settings","version":2},"cited_work":{"arxiv_id":"2006.05051","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.05051","snapshot_observed_at":"2026-08-15T15:04:24.622194Z","title":"Constrained episodic reinforcement learning in concave-convex and knapsack settings","venue":"cs.LG","work_id":"44679d15-b3e0-4691-96be-d2c7e67c42e2","year":2020},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T16:58:21.791264Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:23.987308Z"},"links":{"cited_paper":"/paper/2006.05051","citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:06cff7691cfbf45ee06107ba9f0444c7b8555f976cf442dbd116b417b0e769d7","observation_id":"bba8414c-267b-4453-ac41-1c5a944201de","resolution":{"observed_at":"2026-08-15T15:04:24.633507Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-15T15:04:24.001635Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T16:58:21.791264Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:24.001635Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:efa4b05c771a39323e1285032aab857f3ebb7ea4fbb4599243d94e29bcfe8383","observation_id":"1bb434f8-16fd-45bd-9767-ebb0db64103e","resolution":{"observed_at":"2026-08-15T15:04:24.001635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2606.14589","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:04:24.461614Z","title":null,"venue":null,"work_id":"9fedb1e4-4c3c-4fbf-8509-0955456c1c56","year":2025},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T16:58:21.791264Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:24.012658Z"},"links":{"citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:13455becb753303f2f57c6a61072ab4598f92601d573935d482e0e12fcb06941","observation_id":"f2cf3119-0509-49f2-805a-fd38157d3be4","resolution":{"observed_at":"2026-08-15T15:04:24.477603Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16789","last_updated":"2024-03-09T22:26:06Z","snapshot_observed_at":"2026-08-08T18:07:29.632928Z","submitted_at":"2023-10-25T17:21:23Z","title":"Detecting Pretraining Data from Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16789","snapshot_observed_at":"2026-08-15T15:04:24.025493Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T16:58:21.791264Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:24.025493Z"},"links":{"cited_paper":"/paper/2310.16789","citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:357ca62fa09be93021dd0b26783e55d143f2eabadabcf32ff9ddaf649443be15","observation_id":"361f4804-45fd-41c0-8157-5973a6fa9746","resolution":{"observed_at":"2026-08-15T15:04:24.025493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:04:25.322171Z","title":"Stiennon, L","venue":null,"work_id":"e6202313-7daa-48ae-ac73-f6d1715cedfb","year":2020},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T16:58:21.791264Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:24.034929Z"},"links":{"citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:fc02b23d9f20697b253dbdde406bf5d57fddc2cfe6317a36cd6a32146e6493ff","observation_id":"a5b0d093-908d-4481-8ee5-25223d23b81e","resolution":{"observed_at":"2026-08-15T15:04:25.339250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:04:25.273229Z","title":null,"venue":null,"work_id":"a87ff20e-ae30-4f4d-891b-59f91fc83d8c","year":2023},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T16:58:21.791264Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:24.042808Z"},"links":{"citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:2b7bcd11e5d1776eb0378630ad17b898a8b549fa219df53b43c42e597876658b","observation_id":"90b12d60-1d60-4933-b82c-24b52976fa39","resolution":{"observed_at":"2026-08-15T15:04:25.290817Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02483","last_updated":"2023-07-05T17:58:10Z","snapshot_observed_at":"2026-08-15T10:16:52.688429Z","submitted_at":"2023-07-05T17:58:10Z","title":"Jailbroken: How Does LLM Safety Training Fail?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02483","snapshot_observed_at":"2026-08-15T15:04:24.049741Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T16:58:21.791264Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:24.049741Z"},"links":{"cited_paper":"/paper/2307.02483","citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:bba773648de9e42fb395d43599544d21f36c2ca6dc6e82720cd1081c6f92862e","observation_id":"4195bbd2-6cf9-4f1b-bd56-248690b08a9e","resolution":{"observed_at":"2026-08-15T15:04:24.049741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:04:25.217749Z","title":"Zheng, W.-L","venue":null,"work_id":"5b1d5601-7db6-446b-bbb9-e531fe8fb17d","year":2023},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T16:58:21.791264Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:24.060625Z"},"links":{"citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:d2b0a2ed16ef1b388a461bce8355627f3256508ec77e56be41db73df1632e7c3","observation_id":"8ee3447a-3267-438d-8c7c-1682d9e6c6d8","resolution":{"observed_at":"2026-08-15T15:04:25.232661Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.01604","last_updated":"2026-05-02T21:02:08Z","snapshot_observed_at":"2026-08-15T05:41:02.814541Z","submitted_at":"2026-05-02T21:02:08Z","title":"Evaluating Agentic AI in the Wild: Failure Modes, Drift Patterns, and a Production Evaluation Framework","version":1},"cited_work":{"arxiv_id":"2605.01604","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.01604","snapshot_observed_at":"2026-08-15T15:04:24.687597Z","title":"Evaluating Agentic AI in the Wild: Failure Modes, Drift Patterns, and a Production Evaluation Framework","venue":"cs.AI","work_id":"77ca7ec8-fd68-4c17-b5c9-a251320cc8f5","year":2026},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T16:58:21.791264Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:23.928175Z"},"links":{"cited_paper":"/paper/2605.01604","citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:98992dd8dab7e877237de8a03da3b2b3ba2508d5a222930022a0c73aea1f04a4","observation_id":"4c9e9614-ac3a-42bb-9f4f-64a6db18cfb9","resolution":{"observed_at":"2026-08-15T15:04:24.702289Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T16:58:21.791264Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":6,"verified_fuzzy":14},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 0 inbound Pith citation observations for arXiv:2608.02786."}