{"as_of":"2026-08-18T10:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ea0988bcdb5b6aa0d7b78c812576977462fb4c7ddd781306c107c7be8e401b87","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T23:06:00.821737Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T11:19:47.155013Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-09T13:26:16.578885Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.05602","last_updated":"2025-07-13T12:48:23Z","snapshot_observed_at":"2026-08-16T19:46:09.185552Z","submitted_at":"2025-05-08T19:05:02Z","title":"HiBayES: A Hierarchical Bayesian Modeling Framework for AI Evaluation Statistics","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05602","snapshot_observed_at":"2026-08-04T11:19:47.155013Z","title":"HiBayES: A hierarchical Bayesian modeling framework for AI evaluation statistics, July 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.05709","last_updated":"2026-06-04T12:15:57Z","snapshot_observed_at":"2026-08-16T16:33:40.277640Z","submitted_at":"2025-10-07T09:22:22Z","title":"Correcting Prompt Dependence in LLM Benchmarks: A Bayesian Hierarchical Model with Embedding-Space Clustering","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T11:19:47.155013Z"},"links":{"cited_paper":"/paper/2505.05602","citing_paper":"/paper/2510.05709"},"observation_digest":"sha256:364654155ac89bacb80318596a0f20a282f4e76e7592691c2d1043fcb02a5de4","observation_id":"2801fa99-1e31-4692-aea1-f4a2389eaa15","resolution":{"observed_at":"2026-08-04T11:19:47.155013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05602","last_updated":"2025-07-13T12:48:23Z","snapshot_observed_at":"2026-08-16T19:46:09.185552Z","submitted_at":"2025-05-08T19:05:02Z","title":"HiBayES: A Hierarchical Bayesian Modeling Framework for AI Evaluation Statistics","version":3},"cited_work":{"arxiv_id":"2505.05602","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.05602","snapshot_observed_at":"2026-07-09T13:26:16.578885Z","title":"HiBayES: A Hierarchical Bayesian Modeling Framework for AI Evaluation Statis- tics2025","venue":"cs.AI","work_id":"f3019fe1-4ccb-4488-b99e-d3b1c86188e1","year":2025},"citing_paper":{"arxiv_id":"2511.15352","last_updated":"2026-04-17T17:47:32Z","snapshot_observed_at":"2026-08-07T06:30:33.332757Z","submitted_at":"2025-11-19T11:22:48Z","title":"People readily follow personal advice from AI but it does not improve their well-being","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-17T21:11:04.614448Z"},"links":{"cited_paper":"/paper/2505.05602","citing_paper":"/paper/2511.15352"},"observation_digest":"sha256:861721a3aa480f7c03b37b86b594c2fbeb7c3f03471d640d8c43b0f865293f10","observation_id":"1da28fec-a90b-44bd-84b5-e19a96647d9b","resolution":{"observed_at":"2026-05-17T21:12:05.923970Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05602","last_updated":"2025-07-13T12:48:23Z","snapshot_observed_at":"2026-08-16T19:46:09.185552Z","submitted_at":"2025-05-08T19:05:02Z","title":"HiBayES: A Hierarchical Bayesian Modeling Framework for AI Evaluation Statistics","version":3},"cited_work":{"arxiv_id":"2505.05602","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.05602","snapshot_observed_at":"2026-07-09T13:26:16.578885Z","title":"HiBayES: A Hierarchical Bayesian Modeling Framework for AI Evaluation Statis- tics2025","venue":"cs.AI","work_id":"f3019fe1-4ccb-4488-b99e-d3b1c86188e1","year":2025},"citing_paper":{"arxiv_id":"2603.01865","last_updated":"2026-05-04T15:49:28Z","snapshot_observed_at":"2026-08-16T19:46:35.640703Z","submitted_at":"2026-03-02T13:46:32Z","title":"CyclicJudge: Mitigating Judge Bias Efficiently in LLM-based Evaluation","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T18:10:55.215746Z"},"links":{"cited_paper":"/paper/2505.05602","citing_paper":"/paper/2603.01865"},"observation_digest":"sha256:56830216df25ed010ba923997a63ee1f2ce9e0f2c2c92c014bd1f1faebf6962b","observation_id":"b12517b5-34a7-45e6-b613-6f37e875ce02","resolution":{"observed_at":"2026-05-09T03:28:10.067536Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05602","last_updated":"2025-07-13T12:48:23Z","snapshot_observed_at":"2026-08-16T19:46:09.185552Z","submitted_at":"2025-05-08T19:05:02Z","title":"HiBayES: A Hierarchical Bayesian Modeling Framework for AI Evaluation Statistics","version":3},"cited_work":{"arxiv_id":"2505.05602","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.05602","snapshot_observed_at":"2026-07-09T13:26:16.578885Z","title":"HiBayES: A Hierarchical Bayesian Modeling Framework for AI Evaluation Statis- tics2025","venue":"cs.AI","work_id":"f3019fe1-4ccb-4488-b99e-d3b1c86188e1","year":2025},"citing_paper":{"arxiv_id":"2607.07368","last_updated":"2026-07-08T13:03:25Z","snapshot_observed_at":"2026-08-16T23:00:29.005928Z","submitted_at":"2026-07-08T13:03:25Z","title":"Multi-Agent AI Control: Distributed Attacks Hamper Per-Instance Monitors","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-09T13:21:01.483489Z"},"links":{"cited_paper":"/paper/2505.05602","citing_paper":"/paper/2607.07368"},"observation_digest":"sha256:b75ddf5de89a72dffd6bd751f4a40ae914947cd7fa3a40a1f5bbd332054167db","observation_id":"ba9cb7f2-d722-4af3-91d8-159fc88940f0","resolution":{"observed_at":"2026-07-09T13:26:16.580274Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05602","last_updated":"2025-07-13T12:48:23Z","snapshot_observed_at":"2026-08-16T19:46:09.185552Z","submitted_at":"2025-05-08T19:05:02Z","title":"HiBayES: A Hierarchical Bayesian Modeling Framework for AI Evaluation Statistics","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05602","snapshot_observed_at":"2026-08-01T04:06:15.154820Z","title":"Hibayes: A Hierarchical Bayesian Modeling Framework for AI Eval- uation Statistics,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22951","last_updated":"2026-07-24T23:34:40Z","snapshot_observed_at":"2026-08-10T11:02:05.901395Z","submitted_at":"2026-07-24T23:34:40Z","title":"Modeling Memory-Dependent Reliability of LLMs: A Hidden Markov Model","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T04:06:15.154820Z"},"links":{"cited_paper":"/paper/2505.05602","citing_paper":"/paper/2607.22951"},"observation_digest":"sha256:76afbff83788a6b4e591a88423e4193395499a3c1077b37dd8581b00157afa3d","observation_id":"60843e07-56a9-446a-bbe6-974cbf04c93a","resolution":{"observed_at":"2026-08-01T04:06:15.154820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.05602/citation-record","integrity":"/paper/2505.05602/integrity","json":"/paper/2505.05602/citation-record.json","paper":"/paper/2505.05602"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:06:01.475044Z","title":"The Claude 3 Model Family: Opus, Sonnet, Haiku Anthropic","venue":null,"work_id":"c4002825-a99e-4501-9e1b-631bca202d78","year":2024},"citing_paper":{"arxiv_id":"2505.05602","last_updated":"2025-07-13T12:48:23Z","snapshot_observed_at":"2026-08-16T19:46:09.185552Z","submitted_at":"2025-05-08T19:05:02Z","title":"HiBayES: A Hierarchical Bayesian Modeling Framework for AI Evaluation Statistics","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T23:06:00.676900Z"},"links":{"citing_paper":"/paper/2505.05602"},"observation_digest":"sha256:debb537089b03354a0a9370364605d2c746d276a83ee242e47c3bf0de472941a","observation_id":"2b992279-ef0f-4ea2-8cb9-195731264452","resolution":{"observed_at":"2026-08-15T23:06:01.480096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-15T23:06:00.682344Z","title":"Evaluating Large Language Models Trained on Code","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.05602","last_updated":"2025-07-13T12:48:23Z","snapshot_observed_at":"2026-08-16T19:46:09.185552Z","submitted_at":"2025-05-08T19:05:02Z","title":"HiBayES: A Hierarchical Bayesian Modeling Framework for AI Evaluation Statistics","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T23:06:00.682344Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2505.05602"},"observation_digest":"sha256:2914baae16df9c87b8dc236f84f9a869549fb5d802d01cd8aa66e22b2532d132","observation_id":"1a954fc1-b84a-49dd-8ba5-d53d4b028d2f","resolution":{"observed_at":"2026-08-15T23:06:00.682344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.10044","last_updated":"2019-05-24T05:48:49Z","snapshot_observed_at":"2026-08-17T14:44:42.060038Z","submitted_at":"2019-05-24T05:48:49Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.10044","snapshot_observed_at":"2026-08-15T23:06:00.687781Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.05602","last_updated":"2025-07-13T12:48:23Z","snapshot_observed_at":"2026-08-16T19:46:09.185552Z","submitted_at":"2025-05-08T19:05:02Z","title":"HiBayES: A Hierarchical Bayesian Modeling Framework for AI Evaluation Statistics","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T23:06:00.687781Z"},"links":{"cited_paper":"/paper/1905.10044","citing_paper":"/paper/2505.05602"},"observation_digest":"sha256:7a2f9f5f9a50098492455a1293305988fa9f1102875a533cb2e4d14d54c16fb4","observation_id":"27384ec8-b8a2-46d1-9c7a-2eefb30f2a05","resolution":{"observed_at":"2026-08-15T23:06:00.687781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:06:01.458551Z","title":"HiBayES: A Python package for analysing data from Inspect logs using statistical modeling techniques","venue":null,"work_id":"269f04f2-573a-4b4e-8cbf-ed2715ca6699","year":2025},"citing_paper":{"arxiv_id":"2505.05602","last_updated":"2025-07-13T12:48:23Z","snapshot_observed_at":"2026-08-16T19:46:09.185552Z","submitted_at":"2025-05-08T19:05:02Z","title":"HiBayES: A Hierarchical Bayesian Modeling Framework for AI Evaluation Statistics","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T23:06:00.692755Z"},"links":{"citing_paper":"/paper/2505.05602"},"observation_digest":"sha256:53e10416937d539363e6c853d4adaed5dcd9cf18adc42f70b5347a6707a98813","observation_id":"1b5264fc-b950-47c3-96e3-f8d7c9a38a55","resolution":{"observed_at":"2026-08-15T23:06:01.463513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:06:01.442858Z","title":"Bayesian Data Analysis","venue":null,"work_id":"0be109d1-0863-464b-82e1-f41e4b01362b","year":2013},"citing_paper":{"arxiv_id":"2505.05602","last_updated":"2025-07-13T12:48:23Z","snapshot_observed_at":"2026-08-16T19:46:09.185552Z","submitted_at":"2025-05-08T19:05:02Z","title":"HiBayES: A Hierarchical Bayesian Modeling Framework for AI Evaluation Statistics","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T23:06:00.697420Z"},"links":{"citing_paper":"/paper/2505.05602"},"observation_digest":"sha256:94719e77c131052799cd704876fc57b184eba41a8d46217c9303f9f15125c405","observation_id":"d673f58a-b21b-487d-b6aa-667b7e4c7ca2","resolution":{"observed_at":"2026-08-15T23:06:01.447681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:06:01.427549Z","title":"SWE-bench: Can Language Models Resolve Real-world GitHub Issues? https://github","venue":null,"work_id":"47790eb8-a534-405b-a5ca-ce80bef1e965","year":2023},"citing_paper":{"arxiv_id":"2505.05602","last_updated":"2025-07-13T12:48:23Z","snapshot_observed_at":"2026-08-16T19:46:09.185552Z","submitted_at":"2025-05-08T19:05:02Z","title":"HiBayES: A Hierarchical Bayesian Modeling Framework for AI Evaluation Statistics","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T23:06:00.702596Z"},"links":{"citing_paper":"/paper/2505.05602"},"observation_digest":"sha256:073a5c608aa337aaf3da30dbb50837b971209b3a17164a401199f5e5e5035556","observation_id":"80936299-fd0c-470d-8416-983aa8da0f56","resolution":{"observed_at":"2026-08-15T23:06:01.432468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-15T23:06:00.708335Z","title":"Measuring Massive Multitask Language Understanding","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.05602","last_updated":"2025-07-13T12:48:23Z","snapshot_observed_at":"2026-08-16T19:46:09.185552Z","submitted_at":"2025-05-08T19:05:02Z","title":"HiBayES: A Hierarchical Bayesian Modeling Framework for AI Evaluation Statistics","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T23:06:00.708335Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2505.05602"},"observation_digest":"sha256:10b8b5bd3818ddb8e0827d5d25bcc3a650b5175d2858bc3a785389cd75d33f8b","observation_id":"5dea24d3-4a55-4bd2-b448-77190f63fd58","resolution":{"observed_at":"2026-08-15T23:06:00.708335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1111.4246","last_updated":"2011-11-18T00:39:32Z","snapshot_observed_at":"2026-08-15T04:28:34.964537Z","submitted_at":"2011-11-18T00:39:32Z","title":"The No-U-Turn Sampler: Adaptively Setting Path Lengths in Hamiltonian Monte Carlo","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1111.4246","snapshot_observed_at":"2026-08-15T23:06:00.713179Z","title":"The No-U-Turn Sampler: Adaptively Setting Path Lengths in Hamiltonian Monte Carlo","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.05602","last_updated":"2025-07-13T12:48:23Z","snapshot_observed_at":"2026-08-16T19:46:09.185552Z","submitted_at":"2025-05-08T19:05:02Z","title":"HiBayES: A Hierarchical Bayesian Modeling Framework for AI Evaluation Statistics","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T23:06:00.713179Z"},"links":{"cited_paper":"/paper/1111.4246","citing_paper":"/paper/2505.05602"},"observation_digest":"sha256:2d454a28985fa5b630d005c69d780963539bab87af8b531d9dfdeb3ab3ea52e0","observation_id":"c2c02a5d-792d-45fc-9b95-1cd52e1737e6","resolution":{"observed_at":"2026-08-15T23:06:00.713179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:06:01.409342Z","title":"Analyzing OpenAI’s o1-preview in Comparison with Claude 3 Opus and GPT-4 on ARC AGI Evaluation","venue":null,"work_id":"3541f270-5765-4efe-b4a7-619556b15af4","year":2025},"citing_paper":{"arxiv_id":"2505.05602","last_updated":"2025-07-13T12:48:23Z","snapshot_observed_at":"2026-08-16T19:46:09.185552Z","submitted_at":"2025-05-08T19:05:02Z","title":"HiBayES: A Hierarchical Bayesian Modeling Framework for AI Evaluation Statistics","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T23:06:00.718200Z"},"links":{"citing_paper":"/paper/2505.05602"},"observation_digest":"sha256:4780533741b8b86c11150c608e6653872feb9f3a93ba0e8e87a7a24abb345f1e","observation_id":"11046e32-51a9-4f0d-ba75-9aa8aaa33a2d","resolution":{"observed_at":"2026-08-15T23:06:01.415575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14499","last_updated":"2026-07-10T21:48:09Z","snapshot_observed_at":"2026-08-16T12:48:53.169158Z","submitted_at":"2025-03-18T17:59:31Z","title":"Measuring AI Ability to Complete Long Software Tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14499","snapshot_observed_at":"2026-08-15T23:06:00.723242Z","title":"Measuring AI Ability to Complete Long Tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.05602","last_updated":"2025-07-13T12:48:23Z","snapshot_observed_at":"2026-08-16T19:46:09.185552Z","submitted_at":"2025-05-08T19:05:02Z","title":"HiBayES: A Hierarchical Bayesian Modeling Framework for AI Evaluation Statistics","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T23:06:00.723242Z"},"links":{"cited_paper":"/paper/2503.14499","citing_paper":"/paper/2505.05602"},"observation_digest":"sha256:f58522fe523388d314cefae8c9cda263360715077059c36f7e7bc7c3ac508a34","observation_id":"b4066978-fed2-489a-875a-770c57d75235","resolution":{"observed_at":"2026-08-15T23:06:00.723242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.04683","last_updated":"2017-12-05T19:36:03Z","snapshot_observed_at":"2026-08-18T01:17:42.874463Z","submitted_at":"2017-04-15T19:31:41Z","title":"RACE: Large-scale ReAding Comprehension Dataset From Examinations","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.04683","snapshot_observed_at":"2026-08-15T23:06:00.728561Z","title":"RACE: Large-scale ReAding Comprehension Dataset From Examinations","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.05602","last_updated":"2025-07-13T12:48:23Z","snapshot_observed_at":"2026-08-16T19:46:09.185552Z","submitted_at":"2025-05-08T19:05:02Z","title":"HiBayES: A Hierarchical Bayesian Modeling Framework for AI Evaluation Statistics","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T23:06:00.728561Z"},"links":{"cited_paper":"/paper/1704.04683","citing_paper":"/paper/2505.05602"},"observation_digest":"sha256:ee5dfc034713fc1abd193fc78819512a4d20fe71940724c64b7756456b912d5b","observation_id":"acd725f4-78e9-4ebf-9e32-e3cc7679d014","resolution":{"observed_at":"2026-08-15T23:06:00.728561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11501","last_updated":"2022-11-18T17:20:27Z","snapshot_observed_at":"2026-08-16T16:15:02.405696Z","submitted_at":"2022-11-18T17:20:27Z","title":"DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11501","snapshot_observed_at":"2026-08-15T23:06:00.733761Z","title":"DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.05602","last_updated":"2025-07-13T12:48:23Z","snapshot_observed_at":"2026-08-16T19:46:09.185552Z","submitted_at":"2025-05-08T19:05:02Z","title":"HiBayES: A Hierarchical Bayesian Modeling Framework for AI Evaluation Statistics","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T23:06:00.733761Z"},"links":{"cited_paper":"/paper/2211.11501","citing_paper":"/paper/2505.05602"},"observation_digest":"sha256:3108140548f7fff92414a0b789c82bcdaf87af64b6f382cb92b028e519295d0e","observation_id":"52cc77eb-7348-4177-9cdf-f0465efe70a9","resolution":{"observed_at":"2026-08-15T23:06:00.733761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-15T23:06:00.739467Z","title":"Holistic Evaluation of Language Models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.05602","last_updated":"2025-07-13T12:48:23Z","snapshot_observed_at":"2026-08-16T19:46:09.185552Z","submitted_at":"2025-05-08T19:05:02Z","title":"HiBayES: A Hierarchical Bayesian Modeling Framework for AI Evaluation Statistics","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T23:06:00.739467Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2505.05602"},"observation_digest":"sha256:8ec47e1b9deafb27fb08c2bf2297d1776c24f72c6f60e2fd695d40946dc0616b","observation_id":"71bb4ed7-d858-437c-b4b4-a8eece49a1ff","resolution":{"observed_at":"2026-08-15T23:06:00.739467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2480.2017","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:06:01.172090Z","title":"Statistical Rethinking","venue":null,"work_id":"79db2cfa-e052-4140-9452-0eaeee99d71e","year":2020},"citing_paper":{"arxiv_id":"2505.05602","last_updated":"2025-07-13T12:48:23Z","snapshot_observed_at":"2026-08-16T19:46:09.185552Z","submitted_at":"2025-05-08T19:05:02Z","title":"HiBayES: A Hierarchical Bayesian Modeling Framework for AI Evaluation Statistics","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T23:06:00.744516Z"},"links":{"citing_paper":"/paper/2505.05602"},"observation_digest":"sha256:b9e4303129ecbe0ae63c13bb08e5fbfab406b08c32e981e0723f87273d45741e","observation_id":"1fb628ed-4f58-47a9-b4b9-e1ccdc356764","resolution":{"observed_at":"2026-08-15T23:06:01.181796Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:06:01.392703Z","title":"Statistical Rethinking 2023","venue":null,"work_id":"28f73455-291f-4c78-a20c-c2f56c62b72a","year":2023},"citing_paper":{"arxiv_id":"2505.05602","last_updated":"2025-07-13T12:48:23Z","snapshot_observed_at":"2026-08-16T19:46:09.185552Z","submitted_at":"2025-05-08T19:05:02Z","title":"HiBayES: A Hierarchical Bayesian Modeling Framework for AI Evaluation Statistics","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T23:06:00.749395Z"},"links":{"citing_paper":"/paper/2505.05602"},"observation_digest":"sha256:f5a74f38744c4fdbe50ab1c4df643d46a383ca2dcfddb19b630b0d1349ee9996","observation_id":"96fa30b8-495a-4ed5-bf6c-4a5a33a080ed","resolution":{"observed_at":"2026-08-15T23:06:01.397270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:06:01.376681Z","title":"METR’s GPT-4.5 pre-deployment evaluations","venue":null,"work_id":"8b56e371-81c7-41b8-afdb-dd428836ec98","year":2025},"citing_paper":{"arxiv_id":"2505.05602","last_updated":"2025-07-13T12:48:23Z","snapshot_observed_at":"2026-08-16T19:46:09.185552Z","submitted_at":"2025-05-08T19:05:02Z","title":"HiBayES: A Hierarchical Bayesian Modeling Framework for AI Evaluation Statistics","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T23:06:00.754016Z"},"links":{"citing_paper":"/paper/2505.05602"},"observation_digest":"sha256:cad39ef2425999e2a4e3528d9d08af0176294f390b6c7b60041c050ccf7da2d4","observation_id":"12fe11be-7608-47b9-aa90-6e3139fe0050","resolution":{"observed_at":"2026-08-15T23:06:01.381825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12983","last_updated":"2023-11-21T20:34:47Z","snapshot_observed_at":"2026-08-13T10:06:26.439949Z","submitted_at":"2023-11-21T20:34:47Z","title":"GAIA: a benchmark for General AI Assistants","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12983","snapshot_observed_at":"2026-08-15T23:06:00.758834Z","title":"GAIA: a benchmark for General AI Assistants","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05602","last_updated":"2025-07-13T12:48:23Z","snapshot_observed_at":"2026-08-16T19:46:09.185552Z","submitted_at":"2025-05-08T19:05:02Z","title":"HiBayES: A Hierarchical Bayesian Modeling Framework for AI Evaluation Statistics","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T23:06:00.758834Z"},"links":{"cited_paper":"/paper/2311.12983","citing_paper":"/paper/2505.05602"},"observation_digest":"sha256:989eca008acdf8e4bccdee749a7f448236afdd7f364360c4c4ff063e5b5e965b","observation_id":"9836eb00-9250-43df-bd34-e45c04006f28","resolution":{"observed_at":"2026-08-15T23:06:00.758834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00640","last_updated":"2024-11-01T14:57:16Z","snapshot_observed_at":"2026-08-17T04:34:26.881993Z","submitted_at":"2024-11-01T14:57:16Z","title":"Adding Error Bars to Evals: A Statistical Approach to Language Model Evaluations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00640","snapshot_observed_at":"2026-08-15T23:06:00.764019Z","title":"Adding Error Bars to Evals: A Statistical Approach to Language Model Evaluations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05602","last_updated":"2025-07-13T12:48:23Z","snapshot_observed_at":"2026-08-16T19:46:09.185552Z","submitted_at":"2025-05-08T19:05:02Z","title":"HiBayES: A Hierarchical Bayesian Modeling Framework for AI Evaluation Statistics","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T23:06:00.764019Z"},"links":{"cited_paper":"/paper/2411.00640","citing_paper":"/paper/2505.05602"},"observation_digest":"sha256:836ede00b722a5295a38618ddf2c336ea6375e787886a0ac00c4ca419073aa1a","observation_id":"374b41c5-137e-4c26-9246-1802793bcb96","resolution":{"observed_at":"2026-08-15T23:06:00.764019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:06:01.360519Z","title":"Generalized Linear Models","venue":null,"work_id":"13016e43-b6f3-4ff1-b3c8-3d8912c54db4","year":1972},"citing_paper":{"arxiv_id":"2505.05602","last_updated":"2025-07-13T12:48:23Z","snapshot_observed_at":"2026-08-16T19:46:09.185552Z","submitted_at":"2025-05-08T19:05:02Z","title":"HiBayES: A Hierarchical Bayesian Modeling Framework for AI Evaluation Statistics","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T23:06:00.769405Z"},"links":{"citing_paper":"/paper/2505.05602"},"observation_digest":"sha256:199f063da30d2b4f104ddbd181ba6225cf6b204f069c93f2ddd31a6c071f8048","observation_id":"3cdcd32d-ecd6-4ae8-8eb7-3255ff978764","resolution":{"observed_at":"2026-08-15T23:06:01.365363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-15T23:06:00.774258Z","title":"GPT-4o System Card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05602","last_updated":"2025-07-13T12:48:23Z","snapshot_observed_at":"2026-08-16T19:46:09.185552Z","submitted_at":"2025-05-08T19:05:02Z","title":"HiBayES: A Hierarchical Bayesian Modeling Framework for AI Evaluation Statistics","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T23:06:00.774258Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.05602"},"observation_digest":"sha256:28e2f6b2648405b22cbd2c963d5e779552c22e33e2bced3500d64540bbb96c1a","observation_id":"e0634780-3ced-43ec-9b6b-c21d531641dc","resolution":{"observed_at":"2026-08-15T23:06:00.774258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.11554","last_updated":"2019-12-24T22:09:36Z","snapshot_observed_at":"2026-07-06T08:46:54.138798Z","submitted_at":"2019-12-24T22:09:36Z","title":"Composable Effects for Flexible and Accelerated Probabilistic Programming in NumPyro","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.11554","snapshot_observed_at":"2026-08-15T23:06:00.779556Z","title":"Composable Effects for Flexible and Accelerated Probabilistic Programming in NumPyro","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.05602","last_updated":"2025-07-13T12:48:23Z","snapshot_observed_at":"2026-08-16T19:46:09.185552Z","submitted_at":"2025-05-08T19:05:02Z","title":"HiBayES: A Hierarchical Bayesian Modeling Framework for AI Evaluation Statistics","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T23:06:00.779556Z"},"links":{"cited_paper":"/paper/1912.11554","citing_paper":"/paper/2505.05602"},"observation_digest":"sha256:8bece603e942b70c8969e9630a053bdf3f406e81d93039a7c8602b7157baad81","observation_id":"cc59f489-bb5d-45c5-90c9-49d8e8261ecf","resolution":{"observed_at":"2026-08-15T23:06:00.779556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17354","last_updated":"2025-03-21T17:54:01Z","snapshot_observed_at":"2026-08-16T12:47:51.900771Z","submitted_at":"2025-03-21T17:54:01Z","title":"HCAST: Human-Calibrated Autonomy Software Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17354","snapshot_observed_at":"2026-08-15T23:06:00.784797Z","title":"HCAST: Human-Calibrated Autonomy Software Tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.05602","last_updated":"2025-07-13T12:48:23Z","snapshot_observed_at":"2026-08-16T19:46:09.185552Z","submitted_at":"2025-05-08T19:05:02Z","title":"HiBayES: A Hierarchical Bayesian Modeling Framework for AI Evaluation Statistics","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T23:06:00.784797Z"},"links":{"cited_paper":"/paper/2503.17354","citing_paper":"/paper/2505.05602"},"observation_digest":"sha256:86e71e26e927afdee161ecb7c44ddb2c0a40735a8c3eb02dff317ec8ae58fba0","observation_id":"fa7e32e5-50b3-442d-b2ff-8deaa137af63","resolution":{"observed_at":"2026-08-15T23:06:00.784797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03057","last_updated":"2022-10-06T17:03:34Z","snapshot_observed_at":"2026-07-06T14:00:37.875054Z","submitted_at":"2022-10-06T17:03:34Z","title":"Language Models are Multilingual Chain-of-Thought Reasoners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03057","snapshot_observed_at":"2026-08-15T23:06:00.789738Z","title":"Language Models are Multilingual Chain-of-Thought Reasoners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.05602","last_updated":"2025-07-13T12:48:23Z","snapshot_observed_at":"2026-08-16T19:46:09.185552Z","submitted_at":"2025-05-08T19:05:02Z","title":"HiBayES: A Hierarchical Bayesian Modeling Framework for AI Evaluation Statistics","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T23:06:00.789738Z"},"links":{"cited_paper":"/paper/2210.03057","citing_paper":"/paper/2505.05602"},"observation_digest":"sha256:aa3acf0dc716562af904459929ab15a00b1b3c5de449acf5cb4e2bad554c89a2","observation_id":"21467e2f-7281-40f2-90ba-213d476f0093","resolution":{"observed_at":"2026-08-15T23:06:00.789738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13678","last_updated":"2024-12-18T10:05:43Z","snapshot_observed_at":"2026-08-13T14:24:47.389042Z","submitted_at":"2024-12-18T10:05:43Z","title":"Clio: Privacy-Preserving Insights into Real-World AI Use","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13678","snapshot_observed_at":"2026-08-15T23:06:00.794746Z","title":"Clio: Privacy-Preserving Insights into Real-World AI Use","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05602","last_updated":"2025-07-13T12:48:23Z","snapshot_observed_at":"2026-08-16T19:46:09.185552Z","submitted_at":"2025-05-08T19:05:02Z","title":"HiBayES: A Hierarchical Bayesian Modeling Framework for AI Evaluation Statistics","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T23:06:00.794746Z"},"links":{"cited_paper":"/paper/2412.13678","citing_paper":"/paper/2505.05602"},"observation_digest":"sha256:4d50c8b178d066c63d06ba913c6c0ab2dcb1fffd7731a4cb4d5ad23ec0f47da8","observation_id":"01837506-8aa0-4401-8ea4-3dec0ab627f1","resolution":{"observed_at":"2026-08-15T23:06:00.794746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:06:01.344302Z","title":"inspect_ai: AI-assisted inspection policy development","venue":null,"work_id":"2414c45c-28b1-48c7-8bee-755586a9d649","year":2024},"citing_paper":{"arxiv_id":"2505.05602","last_updated":"2025-07-13T12:48:23Z","snapshot_observed_at":"2026-08-16T19:46:09.185552Z","submitted_at":"2025-05-08T19:05:02Z","title":"HiBayES: A Hierarchical Bayesian Modeling Framework for AI Evaluation Statistics","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T23:06:00.800737Z"},"links":{"citing_paper":"/paper/2505.05602"},"observation_digest":"sha256:069ed339cd1d230c761660e94d22c79c115daa06d00eb0ee5ba96020bbfb0369","observation_id":"eaffacaa-0ea1-4dbb-a666-120a126d8421","resolution":{"observed_at":"2026-08-15T23:06:01.349649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:06:01.325933Z","title":"Asymptotic Equivalence of Bayes Cross Validation and Widely Applicable Information Criterion in Singular Learning Theory","venue":null,"work_id":"b8ce0332-8c5f-4c60-ade1-e4fca83d13c5","year":2010},"citing_paper":{"arxiv_id":"2505.05602","last_updated":"2025-07-13T12:48:23Z","snapshot_observed_at":"2026-08-16T19:46:09.185552Z","submitted_at":"2025-05-08T19:05:02Z","title":"HiBayES: A Hierarchical Bayesian Modeling Framework for AI Evaluation Statistics","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T23:06:00.806930Z"},"links":{"citing_paper":"/paper/2505.05602"},"observation_digest":"sha256:30c176bf8d10b2f29c39531b2fec04b299eb459712c1011a698b8285169ca534","observation_id":"765e2c86-5715-43ce-b82c-a47b7c936a8a","resolution":{"observed_at":"2026-08-15T23:06:01.332331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14898","last_updated":"2023-10-30T17:52:18Z","snapshot_observed_at":"2026-08-16T15:20:59.876100Z","submitted_at":"2023-06-26T17:59:50Z","title":"InterCode: Standardizing and Benchmarking Interactive Coding with Execution Feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14898","snapshot_observed_at":"2026-08-15T23:06:00.812017Z","title":"InterCode: Standardizing and Benchmarking Interactive Coding with Execution Feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05602","last_updated":"2025-07-13T12:48:23Z","snapshot_observed_at":"2026-08-16T19:46:09.185552Z","submitted_at":"2025-05-08T19:05:02Z","title":"HiBayES: A Hierarchical Bayesian Modeling Framework for AI Evaluation Statistics","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T23:06:00.812017Z"},"links":{"cited_paper":"/paper/2306.14898","citing_paper":"/paper/2505.05602"},"observation_digest":"sha256:b65b6e1c9b506118d734fefca1069f8cbc2e2ad2add841610b41bbc588278910","observation_id":"3c78b97b-aa03-42e4-a582-56dfac4df817","resolution":{"observed_at":"2026-08-15T23:06:00.812017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-15T23:06:00.817052Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.05602","last_updated":"2025-07-13T12:48:23Z","snapshot_observed_at":"2026-08-16T19:46:09.185552Z","submitted_at":"2025-05-08T19:05:02Z","title":"HiBayES: A Hierarchical Bayesian Modeling Framework for AI Evaluation Statistics","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T23:06:00.817052Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2505.05602"},"observation_digest":"sha256:3281027ecdb54c52464ab023aa6bf8a75b3cea829367057c0a424407419e5789","observation_id":"512fc14f-2ee8-4ff8-9bdd-c5f840592840","resolution":{"observed_at":"2026-08-15T23:06:00.817052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21199","last_updated":"2024-12-31T08:20:42Z","snapshot_observed_at":"2026-08-12T23:35:38.017550Z","submitted_at":"2024-12-30T18:58:58Z","title":"HumanEval Pro and MBPP Pro: Evaluating Large Language Models on Self-invoking Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21199","snapshot_observed_at":"2026-08-15T23:06:00.821737Z","title":"HumanEval Pro and MBPP Pro: Evaluating Large Language Models on Self-invoking Code Generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05602","last_updated":"2025-07-13T12:48:23Z","snapshot_observed_at":"2026-08-16T19:46:09.185552Z","submitted_at":"2025-05-08T19:05:02Z","title":"HiBayES: A Hierarchical Bayesian Modeling Framework for AI Evaluation Statistics","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T23:06:00.821737Z"},"links":{"cited_paper":"/paper/2412.21199","citing_paper":"/paper/2505.05602"},"observation_digest":"sha256:bc6450fefb150434e74cde4b34a0f5ed74015d4ca97b808c925041fa7707e37f","observation_id":"e75e17fe-3ce5-4b1f-9c40-1b8d65f3dfce","resolution":{"observed_at":"2026-08-15T23:06:00.821737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.05602","last_updated":"2025-07-13T12:48:23Z","latest_version":3,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-16T19:46:09.185552Z","submitted_at":"2025-05-08T19:05:02Z","title":"HiBayES: A Hierarchical Bayesian Modeling Framework for AI Evaluation Statistics"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":1,"verified_fuzzy":10},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 5 inbound Pith citation observations for arXiv:2505.05602."}