{"as_of":"2026-08-14T16:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:07a9b9cf25aef3863631f90caef7171e0bbaa4f8725a07a61c828c50bc78c177","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T00:43:01.149558Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.01000/citation-record","integrity":"/paper/2608.01000/integrity","json":"/paper/2608.01000/citation-record.json","paper":"/paper/2608.01000"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-08-06T00:42:55.654892Z","title":"Concrete problems in ai safety.arXiv preprint arXiv:1606.06565, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T00:42:55.654892Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:c81cdc0a6666a0a25674756c4a66fca269a969415175833d0e3e6884f822a7b1","observation_id":"56765134-c1f1-45e3-8ad6-3b61f52374e3","resolution":{"observed_at":"2026-08-06T00:42:55.654892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-06T00:42:55.750021Z","title":"Program synthesis with large language models.arXiv preprint arXiv:2108.07732, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T00:42:55.750021Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:390013d6a11c938adbd7ca61c8abaf65412d00bdbeb2f75f97c2281e83f1e87e","observation_id":"07b5ba70-1fdd-497c-aafb-e2b2127b7b1f","resolution":{"observed_at":"2026-08-06T00:42:55.750021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.00915","snapshot_observed_at":"2026-08-06T00:42:55.896502Z","title":"Rein- forcement learning with verifiable yet noisy rewards under imperfect verifiers.arXiv preprint arXiv:2510.00915, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T00:42:55.896502Z"},"links":{"cited_paper":"/paper/2510.00915","citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:bfad28f6df399b284a073b51bd9cf7097ad1e3b4f2e727d5ad66a9cd396d36a9","observation_id":"1b80d79f-183c-4525-94a0-aabd8181c5d5","resolution":{"observed_at":"2026-08-06T00:42:55.896502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02856","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-12T18:03:43.445944Z","submitted_at":"2025-07-03T17:59:02Z","title":"Answer Matching Outperforms Multiple Choice for Language Model Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02856","snapshot_observed_at":"2026-08-06T00:42:56.011737Z","title":"An- swer matching outperforms multiple choice for language model evaluation.arXiv preprint arXiv:2507.02856, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T00:42:56.011737Z"},"links":{"cited_paper":"/paper/2507.02856","citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:f967a0927c568ad4623ea143670f5a1f0d1725ae5611d704eb518d1eade8620c","observation_id":"c967abae-1ab3-4368-b4b6-5466d675666d","resolution":{"observed_at":"2026-08-06T00:42:56.011737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:43:06.565279Z","title":"CodeT: Code generation with generated tests","venue":null,"work_id":"16418c8b-9cc2-46ad-8fc9-8792b6ff0af2","year":2023},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T00:42:56.147396Z"},"links":{"citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:5e69661999544ee7512c7c7d2f3255f3afd3beeae5b6778759e5bb60258920a3","observation_id":"6850ce16-9810-4849-b0c8-5a01b6b1b022","resolution":{"observed_at":"2026-08-06T00:43:06.627859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-06T00:42:56.255843Z","title":"Evaluating large language models trained on code.arXiv preprint arXiv:2107.03374, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T00:42:56.255843Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:42d7fedf3367713f5a74d932d777495ae667f4053678183dcc6425bd36031947","observation_id":"a6f23190-75dd-4ea2-a758-ac7ab7893f39","resolution":{"observed_at":"2026-08-06T00:42:56.255843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:43:06.388046Z","title":"Jimenez, John Yang, Kevin Liu, and Aleksander Madry","venue":null,"work_id":"4673fa5c-2b15-48af-8d09-509f872c2461","year":2024},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T00:42:56.395232Z"},"links":{"citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:004d39650b1681b09e2293e642d1dab86514235c566b76ce4ed05cf293f6e7ce","observation_id":"80aa02aa-e708-4211-a92a-734accb60b35","resolution":{"observed_at":"2026-08-06T00:43:06.479453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T15:58:13.809876Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T00:42:56.490998Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learn- ing.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T00:42:56.490998Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:4f5419991207dc560a114c6d36bae70e2a5e5e8a3ce87c7023fe0ccb202ba6d7","observation_id":"f09a48a7-2071-4fff-9943-f16d5e6aaff7","resolution":{"observed_at":"2026-08-06T00:42:56.490998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13820","last_updated":"2025-07-30T14:58:42Z","snapshot_observed_at":"2026-08-12T23:31:14.053477Z","submitted_at":"2025-02-19T15:32:11Z","title":"Scoring Verifiers: Evaluating Synthetic Verification for Code and Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13820","snapshot_observed_at":"2026-08-06T00:42:56.617826Z","title":"Scoring verifiers: Evaluating synthetic verification for code and reasoning.arXiv preprint arXiv:2502.13820, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T00:42:56.617826Z"},"links":{"cited_paper":"/paper/2502.13820","citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:e54c50ece1a6e94adfdfa9440efb6422b776ed6463951139b1c633bb98787e9d","observation_id":"27ee833d-e729-49cc-ac06-0519fce26530","resolution":{"observed_at":"2026-08-06T00:42:56.617826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:43:06.291439Z","title":"Rabe, Talia Ringer, and Yuriy Brun","venue":null,"work_id":"43ac1878-276c-4d9c-a569-346f424f0d96","year":2023},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T00:42:56.724127Z"},"links":{"citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:3f2ce8e870aa82ffdfa6c11a4d9263a9ceb76b1b50b32a2ea62978d324df5d2b","observation_id":"005b98e3-25d7-4240-a9d3-51f1bbc8ddb5","resolution":{"observed_at":"2026-08-06T00:43:06.329643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:43:06.144662Z","title":"Scaling laws for reward model overoptimization","venue":null,"work_id":"ac53c785-763b-47f5-a6fd-4b410958be38","year":2023},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T00:42:56.793886Z"},"links":{"citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:e4bd78383a9f66a18a6259e57f885ae06120203384ec0d44e538a404f724a196","observation_id":"e545781d-73f3-4ba4-ad35-7054ea7994a2","resolution":{"observed_at":"2026-08-06T00:43:06.203280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-13T06:43:22.011336Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15594","snapshot_observed_at":"2026-08-06T00:42:56.891870Z","title":"A survey on LLM-as-a-judge.arXiv preprint arXiv:2411.15594, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T00:42:56.891870Z"},"links":{"cited_paper":"/paper/2411.15594","citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:05bb1195c17ad4830ca6ed012cad4d68b9dfbf6be8f43d94274cd45285bcd693","observation_id":"801c6585-745f-478f-b774-0563d4008229","resolution":{"observed_at":"2026-08-06T00:42:56.891870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17746","last_updated":"2025-10-03T01:55:55Z","snapshot_observed_at":"2026-08-12T14:23:22.826603Z","submitted_at":"2025-07-23T17:57:55Z","title":"Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.17746","snapshot_observed_at":"2026-08-06T00:42:56.941409Z","title":"Rubrics as rewards: Reinforcement learning beyond verifiable domains.arXiv preprint arXiv:2507.17746, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T00:42:56.941409Z"},"links":{"cited_paper":"/paper/2507.17746","citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:ba697f7322b7437c13a124a6614174e219e8a266a839e807d5fafc900e21b3f7","observation_id":"7c120526-1391-40cd-8620-153f1f432da0","resolution":{"observed_at":"2026-08-06T00:42:56.941409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15149","last_updated":"2026-04-16T15:30:10Z","snapshot_observed_at":"2026-08-14T04:10:32.698468Z","submitted_at":"2026-04-16T15:30:10Z","title":"LLMs Gaming Verifiers: RLVR can Lead to Reward Hacking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.15149","snapshot_observed_at":"2026-08-06T00:42:57.018264Z","title":"LLMs gaming veri- fiers: RLVR can lead to reward hacking.arXiv preprint arXiv:2604.15149, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T00:42:57.018264Z"},"links":{"cited_paper":"/paper/2604.15149","citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:07acd3df478a2e0b7108fa07beaadb6b573fcb5d7b4c5a55aa5cc51d645f2e0f","observation_id":"dbdc489b-57d3-41ac-8f0c-cea0e5b2814b","resolution":{"observed_at":"2026-08-06T00:42:57.018264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:43:05.938799Z","title":"Large language models cannot self-correct reasoning yet","venue":null,"work_id":"3ea4297b-3e08-4105-a860-b1780ed2f3b2","year":2024},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T00:42:57.177300Z"},"links":{"citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:d3dccc2598a4d8f633e4bd1ca7bcb9e2bb6eb43bcdd339cdb59d00ae8cb82ddf","observation_id":"6c547609-724c-468b-ac3d-2d5426bc755a","resolution":{"observed_at":"2026-08-06T00:43:06.049364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:42:57.276071Z","title":"Pitfalls of rule- and model-based verifiers: A case study on mathematical reasoning.arXiv preprint arXiv:2505.22203, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T00:42:57.276071Z"},"links":{"citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:6633595ccdfd73e7f60075109b64dc01e0ae00fdc8037d2062fd1d6e00f033cb","observation_id":"a3212086-ea3f-4470-b589-c33e24fd66c1","resolution":{"observed_at":"2026-08-06T00:42:57.276071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12057","last_updated":"2024-10-28T17:45:56Z","snapshot_observed_at":"2026-08-12T22:22:22.005805Z","submitted_at":"2024-10-15T20:52:09Z","title":"Large-scale cloze evaluation reveals that token prediction tasks are neither lexically nor semantically aligned","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12057","snapshot_observed_at":"2026-08-06T00:42:57.335872Z","title":"Jacobs, Loïc Grobol, and Alvin Tsang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T00:42:57.335872Z"},"links":{"cited_paper":"/paper/2410.12057","citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:28b04d4cf4a5cafc91652b78317cf33daf2af0dc10516c0d40b02ffc45d01d08","observation_id":"c04fee6b-eb3d-492a-8552-fb573dc0c5a7","resolution":{"observed_at":"2026-08-06T00:42:57.335872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04298","last_updated":"2024-09-06T01:14:26Z","snapshot_observed_at":"2026-08-14T00:20:08.140594Z","submitted_at":"2024-04-04T20:27:37Z","title":"SELF-[IN]CORRECT: LLMs Struggle with Discriminating Self-Generated Responses","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04298","snapshot_observed_at":"2026-08-06T00:42:57.387763Z","title":"SELF-[IN]CORRECT: LLMs struggle with discriminating self-generated responses","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T00:42:57.387763Z"},"links":{"cited_paper":"/paper/2404.04298","citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:97acfe611651f26e8422784bb6fbdff6ab2057b4d7dec8b6664c8f865e33001a","observation_id":"d4d63866-d6d2-445d-90d9-125f3954079a","resolution":{"observed_at":"2026-08-06T00:42:57.387763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05221","last_updated":"2022-11-21T16:38:35Z","snapshot_observed_at":"2026-08-14T05:42:29.067319Z","submitted_at":"2022-07-11T22:59:39Z","title":"Language Models (Mostly) Know What They Know","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.05221","snapshot_observed_at":"2026-08-06T00:42:57.450552Z","title":"Language models (mostly) know what they know.arXiv preprint arXiv:2207.05221, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T00:42:57.450552Z"},"links":{"cited_paper":"/paper/2207.05221","citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:b2f68956c2dc57e2a5254eb2becacdd742e077860a4921f87d838a88fbd93a7b","observation_id":"a89ff8da-017e-4a43-8066-a445deb8ca2d","resolution":{"observed_at":"2026-08-06T00:42:57.450552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-10T16:05:13.426341Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-06T00:42:57.612250Z","title":"Tulu 3: Pushing frontiers in open language model post-training.arXiv preprint arXiv:2411.15124, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T00:42:57.612250Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:072c73bae5978c30569384178682000958f69a312d8fd2ad72ec9c317bf72b5e","observation_id":"31b5bf56-2455-40df-8c27-4ac6a37a2744","resolution":{"observed_at":"2026-08-06T00:42:57.612250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:43:05.783012Z","title":"Let’sverifystepbystep","venue":null,"work_id":"b4c381d6-7f6b-49e8-892a-d18e9ee87e7d","year":2024},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T00:42:57.680434Z"},"links":{"citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:7fdd0a71dac2fa393ec99ffa02cf2fde28a4e19245a63e08675c635b5f82531a","observation_id":"15d8bc4f-2ab0-47ad-996f-6442d3c29fbb","resolution":{"observed_at":"2026-08-06T00:43:05.861746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:43:05.609349Z","title":"Is your code generated by ChatGPT really correct? rigorous evaluation of large language models for code generation","venue":null,"work_id":"4983ddf0-4cd7-4067-ad17-4e4220c1893b","year":2023},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T00:42:57.779029Z"},"links":{"citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:b047e14c7a58d500f7518e270f0ae22838e48ca17740e596d67214424aa8c197","observation_id":"1041a728-0780-4d1b-9b1e-9fc7e41be5ef","resolution":{"observed_at":"2026-08-06T00:43:05.690456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06920","last_updated":"2025-07-10T03:12:09Z","snapshot_observed_at":"2026-08-14T02:20:25.887273Z","submitted_at":"2025-07-09T14:58:47Z","title":"Rethinking Verification for LLM Code Generation: From Generation to Testing","version":2},"cited_work":{"arxiv_id":"2507.06920","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.06920","snapshot_observed_at":"2026-08-06T00:43:02.198642Z","title":"Rethinking Verification for LLM Code Generation: From Generation to Testing","venue":"cs.CL","work_id":"e321348c-bd8c-4f65-83e2-5880084e4756","year":2025},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T00:42:57.915322Z"},"links":{"cited_paper":"/paper/2507.06920","citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:0d8ef1f5277f98152e1b0d7b8eb22765bd8850a4fe4108c84e85f7c99cdcccf2","observation_id":"f45f340b-6e35-426b-a2c7-6c37c87c9d3c","resolution":{"observed_at":"2026-08-06T00:43:02.301477Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:43:05.448148Z","title":"Self-refine: Iterative refinement with self-feedback","venue":null,"work_id":"ff860bd6-39ce-4b32-8bd8-e6e5a8a4757c","year":2023},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T00:42:57.957263Z"},"links":{"citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:c58149069a1a9ceae04de4d0cc6de71828280f42090e4c97c5fb9b32ab96a31c","observation_id":"261b4d69-af70-4247-8968-b61cb2c8d588","resolution":{"observed_at":"2026-08-06T00:43:05.515856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:43:05.299108Z","title":null,"venue":null,"work_id":"4dae6428-df81-4898-b5c7-87552a1ca40d","year":1995},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T00:42:58.059997Z"},"links":{"citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:55bff40ced85f390cbbbb14e7f99c5642c3a4b100476ed60208b191feb8e2b4c","observation_id":"5c55bc9d-56f5-495b-8c7a-f85f33a27070","resolution":{"observed_at":"2026-08-06T00:43:05.362211Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:43:05.111324Z","title":"What can we learn from collective human opinions on natural language inference data? InProceedings of EMNLP, 2020","venue":null,"work_id":"028a58ce-c3cb-4665-bd8d-25b50e3186d6","year":2020},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T00:42:58.138372Z"},"links":{"citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:7049db1e0ef79c0d50a19c6452938afefa4f6aaacf787d35bc589d4c4ec730d4","observation_id":"d4dedd60-c8fd-44a7-ae32-aa71ce43d2a6","resolution":{"observed_at":"2026-08-06T00:43:05.208678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:43:04.982659Z","title":"The effects of reward misspecification: Mapping and mitigating misaligned models","venue":null,"work_id":"057b9acc-654c-4093-a828-1fa31324085e","year":2022},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T00:42:58.221825Z"},"links":{"citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:1a732254b5d5ab1b510d0b5bb4f45ef2d87fd306d81d41102a8f4db41027a5ff","observation_id":"2ae0cc0b-53c8-4a2e-8a68-5bcdab945dd1","resolution":{"observed_at":"2026-08-06T00:43:05.052619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T00:42:58.258320Z","title":"Qwen2.5 technical report.arXiv preprint arXiv:2412.15115, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T00:42:58.258320Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:8ea97c63211dfc3044b4bb4fcdd867dc9f4a1ea9a1a7c9959fefa619402c60aa","observation_id":"a7d0c9a5-fc65-4dde-ac36-f927e43501aa","resolution":{"observed_at":"2026-08-06T00:42:58.258320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.01066","last_updated":"2026-05-31T07:18:07Z","snapshot_observed_at":"2026-08-08T02:46:37.818715Z","submitted_at":"2026-05-31T07:18:07Z","title":"Before the Model Learns the Bug:Fuzzing RLVR Verifiers","version":1},"cited_work":{"arxiv_id":"2606.01066","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.01066","snapshot_observed_at":"2026-08-06T00:43:01.974900Z","title":"Before the Model Learns the Bug:Fuzzing RLVR Verifiers","venue":"cs.AI","work_id":"b7d3a78a-c6ab-4a6a-9310-7ab3ad9afd6e","year":2026},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T00:42:58.298232Z"},"links":{"cited_paper":"/paper/2606.01066","citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:206dae2d01ff5dc3cde17b7c447f59bf468f26c0660c9e14601752586dc82791","observation_id":"9d5f5215-d663-4eaa-8ade-5d68212353fb","resolution":{"observed_at":"2026-08-06T00:43:02.020167Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:43:04.841911Z","title":"An empirical evaluation of using large language models for automated unit test generation.IEEE Transactions on Software Engineering, 2024","venue":null,"work_id":"98577b87-3b37-43a2-bd59-aff75af432b7","year":2024},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T00:42:58.462050Z"},"links":{"citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:17ea13d0905c760da820e01e45da36cbd8654ceeb0ef852344e6f17dca66526a","observation_id":"12ec88ad-73c2-45b3-82ff-215cc94ad8ef","resolution":{"observed_at":"2026-08-06T00:43:04.930480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T00:42:58.610145Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T00:42:58.610145Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:0cf53c0fc23e71d794ebb6def79215428b7e9d4836f0fe544f9d9377707fc317","observation_id":"4d1e0d3c-c731-42f6-81d8-0aa460389574","resolution":{"observed_at":"2026-08-06T00:42:58.610145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:42:58.664880Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T00:42:58.664880Z"},"links":{"citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:eead00814a530b8f349419c89a3110620e2f2738878c7dbf1412cdfa96fe20c7","observation_id":"59fe8eca-91b5-4b3b-b61f-47f671f12e7b","resolution":{"observed_at":"2026-08-06T00:42:58.664880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02674","last_updated":"2025-02-25T16:59:11Z","snapshot_observed_at":"2026-08-14T01:52:30.309788Z","submitted_at":"2024-12-03T18:47:26Z","title":"Mind the Gap: Examining the Self-Improvement Capabilities of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02674","snapshot_observed_at":"2026-08-06T00:42:58.750607Z","title":"Mind the gap: Examining the self-improvement capabilities of large language models.arXiv preprint arXiv:2412.02674, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T00:42:58.750607Z"},"links":{"cited_paper":"/paper/2412.02674","citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:65e56f72da42f76fabf905dc0b95d11533a16c1b24b012ef7e564b55c1634a07","observation_id":"4a151dce-1fbe-4ea6-af68-2b1378e91128","resolution":{"observed_at":"2026-08-06T00:42:58.750607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08115","last_updated":"2024-08-03T21:25:31Z","snapshot_observed_at":"2026-08-13T04:20:10.940720Z","submitted_at":"2024-02-12T23:11:01Z","title":"On the Self-Verification Limitations of Large Language Models on Reasoning and Planning Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08115","snapshot_observed_at":"2026-08-06T00:42:58.819481Z","title":"On the self-verification limitations of large language models on reasoning and planning tasks.arXiv preprint arXiv:2402.08115, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T00:42:58.819481Z"},"links":{"cited_paper":"/paper/2402.08115","citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:9cc4ef247a00ac512221ad5ab86036fea9308bfb9035cfda7424b5fc828f51c4","observation_id":"0f457223-c64b-4f60-b8b0-d9575cbc3583","resolution":{"observed_at":"2026-08-06T00:42:58.819481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:43:04.637136Z","title":"Just ask for calibration: Strategies for eliciting calibrated confidence scores from language models","venue":null,"work_id":"b2a406a4-be4e-4e7d-a8f1-6235428b541e","year":2023},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T00:42:58.890270Z"},"links":{"citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:92b5730744fc9bb48d200c7e0e26338554bdb927f36233c742d624a9c484673d","observation_id":"683e9c94-b538-447e-bfd9-f61edfaee109","resolution":{"observed_at":"2026-08-06T00:43:04.753162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:43:04.410995Z","title":"Order matters: Sequence to sequence for sets","venue":null,"work_id":"84547819-db0e-466d-a184-129388f37b5e","year":2016},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T00:42:58.971370Z"},"links":{"citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:acb369e6a788177192fb78776ddc536ddfeccab4e208749aa1ade34d5e3dea3a","observation_id":"32f3b319-5db9-4391-9e00-d3e90967dfd7","resolution":{"observed_at":"2026-08-06T00:43:04.479794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:43:04.237238Z","title":"Self-consistency improves chain of thought reasoning in language models","venue":null,"work_id":"dccf89f2-d92b-441f-bc3d-03b36fe11286","year":2023},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T00:42:59.054572Z"},"links":{"citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:85e98d20c051226e3cf90e670b7b1e3a050460c39587f60641e662a20cf3dc0d","observation_id":"290ed08f-de5f-440a-88ac-1ec852d72c44","resolution":{"observed_at":"2026-08-06T00:43:04.312856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:43:04.061479Z","title":"Con- sistency of a recurrent language model with respect to incomplete decoding","venue":null,"work_id":"a3a33046-fb47-47e2-b778-cb5a84b377e0","year":2020},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T00:42:59.158105Z"},"links":{"citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:1a7f5f85c58a37dffe7ee9536fc3547e9ac28ad5defe7d0bbe5e60867adf7010","observation_id":"99421d6f-cc4f-4d6f-ac40-2c5440992a10","resolution":{"observed_at":"2026-08-06T00:43:04.163427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:43:03.868074Z","title":"Large language models are better reasoners with self-verification","venue":null,"work_id":"dec0eb39-b1f1-44e1-9868-e05609019409","year":2023},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T00:42:59.255283Z"},"links":{"citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:b4aa560a750d6878d71f918c024622f777299cec58dc8331640387bd925a3675","observation_id":"2cc989b6-bc3c-4596-a067-a6cc37a92e28","resolution":{"observed_at":"2026-08-06T00:43:03.957082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:43:03.674289Z","title":"what it can create, it may not understand","venue":null,"work_id":"567911b4-d30a-4946-bbd9-f641a0493d5a","year":2024},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T00:42:59.332880Z"},"links":{"citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:8fe2b29c6705b4de215d4d910c50460cb01aa32b0102f3045fe536487f60399e","observation_id":"3a972c1a-5c23-46e9-92af-72b9315f088c","resolution":{"observed_at":"2026-08-06T00:43:03.758630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09702","last_updated":"2023-08-19T21:27:51Z","snapshot_observed_at":"2026-08-09T04:46:02.275866Z","submitted_at":"2023-07-19T01:14:49Z","title":"Efficient Guided Generation for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09702","snapshot_observed_at":"2026-08-06T00:42:59.366613Z","title":"Willard and Rémi Louf","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T00:42:59.366613Z"},"links":{"cited_paper":"/paper/2307.09702","citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:27c1269893f3e03e726608da21165de25e4f713c461e20390df1f17083dbeaec","observation_id":"2df6edbf-9234-47ab-abbb-249b9208a7e8","resolution":{"observed_at":"2026-08-06T00:42:59.366613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:43:03.516327Z","title":"Jiang, Wenda Li, et al","venue":null,"work_id":"385841db-81a5-455c-b26b-3c404ff140ba","year":2022},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T00:42:59.427699Z"},"links":{"citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:25e4b958e6c655c28b6ced0367e93c6c88c0f1b78d6bf23f2b529e162b99e3d6","observation_id":"09c82dbb-8a4e-48cb-950a-43421840574c","resolution":{"observed_at":"2026-08-06T00:43:03.588185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:43:03.350794Z","title":"Can LLMs express their uncertainty? an empirical evaluation of confidence elicitation in LLMs","venue":null,"work_id":"175c3898-48ea-4002-a31d-8651c6f7e95f","year":2024},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T00:42:59.506928Z"},"links":{"citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:2a6ebc58d6289db397b9f6ebbaace193b4bbb9dda27891692e90b42585d71354","observation_id":"18f93d2b-342f-4e6e-9566-7a552c9195ed","resolution":{"observed_at":"2026-08-06T00:43:03.450792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-06T00:42:59.575499Z","title":"DAPO: An open-source LLM reinforcement learning system at scale.arXiv preprint arXiv:2503.14476, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T00:42:59.575499Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:b7f8d347e06503a3c8aaeaae3560dd62cae127bb886b734c3a2cfc505e86dc8e","observation_id":"0e153ff8-2c8e-4109-a9a0-2c5f7b589980","resolution":{"observed_at":"2026-08-06T00:42:59.575499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:43:03.130507Z","title":"Judging LLM-as-a-judge with MT-bench and chatbot arena","venue":null,"work_id":"cb6c3015-6a9f-45ab-96a7-e273cf061e82","year":2023},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T00:42:59.671625Z"},"links":{"citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:19cbbab704bca8330c327897dfdcb684108b7cc960795fc0ebf79037bdca2087","observation_id":"c690072c-e9ad-48de-9f5c-32e63bac7c6b","resolution":{"observed_at":"2026-08-06T00:43:03.233303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:42:59.770338Z","title":"RubricBench: Aligning model-generated rubrics with human standards","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T00:42:59.770338Z"},"links":{"citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:15784f7f86f4e0d654eac13d2296e8e90a52e10776af7e4b1846a5a8c9925b1f","observation_id":"047a85fc-af93-4817-91e6-e91dc3018dd5","resolution":{"observed_at":"2026-08-06T00:42:59.770338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-08-07T08:02:34.857823Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-06T00:42:59.909123Z","title":"Self-rewarding language models.arXiv preprint arXiv:2401.10020, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T00:42:59.909123Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:9d22a91156d3eccb0b9868f0fa67af8d6b3fd16afa719dede91b392e7ac7c0d0","observation_id":"1b7c10b3-f874-4fe8-8bb0-b59dfb1efac2","resolution":{"observed_at":"2026-08-06T00:42:59.909123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15240","last_updated":"2025-02-22T10:21:46Z","snapshot_observed_at":"2026-08-12T22:56:24.326978Z","submitted_at":"2024-08-27T17:57:45Z","title":"Generative Verifiers: Reward Modeling as Next-Token Prediction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15240","snapshot_observed_at":"2026-08-06T00:42:59.966639Z","title":"Generative verifiers: Reward modeling as next-token prediction.arXiv preprint arXiv:2408.15240, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T00:42:59.966639Z"},"links":{"cited_paper":"/paper/2408.15240","citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:96c925cad27fa329852144732ee5e993fd68af4100b3b0377f2f3318fb745343","observation_id":"ab446688-d7fe-443e-ab53-2f9e60002670","resolution":{"observed_at":"2026-08-06T00:42:59.966639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00215","last_updated":"2024-06-28T19:53:17Z","snapshot_observed_at":"2026-08-12T23:32:25.133777Z","submitted_at":"2024-06-28T19:53:17Z","title":"LLM Critics Help Catch LLM Bugs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00215","snapshot_observed_at":"2026-08-06T00:43:00.039128Z","title":"LLM critics help catch LLM bugs.arXiv preprint arXiv:2407.00215, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T00:43:00.039128Z"},"links":{"cited_paper":"/paper/2407.00215","citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:efe5aae9a8b8200587b285776d3cd2f6defebbfdf373329734be9b518002c0fc","observation_id":"12947eb9-15c3-41cd-ac6d-73160fddd018","resolution":{"observed_at":"2026-08-06T00:43:00.039128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:43:02.984741Z","title":"SWT-Bench: Test- ing and validating real-world bug-fixes with code agents","venue":null,"work_id":"5e830692-a7ba-46a3-a81f-2ca390f682a6","year":2024},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T00:43:00.114410Z"},"links":{"citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:011f602875a64abe6db0cc4a71ee0ac30fb96b164857b21e3e544777a5f24422","observation_id":"796a9f74-3c3c-46c4-898b-aedb632ee5ab","resolution":{"observed_at":"2026-08-06T00:43:03.042207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:43:02.844927Z","title":null,"venue":null,"work_id":"e00d1c2e-b861-4de5-a9ef-bc29ae37c802","year":2023},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T00:43:00.195636Z"},"links":{"citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:bbae62c457594c57bce6d0b611d6755f16ca5d5e83f6269615fef1c02e99750c","observation_id":"9a5417b1-96e7-432a-b22a-eeb1cf7271d2","resolution":{"observed_at":"2026-08-06T00:43:02.910960Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:43:02.631451Z","title":"Tomayto, tomahto: Beyond token-level answer equivalence for question answering evaluation","venue":null,"work_id":"63870750-aa86-46e9-9b45-2cd47dbfcbc3","year":2022},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T00:43:00.307939Z"},"links":{"citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:9739c60b8ebf1a78ddade657db360f0678339ffa1b7716fb0fa8208e65451a6d","observation_id":"7e78a78f-6223-4c63-9ea3-3b09e37e95c8","resolution":{"observed_at":"2026-08-06T00:43:02.742530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03786","last_updated":"2024-12-10T00:45:24Z","snapshot_observed_at":"2026-08-13T05:52:45.349468Z","submitted_at":"2024-05-06T18:37:35Z","title":"TOGLL: Correct and Strong Test Oracle Generation with LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03786","snapshot_observed_at":"2026-08-06T00:43:00.408314Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T00:43:00.408314Z"},"links":{"cited_paper":"/paper/2405.03786","citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:3995d11997b776765479f58799fb5f4b77a4596911c6163066a23ff0d2bf34a5","observation_id":"5cd6e2e8-5672-4516-a13f-9301b2efc1fc","resolution":{"observed_at":"2026-08-06T00:43:00.408314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2411.08254","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:43:01.635916Z","title":"VALTEST: Automated validation of language model generated test cases.arXiv preprint arXiv:2411.08254, 2024","venue":null,"work_id":"44c70827-33ca-4eb7-bd67-b0785ca96a9d","year":2024},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T00:43:00.527312Z"},"links":{"citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:424b1f7f402439b2b1ec2aaaa8ecb84fc14fde00ca06bdced6dc8847af660c9a","observation_id":"ec88bab9-d4f6-4ae1-a738-cb20d5ee4566","resolution":{"observed_at":"2026-08-06T00:43:01.743085Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:43:00.589660Z","title":"Hallucination to consensus: Multi- agent LLMs for end-to-end JUnit test generation.ACM Transactions on Software Engineering and Methodology, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T00:43:00.589660Z"},"links":{"citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:19e8667c045f15b1c3a677ee0d563458f22ca55f192a8bc5ae677de1afa29627","observation_id":"6afcd0e0-4214-4d8a-b992-712d4c9a5c4e","resolution":{"observed_at":"2026-08-06T00:43:00.589660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21136","last_updated":"2024-10-28T15:37:06Z","snapshot_observed_at":"2026-08-12T22:13:40.857003Z","submitted_at":"2024-10-28T15:37:06Z","title":"Do LLMs generate test oracles that capture the actual or the expected program behaviour?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21136","snapshot_observed_at":"2026-08-06T00:43:00.711348Z","title":"Do LLMs generate test oracles that capture the actual or the expected program behaviour?arXiv preprint arXiv:2410.21136, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T00:43:00.711348Z"},"links":{"cited_paper":"/paper/2410.21136","citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:770536059399ea515273be6e53b3f843751f98cc5004c309fea1954e33fb1826","observation_id":"02d73510-88a2-49a8-8ad6-887c67f30d77","resolution":{"observed_at":"2026-08-06T00:43:00.711348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.10435","last_updated":"2023-01-27T15:30:27Z","snapshot_observed_at":"2026-08-12T07:50:34.802331Z","submitted_at":"2022-11-18T18:56:13Z","title":"PAL: Program-aided Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.10435","snapshot_observed_at":"2026-08-06T00:43:00.801354Z","title":"PAL: Program-aided language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T00:43:00.801354Z"},"links":{"cited_paper":"/paper/2211.10435","citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:36d969fbf3802c652c73cd21e8c50fd4e6eb8d2ffb92bfaba8814bdc29c88f27","observation_id":"b6b194e9-ca16-465e-a061-06b656f02174","resolution":{"observed_at":"2026-08-06T00:43:00.801354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.12588","last_updated":"2023-10-23T01:27:38Z","snapshot_observed_at":"2026-08-02T13:06:11.850456Z","submitted_at":"2022-11-22T21:06:00Z","title":"Program of Thoughts Prompting: Disentangling Computation from Reasoning for Numerical Reasoning Tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.12588","snapshot_observed_at":"2026-08-06T00:43:00.878591Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T00:43:00.878591Z"},"links":{"cited_paper":"/paper/2211.12588","citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:5f9591634148bbb3b5e2b6016e14307a36508286cd176217adc67bcbba727968","observation_id":"246a7c5b-3fb0-4a73-a6a8-40f2cfbd12ef","resolution":{"observed_at":"2026-08-06T00:43:00.878591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14625","snapshot_observed_at":"2026-08-06T00:43:00.923422Z","title":"TinyV: Reducing false negatives in verification improves RL for LLM reasoning.arXiv preprint arXiv:2505.14625, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T00:43:00.923422Z"},"links":{"cited_paper":"/paper/2505.14625","citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:077788fb5b82f88c99813a74b363fb6f81b53cbe35995e87f48afdd93f2cd097","observation_id":"fcb0a385-ed47-474e-88e8-9680e753f793","resolution":{"observed_at":"2026-08-06T00:43:00.923422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.04727","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:43:01.373995Z","title":"Sequential enumeration in large language models.arXiv preprint arXiv:2512.04727, 2025","venue":null,"work_id":"dd8ae7e4-a463-416b-bd97-3b63e9b3a15f","year":2025},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T00:43:01.079571Z"},"links":{"citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:2286224d32fbc0043c32b6823f1328315471840284067c3fad474121ead56a40","observation_id":"2a2c8d15-daa5-437a-bf31-b20394ddef9d","resolution":{"observed_at":"2026-08-06T00:43:01.425149Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:43:01.149558Z","title":"|S ∗|= 10","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T00:43:01.149558Z"},"links":{"citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:61cad0ab09b6acd1f01c412916a6b14d96a085321d9b000041f704235a07548b","observation_id":"59fdd9e4-6fcb-4ed3-a5c9-5609e1b3485a","resolution":{"observed_at":"2026-08-06T00:43:01.149558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-11T20:46:23.964034Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":4,"verified_fuzzy":22},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 0 inbound Pith citation observations for arXiv:2608.01000."}