{"as_of":"2026-08-20T13:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:441424d6c61f85358e4e5c455bb7fcb87461f02b16d4d8c1b230bde81c41e459","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T10:02:42.228482Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.16239/citation-record","integrity":"/paper/2607.16239/integrity","json":"/paper/2607.16239/citation-record.json","paper":"/paper/2607.16239"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:02:36.735541Z","title":"and Tanno, Ryutaro and Schwaighofer, Anton and Tezcan, Kerem C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16239","last_updated":"2026-06-26T00:31:00Z","snapshot_observed_at":"2026-08-20T08:19:41.088070Z","submitted_at":"2026-06-26T00:31:00Z","title":"BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-02T10:02:36.735541Z"},"links":{"citing_paper":"/paper/2607.16239"},"observation_digest":"sha256:dfddb4592bd78077ce56b175f2c709468ebb3fffce26794169c452b4a1afba90","observation_id":"cc0b5e90-ca7b-4f89-abdb-5a5af7d5d4e0","resolution":{"observed_at":"2026-08-02T10:02:36.735541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06812","last_updated":"2023-01-27T18:53:11Z","snapshot_observed_at":"2026-08-17T00:30:24.055922Z","submitted_at":"2022-10-13T07:54:07Z","title":"CROWDLAB: Supervised learning to infer consensus labels and quality scores for data with multiple annotators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.06812","snapshot_observed_at":"2026-08-02T10:02:36.797778Z","title":"doi:10.48550/arXiv.2210.06812 , abstract =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16239","last_updated":"2026-06-26T00:31:00Z","snapshot_observed_at":"2026-08-20T08:19:41.088070Z","submitted_at":"2026-06-26T00:31:00Z","title":"BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-02T10:02:36.797778Z"},"links":{"cited_paper":"/paper/2210.06812","citing_paper":"/paper/2607.16239"},"observation_digest":"sha256:4bb6096c55d5548910327653bb048129572f7ac6d1b9641c0fbb559820ef0202","observation_id":"88db8488-36db-4107-9139-1e0ef6d2ec70","resolution":{"observed_at":"2026-08-02T10:02:36.797778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10820","last_updated":"2024-06-04T13:15:16Z","snapshot_observed_at":"2026-08-16T14:09:15.457659Z","submitted_at":"2024-03-16T06:10:22Z","title":"Active Label Correction for Semantic Segmentation with Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10820","snapshot_observed_at":"2026-08-02T10:02:36.850586Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16239","last_updated":"2026-06-26T00:31:00Z","snapshot_observed_at":"2026-08-20T08:19:41.088070Z","submitted_at":"2026-06-26T00:31:00Z","title":"BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-02T10:02:36.850586Z"},"links":{"cited_paper":"/paper/2403.10820","citing_paper":"/paper/2607.16239"},"observation_digest":"sha256:83911f8a49fb2f5bea2528b89bc5c4c7e58d38bc5d41df4c49b77febd9f8b706","observation_id":"a826fa97-6006-4213-9e99-bf46f3874c23","resolution":{"observed_at":"2026-08-02T10:02:36.850586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.05022","last_updated":"2021-07-22T07:04:55Z","snapshot_observed_at":"2026-08-16T18:52:34.652391Z","submitted_at":"2021-01-13T11:55:58Z","title":"Re-labeling ImageNet: from Single to Multi-Labels, from Global to Localized Labels","version":2},"cited_work":{"arxiv_id":"2101.05022","doi":"10.48550/arxiv.2101.05022","metadata_source":"pith","pith_arxiv_id":"2101.05022","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Re-labeling ImageNet: from Single to Multi-Labels, from Global to Localized Labels","venue":"cs.CV","work_id":"b6170d32-12aa-475b-8aa7-4136acd56182","year":2021},"citing_paper":{"arxiv_id":"2607.16239","last_updated":"2026-06-26T00:31:00Z","snapshot_observed_at":"2026-08-20T08:19:41.088070Z","submitted_at":"2026-06-26T00:31:00Z","title":"BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-02T10:02:36.913050Z"},"links":{"cited_paper":"/paper/2101.05022","citing_paper":"/paper/2607.16239"},"observation_digest":"sha256:8738e001de896d557a2fef75bf94203e5062df2be3d0b4fe143bb956a62649dc","observation_id":"146248a4-36f8-49dc-85f0-ed55d9f7b979","resolution":{"observed_at":"2026-08-02T10:03:21.612999Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.14749","last_updated":"2021-11-07T13:04:04Z","snapshot_observed_at":"2026-08-16T18:35:58.593110Z","submitted_at":"2021-03-26T21:54:36Z","title":"Pervasive Label Errors in Test Sets Destabilize Machine Learning Benchmarks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.14749","snapshot_observed_at":"2026-08-02T10:02:37.001079Z","title":"and Athalye, Anish and Mueller, Jonas , month = nov, year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16239","last_updated":"2026-06-26T00:31:00Z","snapshot_observed_at":"2026-08-20T08:19:41.088070Z","submitted_at":"2026-06-26T00:31:00Z","title":"BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-02T10:02:37.001079Z"},"links":{"cited_paper":"/paper/2103.14749","citing_paper":"/paper/2607.16239"},"observation_digest":"sha256:0a12820403d0b7b9433ee0ef38732b05779569f1b2538e150c0c327cc9b08689","observation_id":"5d3000d0-13a7-4bfb-8455-5a40d5cdd5d4","resolution":{"observed_at":"2026-08-02T10:02:37.001079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.00068","last_updated":"2022-08-22T00:58:03Z","snapshot_observed_at":"2026-08-20T11:01:53.152700Z","submitted_at":"2019-10-31T19:26:33Z","title":"Confident Learning: Estimating Uncertainty in Dataset Labels","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.00068","snapshot_observed_at":"2026-08-02T10:02:37.068883Z","title":"and Jiang, Lu and Chuang, Isaac L","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2607.16239","last_updated":"2026-06-26T00:31:00Z","snapshot_observed_at":"2026-08-20T08:19:41.088070Z","submitted_at":"2026-06-26T00:31:00Z","title":"BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-02T10:02:37.068883Z"},"links":{"cited_paper":"/paper/1911.00068","citing_paper":"/paper/2607.16239"},"observation_digest":"sha256:2efaf044e4508009a4967f5ff60a743a19e378930da2791549379a40099a6eb8","observation_id":"eb514b99-9dfb-41ae-ac39-b5140524b364","resolution":{"observed_at":"2026-08-02T10:02:37.068883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:02:37.261530Z","title":"International Journal of Human-Computer Studies , volume=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16239","last_updated":"2026-06-26T00:31:00Z","snapshot_observed_at":"2026-08-20T08:19:41.088070Z","submitted_at":"2026-06-26T00:31:00Z","title":"BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-02T10:02:37.261530Z"},"links":{"citing_paper":"/paper/2607.16239"},"observation_digest":"sha256:63c81215faa271ab55a8099f832554b31ba77752f91accb9a712cd042eb8c0b0","observation_id":"86b43fe6-9d1e-44be-aa2c-844a416ae05d","resolution":{"observed_at":"2026-08-02T10:02:37.261530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:02:37.508923Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16239","last_updated":"2026-06-26T00:31:00Z","snapshot_observed_at":"2026-08-20T08:19:41.088070Z","submitted_at":"2026-06-26T00:31:00Z","title":"BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-02T10:02:37.508923Z"},"links":{"citing_paper":"/paper/2607.16239"},"observation_digest":"sha256:7b4e766fe030259d44cca24327e28f7acce9ea8fcd66c20e80e8375b82464696","observation_id":"68f15005-44a2-4874-804f-f6a3c4668752","resolution":{"observed_at":"2026-08-02T10:02:37.508923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:02:37.664819Z","title":"2016 , pages =","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.16239","last_updated":"2026-06-26T00:31:00Z","snapshot_observed_at":"2026-08-20T08:19:41.088070Z","submitted_at":"2026-06-26T00:31:00Z","title":"BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-02T10:02:37.664819Z"},"links":{"citing_paper":"/paper/2607.16239"},"observation_digest":"sha256:60a3006bea453fef955486431f1fd5d46c1bc2969ac9d8e775655c5506f9c469","observation_id":"f0947870-4e18-42da-a976-01d0b9beac98","resolution":{"observed_at":"2026-08-02T10:02:37.664819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:02:37.767828Z","title":"Applied Statistics , author =","venue":null,"work_id":null,"year":1979},"citing_paper":{"arxiv_id":"2607.16239","last_updated":"2026-06-26T00:31:00Z","snapshot_observed_at":"2026-08-20T08:19:41.088070Z","submitted_at":"2026-06-26T00:31:00Z","title":"BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-02T10:02:37.767828Z"},"links":{"citing_paper":"/paper/2607.16239"},"observation_digest":"sha256:4a9b9406f070406d4b0ee0b58729ffd3dfff638ec8380f1cc0e4978813ba2bf8","observation_id":"805558bc-e207-4f83-8057-4f4c8011a8a9","resolution":{"observed_at":"2026-08-02T10:02:37.767828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04475","last_updated":"2025-03-10T09:27:03Z","snapshot_observed_at":"2026-07-06T17:56:23.317089Z","submitted_at":"2024-04-06T02:29:02Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04475","snapshot_observed_at":"2026-08-02T10:02:37.822337Z","title":", month = mar, year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16239","last_updated":"2026-06-26T00:31:00Z","snapshot_observed_at":"2026-08-20T08:19:41.088070Z","submitted_at":"2026-06-26T00:31:00Z","title":"BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-02T10:02:37.822337Z"},"links":{"cited_paper":"/paper/2404.04475","citing_paper":"/paper/2607.16239"},"observation_digest":"sha256:ea7f19b46db67106cfb1cb21e83dc33e6eee42f1fa1b40851f23069a082c5338","observation_id":"0d06bfe2-70b1-4e8a-8367-61f2a05bfdb3","resolution":{"observed_at":"2026-08-02T10:02:37.822337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01535","last_updated":"2024-12-04T19:23:17Z","snapshot_observed_at":"2026-08-16T13:55:51.395455Z","submitted_at":"2024-05-02T17:59:35Z","title":"Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01535","snapshot_observed_at":"2026-08-02T10:02:37.926198Z","title":"Prometheus 2:","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16239","last_updated":"2026-06-26T00:31:00Z","snapshot_observed_at":"2026-08-20T08:19:41.088070Z","submitted_at":"2026-06-26T00:31:00Z","title":"BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-02T10:02:37.926198Z"},"links":{"cited_paper":"/paper/2405.01535","citing_paper":"/paper/2607.16239"},"observation_digest":"sha256:6ab8f82548d33c918bd3e5550104d531418480f8997ac15d227cc38cfd45cb6e","observation_id":"4b2a61fe-472f-44f8-84cd-293b4924161f","resolution":{"observed_at":"2026-08-02T10:02:37.926198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:02:38.025221Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16239","last_updated":"2026-06-26T00:31:00Z","snapshot_observed_at":"2026-08-20T08:19:41.088070Z","submitted_at":"2026-06-26T00:31:00Z","title":"BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-02T10:02:38.025221Z"},"links":{"citing_paper":"/paper/2607.16239"},"observation_digest":"sha256:26dc1dda79b74c5d7a149b091c33e8ccaa27b2bf5aba5a15acf476aef94f0753","observation_id":"44171479-06ac-4ad4-ab81-5e0ff22c3905","resolution":{"observed_at":"2026-08-02T10:02:38.025221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:02:38.096308Z","title":"2002 , publisher=","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.16239","last_updated":"2026-06-26T00:31:00Z","snapshot_observed_at":"2026-08-20T08:19:41.088070Z","submitted_at":"2026-06-26T00:31:00Z","title":"BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-02T10:02:38.096308Z"},"links":{"citing_paper":"/paper/2607.16239"},"observation_digest":"sha256:07b0805c798a4cae5597443439c593562910eb6e4ffeff955ec73d8e4ffa0218","observation_id":"49956311-0aee-4a9e-9b69-bde3928a114c","resolution":{"observed_at":"2026-08-02T10:02:38.096308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:02:38.193595Z","title":"arXiv preprint arXiv:2507.01372 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16239","last_updated":"2026-06-26T00:31:00Z","snapshot_observed_at":"2026-08-20T08:19:41.088070Z","submitted_at":"2026-06-26T00:31:00Z","title":"BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-02T10:02:38.193595Z"},"links":{"citing_paper":"/paper/2607.16239"},"observation_digest":"sha256:4d211fcfea3a1e4f5d4dc7207d6d6d1a5574578c8e4763a8dd48cda6309a8b84","observation_id":"eea6e29f-18e6-4e30-9230-d393a2c765aa","resolution":{"observed_at":"2026-08-02T10:02:38.193595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:02:38.343104Z","title":"arXiv preprint arXiv:2511.08991 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16239","last_updated":"2026-06-26T00:31:00Z","snapshot_observed_at":"2026-08-20T08:19:41.088070Z","submitted_at":"2026-06-26T00:31:00Z","title":"BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-02T10:02:38.343104Z"},"links":{"citing_paper":"/paper/2607.16239"},"observation_digest":"sha256:d0e1cd2b9bacd29f32ce00163c11c4511a691565f1af5e837514b42e8efb36b3","observation_id":"5ae0b878-47b0-4fa7-9dee-d617f8312307","resolution":{"observed_at":"2026-08-02T10:02:38.343104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15260","last_updated":"2025-08-21T05:48:38Z","snapshot_observed_at":"2026-08-12T17:10:09.978771Z","submitted_at":"2025-08-21T05:48:38Z","title":"Deep Think with Confidence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.15260","snapshot_observed_at":"2026-08-02T10:02:38.510143Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16239","last_updated":"2026-06-26T00:31:00Z","snapshot_observed_at":"2026-08-20T08:19:41.088070Z","submitted_at":"2026-06-26T00:31:00Z","title":"BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-02T10:02:38.510143Z"},"links":{"cited_paper":"/paper/2508.15260","citing_paper":"/paper/2607.16239"},"observation_digest":"sha256:2b9dfc91a8a3bb8acd70104a37b6814b684cbbdd559f3f7aa6c999d0907a7988","observation_id":"25edf008-2d97-419b-bc87-9ad7750d29e1","resolution":{"observed_at":"2026-08-02T10:02:38.510143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:02:38.633785Z","title":"Assessing Writing , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16239","last_updated":"2026-06-26T00:31:00Z","snapshot_observed_at":"2026-08-20T08:19:41.088070Z","submitted_at":"2026-06-26T00:31:00Z","title":"BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-02T10:02:38.633785Z"},"links":{"citing_paper":"/paper/2607.16239"},"observation_digest":"sha256:d1daf7fcb318c1f62793a7dbb718fa195f49463aa847a24c90d64ba89c336349","observation_id":"180fef72-91aa-47ab-a012-5dc417b0be68","resolution":{"observed_at":"2026-08-02T10:02:38.633785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:02:38.854352Z","title":"Transactions of the Association for Computational Linguistics , volume=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16239","last_updated":"2026-06-26T00:31:00Z","snapshot_observed_at":"2026-08-20T08:19:41.088070Z","submitted_at":"2026-06-26T00:31:00Z","title":"BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-02T10:02:38.854352Z"},"links":{"citing_paper":"/paper/2607.16239"},"observation_digest":"sha256:aa3434ffce475edd3f84c57ff14ee19641796f1908bc10890d95f8fcd9aef49b","observation_id":"18997e56-ebde-4f3f-b138-1f0cb174080a","resolution":{"observed_at":"2026-08-02T10:02:38.854352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:02:39.011034Z","title":"Proceedings of the IEEE/CVF international conference on computer vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16239","last_updated":"2026-06-26T00:31:00Z","snapshot_observed_at":"2026-08-20T08:19:41.088070Z","submitted_at":"2026-06-26T00:31:00Z","title":"BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-02T10:02:39.011034Z"},"links":{"citing_paper":"/paper/2607.16239"},"observation_digest":"sha256:58b0d585607c3996a2c839535712d8a508694a36caab20be7ecc7cd7a7ee27e9","observation_id":"d30b06c9-9b1a-401b-b2b0-71c52a21e0bc","resolution":{"observed_at":"2026-08-02T10:02:39.011034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:02:39.105810Z","title":"The Annals of Applied Statistics , volume=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16239","last_updated":"2026-06-26T00:31:00Z","snapshot_observed_at":"2026-08-20T08:19:41.088070Z","submitted_at":"2026-06-26T00:31:00Z","title":"BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-02T10:02:39.105810Z"},"links":{"citing_paper":"/paper/2607.16239"},"observation_digest":"sha256:deb5d087ed85ae0c814a61b63ab6a3fe7dc67bdcc5f716a6cb4ff3f1cc146d28","observation_id":"a1e7c997-729b-4c6a-b6c5-99f0958b1d75","resolution":{"observed_at":"2026-08-02T10:02:39.105810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:02:39.182453Z","title":"The Econometrics Journal , volume=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.16239","last_updated":"2026-06-26T00:31:00Z","snapshot_observed_at":"2026-08-20T08:19:41.088070Z","submitted_at":"2026-06-26T00:31:00Z","title":"BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-02T10:02:39.182453Z"},"links":{"citing_paper":"/paper/2607.16239"},"observation_digest":"sha256:be1ae91561083114b3106f7058231c02fb6b699b39f0dd74f0c7f19834bab1c9","observation_id":"4b46fb76-60b6-46fe-8524-93d8ee668a64","resolution":{"observed_at":"2026-08-02T10:02:39.182453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:02:39.261597Z","title":"Science , volume=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16239","last_updated":"2026-06-26T00:31:00Z","snapshot_observed_at":"2026-08-20T08:19:41.088070Z","submitted_at":"2026-06-26T00:31:00Z","title":"BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-02T10:02:39.261597Z"},"links":{"citing_paper":"/paper/2607.16239"},"observation_digest":"sha256:61a887f9100cfa7964fed7ec92197466eb5416cf2bf7dd009e0d55626ff4067a","observation_id":"23f5c53a-263d-4bb1-b4bb-7fe6dce984de","resolution":{"observed_at":"2026-08-02T10:02:39.261597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:02:39.338823Z","title":"and Duchi, John C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16239","last_updated":"2026-06-26T00:31:00Z","snapshot_observed_at":"2026-08-20T08:19:41.088070Z","submitted_at":"2026-06-26T00:31:00Z","title":"BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-02T10:02:39.338823Z"},"links":{"citing_paper":"/paper/2607.16239"},"observation_digest":"sha256:67a8b16d800595dfa1e61f29f067b0eb09297bbbfb5d5ca2395756ccd3c42d60","observation_id":"43681a52-226c-48a9-93ee-c1ed77290899","resolution":{"observed_at":"2026-08-02T10:02:39.338823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:02:39.429731Z","title":"Proceedings of the National Academy of Sciences , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16239","last_updated":"2026-06-26T00:31:00Z","snapshot_observed_at":"2026-08-20T08:19:41.088070Z","submitted_at":"2026-06-26T00:31:00Z","title":"BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-02T10:02:39.429731Z"},"links":{"citing_paper":"/paper/2607.16239"},"observation_digest":"sha256:53a6a0ae3a027056982b0be79acaecc5a3df3c8a837dc456fe7335564bafccb3","observation_id":"23442581-0629-44f7-8d24-7ca5e36ffe3c","resolution":{"observed_at":"2026-08-02T10:02:39.429731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:02:39.515117Z","title":"1992 , publisher=","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2607.16239","last_updated":"2026-06-26T00:31:00Z","snapshot_observed_at":"2026-08-20T08:19:41.088070Z","submitted_at":"2026-06-26T00:31:00Z","title":"BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-02T10:02:39.515117Z"},"links":{"citing_paper":"/paper/2607.16239"},"observation_digest":"sha256:4822e1a5b2917bf7057b466bd6395c7a6cf1a4c9f1cd2739752f14142c6c0879","observation_id":"22d79700-0cdf-41f3-9706-e4f5ebbd2704","resolution":{"observed_at":"2026-08-02T10:02:39.515117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:02:39.598977Z","title":"Biometrika , volume=","venue":null,"work_id":null,"year":1976},"citing_paper":{"arxiv_id":"2607.16239","last_updated":"2026-06-26T00:31:00Z","snapshot_observed_at":"2026-08-20T08:19:41.088070Z","submitted_at":"2026-06-26T00:31:00Z","title":"BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-02T10:02:39.598977Z"},"links":{"citing_paper":"/paper/2607.16239"},"observation_digest":"sha256:7006a72ee0326351a62c37a53a7f46e6731eb2259a6937f5ae01e300304c1260","observation_id":"35910408-382e-4de7-a997-10550edc747c","resolution":{"observed_at":"2026-08-02T10:02:39.598977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:02:39.680954Z","title":"The Annals of Statistics , volume=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.16239","last_updated":"2026-06-26T00:31:00Z","snapshot_observed_at":"2026-08-20T08:19:41.088070Z","submitted_at":"2026-06-26T00:31:00Z","title":"BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-02T10:02:39.680954Z"},"links":{"citing_paper":"/paper/2607.16239"},"observation_digest":"sha256:96704fe5110c1c5bb8393c18ad557b59bf189e10efca61f1742cee4cfd4d44dc","observation_id":"390dfa8b-5c5e-411e-ac97-de27f2cb148a","resolution":{"observed_at":"2026-08-02T10:02:39.680954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:02:39.737223Z","title":"Journal of the Royal Statistical Society: Series B , volume=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.16239","last_updated":"2026-06-26T00:31:00Z","snapshot_observed_at":"2026-08-20T08:19:41.088070Z","submitted_at":"2026-06-26T00:31:00Z","title":"BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-02T10:02:39.737223Z"},"links":{"citing_paper":"/paper/2607.16239"},"observation_digest":"sha256:2d68458a37846e7fa7345d594e168bd346d1f0baf1397d915480320577908eed","observation_id":"69c94ca9-91b8-427f-b2ca-cdef1f05ae4a","resolution":{"observed_at":"2026-08-02T10:02:39.737223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:02:39.778880Z","title":"and Zhang, Hao and Gonzalez, Joseph E","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16239","last_updated":"2026-06-26T00:31:00Z","snapshot_observed_at":"2026-08-20T08:19:41.088070Z","submitted_at":"2026-06-26T00:31:00Z","title":"BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-02T10:02:39.778880Z"},"links":{"citing_paper":"/paper/2607.16239"},"observation_digest":"sha256:3391b46ac591903e00943679e0e5cb73b784186cf8718e826a3e9f7613722536","observation_id":"cf7d139b-f6f9-4d58-9ed6-ed55e71747b5","resolution":{"observed_at":"2026-08-02T10:02:39.778880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:02:39.795503Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16239","last_updated":"2026-06-26T00:31:00Z","snapshot_observed_at":"2026-08-20T08:19:41.088070Z","submitted_at":"2026-06-26T00:31:00Z","title":"BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-02T10:02:39.795503Z"},"links":{"citing_paper":"/paper/2607.16239"},"observation_digest":"sha256:0bec0872ef756260d6db2c79a6cde08fcc44d160041cfc0459bd1bdae392b1f3","observation_id":"69cf0b29-3197-48c7-982f-a2e93031c653","resolution":{"observed_at":"2026-08-02T10:02:39.795503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17926","last_updated":"2023-08-30T13:22:35Z","snapshot_observed_at":"2026-08-14T09:51:03.197404Z","submitted_at":"2023-05-29T07:41:03Z","title":"Large Language Models are not Fair Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17926","snapshot_observed_at":"2026-08-02T10:02:39.901631Z","title":"arXiv preprint arXiv:2305.17926 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16239","last_updated":"2026-06-26T00:31:00Z","snapshot_observed_at":"2026-08-20T08:19:41.088070Z","submitted_at":"2026-06-26T00:31:00Z","title":"BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-02T10:02:39.901631Z"},"links":{"cited_paper":"/paper/2305.17926","citing_paper":"/paper/2607.16239"},"observation_digest":"sha256:7ea48989b3bd9073853b127fa90059f8b5530bee9464a935e38376ca03335c05","observation_id":"84348907-2062-41d7-a97f-73f1e75be3ad","resolution":{"observed_at":"2026-08-02T10:02:39.901631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:02:40.065029Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16239","last_updated":"2026-06-26T00:31:00Z","snapshot_observed_at":"2026-08-20T08:19:41.088070Z","submitted_at":"2026-06-26T00:31:00Z","title":"BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-02T10:02:40.065029Z"},"links":{"citing_paper":"/paper/2607.16239"},"observation_digest":"sha256:0476c93664d7f74e16502e698021f3e1e07c0d9603db6b26487e97be355decfe","observation_id":"009051d1-630f-48b8-b4f9-d3e81c4f086f","resolution":{"observed_at":"2026-08-02T10:02:40.065029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:02:40.173194Z","title":"A Survey on","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16239","last_updated":"2026-06-26T00:31:00Z","snapshot_observed_at":"2026-08-20T08:19:41.088070Z","submitted_at":"2026-06-26T00:31:00Z","title":"BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-02T10:02:40.173194Z"},"links":{"citing_paper":"/paper/2607.16239"},"observation_digest":"sha256:039620f0ce5742d8dd3622a2ea24a808e3f47239f6e8866b52114d73bae175cc","observation_id":"043dcf38-241a-44bb-9433-c16c5a270922","resolution":{"observed_at":"2026-08-02T10:02:40.173194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:02:40.291453Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16239","last_updated":"2026-06-26T00:31:00Z","snapshot_observed_at":"2026-08-20T08:19:41.088070Z","submitted_at":"2026-06-26T00:31:00Z","title":"BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-02T10:02:40.291453Z"},"links":{"citing_paper":"/paper/2607.16239"},"observation_digest":"sha256:552c8d68a5e47aaa1e7a1085df302ab98c90a905c421ff35186d85e2159bcd28","observation_id":"b2c319f9-468e-435f-a625-85c7e7285589","resolution":{"observed_at":"2026-08-02T10:02:40.291453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:02:40.393802Z","title":"Proceedings of the 41st International Conference on Machine Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16239","last_updated":"2026-06-26T00:31:00Z","snapshot_observed_at":"2026-08-20T08:19:41.088070Z","submitted_at":"2026-06-26T00:31:00Z","title":"BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-02T10:02:40.393802Z"},"links":{"citing_paper":"/paper/2607.16239"},"observation_digest":"sha256:db9d919d233a805483afad400b3c2bff37175fb7031c47cc0bcc72ebc1632665","observation_id":"e97f940c-2b34-4c41-85fd-99f6f44f02f8","resolution":{"observed_at":"2026-08-02T10:02:40.393802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:02:40.502688Z","title":"Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing , year=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16239","last_updated":"2026-06-26T00:31:00Z","snapshot_observed_at":"2026-08-20T08:19:41.088070Z","submitted_at":"2026-06-26T00:31:00Z","title":"BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-02T10:02:40.502688Z"},"links":{"citing_paper":"/paper/2607.16239"},"observation_digest":"sha256:5470b20067df7abdcab48f1b6c093ff881e88e4c317a1d85ae2e6abd5ea4f68a","observation_id":"a03f5688-6074-49aa-8dc7-4053e3456085","resolution":{"observed_at":"2026-08-02T10:02:40.502688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:02:40.587038Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16239","last_updated":"2026-06-26T00:31:00Z","snapshot_observed_at":"2026-08-20T08:19:41.088070Z","submitted_at":"2026-06-26T00:31:00Z","title":"BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-02T10:02:40.587038Z"},"links":{"citing_paper":"/paper/2607.16239"},"observation_digest":"sha256:69f1931a9c28f5796b820376db2209b9be0a1070e163e88d526238dff8f1a0e5","observation_id":"e9aa15a8-84c8-4960-bec9-bee4cc7f4f75","resolution":{"observed_at":"2026-08-02T10:02:40.587038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:02:40.691121Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16239","last_updated":"2026-06-26T00:31:00Z","snapshot_observed_at":"2026-08-20T08:19:41.088070Z","submitted_at":"2026-06-26T00:31:00Z","title":"BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-02T10:02:40.691121Z"},"links":{"citing_paper":"/paper/2607.16239"},"observation_digest":"sha256:bc5e74f1aa92189ce03620fe79f5b69eeb99f8da882da917e17141331bec221f","observation_id":"7d70c31c-173d-4a66-97b1-fbff00907b91","resolution":{"observed_at":"2026-08-02T10:02:40.691121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18796","last_updated":"2024-05-01T15:37:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-29T15:33:23Z","title":"Replacing Judges with Juries: Evaluating LLM Generations with a Panel of Diverse Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18796","snapshot_observed_at":"2026-08-02T10:02:40.860728Z","title":"Replacing Judges with Juries: Evaluating","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16239","last_updated":"2026-06-26T00:31:00Z","snapshot_observed_at":"2026-08-20T08:19:41.088070Z","submitted_at":"2026-06-26T00:31:00Z","title":"BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-02T10:02:40.860728Z"},"links":{"cited_paper":"/paper/2404.18796","citing_paper":"/paper/2607.16239"},"observation_digest":"sha256:42fb7f18a7127b2fd6537c5bb30e106be9f20364e1c9b65e565df6f841e69397","observation_id":"199b660b-6ff6-45d6-a181-5536b142840e","resolution":{"observed_at":"2026-08-02T10:02:40.860728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:02:40.965634Z","title":"Enhancing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16239","last_updated":"2026-06-26T00:31:00Z","snapshot_observed_at":"2026-08-20T08:19:41.088070Z","submitted_at":"2026-06-26T00:31:00Z","title":"BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-02T10:02:40.965634Z"},"links":{"citing_paper":"/paper/2607.16239"},"observation_digest":"sha256:204a75cddf82412b1ae4aa262ee72793cd0459cca8cf8f01164dbe765723b3a1","observation_id":"9ba43dac-c646-460f-b004-3b9fb3f5d0a3","resolution":{"observed_at":"2026-08-02T10:02:40.965634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:02:41.013651Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16239","last_updated":"2026-06-26T00:31:00Z","snapshot_observed_at":"2026-08-20T08:19:41.088070Z","submitted_at":"2026-06-26T00:31:00Z","title":"BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-02T10:02:41.013651Z"},"links":{"citing_paper":"/paper/2607.16239"},"observation_digest":"sha256:394328e1893a1b2e95e9b50782d8e2bdbb7991ae9afd5c58505f2555315ac86d","observation_id":"fdd547c2-ebc6-452f-97ed-0833cffc93f8","resolution":{"observed_at":"2026-08-02T10:02:41.013651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:02:41.104201Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16239","last_updated":"2026-06-26T00:31:00Z","snapshot_observed_at":"2026-08-20T08:19:41.088070Z","submitted_at":"2026-06-26T00:31:00Z","title":"BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-02T10:02:41.104201Z"},"links":{"citing_paper":"/paper/2607.16239"},"observation_digest":"sha256:c0566a1ef40dcfcd367c6ce07ff0acd314a8484c30fbbd6c45324f647b6ca16b","observation_id":"59775538-2086-444f-b486-9a5196eb6948","resolution":{"observed_at":"2026-08-02T10:02:41.104201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01535","last_updated":"2024-12-04T19:23:17Z","snapshot_observed_at":"2026-08-16T13:55:51.395455Z","submitted_at":"2024-05-02T17:59:35Z","title":"Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01535","snapshot_observed_at":"2026-08-02T10:02:41.214150Z","title":"arXiv preprint arXiv:2405.01535 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16239","last_updated":"2026-06-26T00:31:00Z","snapshot_observed_at":"2026-08-20T08:19:41.088070Z","submitted_at":"2026-06-26T00:31:00Z","title":"BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-02T10:02:41.214150Z"},"links":{"cited_paper":"/paper/2405.01535","citing_paper":"/paper/2607.16239"},"observation_digest":"sha256:ea203162593ba611a962928075b4f972e71682a8044dc140fc3bf627511d99c7","observation_id":"da6dcea5-c533-4d7a-bd14-53e25c6e8103","resolution":{"observed_at":"2026-08-02T10:02:41.214150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:02:41.318881Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16239","last_updated":"2026-06-26T00:31:00Z","snapshot_observed_at":"2026-08-20T08:19:41.088070Z","submitted_at":"2026-06-26T00:31:00Z","title":"BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-02T10:02:41.318881Z"},"links":{"citing_paper":"/paper/2607.16239"},"observation_digest":"sha256:1618bc39112c2198e9292f25ef1f614e3fd804ee87b01c37aa495c450366279a","observation_id":"af2e6d10-3034-4383-bf28-324a9ee37afd","resolution":{"observed_at":"2026-08-02T10:02:41.318881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05470","last_updated":"2023-12-07T08:48:36Z","snapshot_observed_at":"2026-08-16T14:53:56.793203Z","submitted_at":"2023-10-09T07:27:15Z","title":"Generative Judge for Evaluating Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05470","snapshot_observed_at":"2026-08-02T10:02:41.468860Z","title":"arXiv preprint arXiv:2310.05470 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16239","last_updated":"2026-06-26T00:31:00Z","snapshot_observed_at":"2026-08-20T08:19:41.088070Z","submitted_at":"2026-06-26T00:31:00Z","title":"BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-02T10:02:41.468860Z"},"links":{"cited_paper":"/paper/2310.05470","citing_paper":"/paper/2607.16239"},"observation_digest":"sha256:05c397e16e41218a882319da95e4a7b9dcd0826c1d33712a34d865667377632c","observation_id":"56667f6b-9cd5-43b1-9e61-0c3b7106d3b4","resolution":{"observed_at":"2026-08-02T10:02:41.468860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:02:41.578931Z","title":"An Empirical Study of","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16239","last_updated":"2026-06-26T00:31:00Z","snapshot_observed_at":"2026-08-20T08:19:41.088070Z","submitted_at":"2026-06-26T00:31:00Z","title":"BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-02T10:02:41.578931Z"},"links":{"citing_paper":"/paper/2607.16239"},"observation_digest":"sha256:b2917c3fabc19f6a54e47bb9ceab1506dacb369c8affa804d2cb25104e71383a","observation_id":"0d29f28c-c689-4eaf-b0bc-fbc72086e9f2","resolution":{"observed_at":"2026-08-02T10:02:41.578931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:02:41.705702Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16239","last_updated":"2026-06-26T00:31:00Z","snapshot_observed_at":"2026-08-20T08:19:41.088070Z","submitted_at":"2026-06-26T00:31:00Z","title":"BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-02T10:02:41.705702Z"},"links":{"citing_paper":"/paper/2607.16239"},"observation_digest":"sha256:4c05f01b45e8da73adf768d6757bcba09a4b5be370d71de02babf95e8f643f6d","observation_id":"cdda88e8-9cd7-4ac9-b8c0-4a668773beff","resolution":{"observed_at":"2026-08-02T10:02:41.705702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:02:41.865934Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16239","last_updated":"2026-06-26T00:31:00Z","snapshot_observed_at":"2026-08-20T08:19:41.088070Z","submitted_at":"2026-06-26T00:31:00Z","title":"BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-02T10:02:41.865934Z"},"links":{"citing_paper":"/paper/2607.16239"},"observation_digest":"sha256:52ab7120534165639268e80f4a5ccbc82efd166ff6dd0bdfb92e1f339160bf2f","observation_id":"686ec06d-b12d-4a78-8e43-70fb67392f8e","resolution":{"observed_at":"2026-08-02T10:02:41.865934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:02:41.986138Z","title":"The Computational Geometry Algorithms Library , subtitle =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16239","last_updated":"2026-06-26T00:31:00Z","snapshot_observed_at":"2026-08-20T08:19:41.088070Z","submitted_at":"2026-06-26T00:31:00Z","title":"BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-02T10:02:41.986138Z"},"links":{"citing_paper":"/paper/2607.16239"},"observation_digest":"sha256:2888f3e1fbd582f524c423ce0c613b5758add265e390ed005b7dc5d06d19a4a4","observation_id":"a34268e3-5feb-4ee4-ad66-b61e89733afe","resolution":{"observed_at":"2026-08-02T10:02:41.986138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:02:42.096787Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16239","last_updated":"2026-06-26T00:31:00Z","snapshot_observed_at":"2026-08-20T08:19:41.088070Z","submitted_at":"2026-06-26T00:31:00Z","title":"BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-02T10:02:42.096787Z"},"links":{"citing_paper":"/paper/2607.16239"},"observation_digest":"sha256:14363bac47f6c6bc048b780a1faf396a8ade13566287b38bb91b8b8cb5134976","observation_id":"50eef0ae-6985-40d2-9628-3cefc3253b21","resolution":{"observed_at":"2026-08-02T10:02:42.096787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T10:02:42.228482Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16239","last_updated":"2026-06-26T00:31:00Z","snapshot_observed_at":"2026-08-20T08:19:41.088070Z","submitted_at":"2026-06-26T00:31:00Z","title":"BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-02T10:02:42.228482Z"},"links":{"citing_paper":"/paper/2607.16239"},"observation_digest":"sha256:f5e2cb43488a924d1f77d12ad8e975d9e14cbab349030caa4499d88738916835","observation_id":"784d6f4c-fe0c-4d32-9625-955b616b58b4","resolution":{"observed_at":"2026-08-02T10:02:42.228482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.16239","last_updated":"2026-06-26T00:31:00Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-20T08:19:41.088070Z","submitted_at":"2026-06-26T00:31:00Z","title":"BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":51,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 0 inbound Pith citation observations for arXiv:2607.16239."}