{"as_of":"2026-08-14T10:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:088f9b0c8986d8e197040bd8c2f81c0d9e9d5a8338623f4b4c1ecc8fd90370ed","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T20:45:46.434071Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.04997/citation-record","integrity":"/paper/2502.04997/integrity","json":"/paper/2502.04997/citation-record.json","paper":"/paper/2502.04997"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:46.245898Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-12T00:17:52.433683Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.245898Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:0244cd6d4ae33a491e456d39ee1f9adcedd6b535ac313a0d2813dde9268c7c5c","observation_id":"4483f975-684c-4823-a6f1-580ead32d782","resolution":{"observed_at":"2026-08-08T20:45:46.245898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:46.251217Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-12T00:17:52.433683Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.251217Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:26ac2154f0435381c132cb6a131dda6451c444e81c1f216715076394d9977a14","observation_id":"a1da4f4e-ef0a-4d90-8a36-63ef976f40ad","resolution":{"observed_at":"2026-08-08T20:45:46.251217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:47.135490Z","title":null,"venue":null,"work_id":"76055ff8-ccb7-4126-b735-8ca3e9438642","year":2022},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-12T00:17:52.433683Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.255883Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:7865602718fd38d25b1c1dc79b154468d846515e303867243046ee8ddc760793","observation_id":"93990ef9-6206-4c1d-9299-5ab10a4df999","resolution":{"observed_at":"2026-08-08T20:45:47.140190Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:47.122646Z","title":null,"venue":null,"work_id":"4c5da730-0671-4cb5-8538-ac05d1769550","year":2024},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-12T00:17:52.433683Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.260470Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:0023090895dea22e75ff25802996c989c21b69ec2a47cd5839a5b21d0c0f2bc0","observation_id":"0f59a00b-bb6a-4a42-b6cc-1335c515cae0","resolution":{"observed_at":"2026-08-08T20:45:47.126706Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18403","last_updated":"2025-06-02T11:31:19Z","snapshot_observed_at":"2026-08-12T23:34:25.129632Z","submitted_at":"2024-06-26T14:56:13Z","title":"LLMs instead of Human Judges? A Large Scale Empirical Study across 20 NLP Evaluation Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18403","snapshot_observed_at":"2026-08-08T20:45:46.264867Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-12T00:17:52.433683Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.264867Z"},"links":{"cited_paper":"/paper/2406.18403","citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:ad8ff1145cca2e589395b4eedef67dff0d267104e1a7909c6ccdd5de05211ed1","observation_id":"d9f24b30-7e2e-45d4-8b78-2e170cd8f140","resolution":{"observed_at":"2026-08-08T20:45:46.264867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-08T20:45:46.269564Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-12T00:17:52.433683Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.269564Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:366324a1cf2df00011898f40be6ce0fd16e9e3ccb300e0480212e62a0acd66ff","observation_id":"2e6a1d5a-7e15-4314-908e-6217626a7550","resolution":{"observed_at":"2026-08-08T20:45:46.269564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:47.109622Z","title":null,"venue":null,"work_id":"7614b1e9-2edd-4eee-898d-19a34c9246b0","year":2018},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-12T00:17:52.433683Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.274492Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:1071721b8586d2067169a00fbbc7065570ddc61f3912565d9b46e04b7975d5bd","observation_id":"d141ca34-f822-48da-8bea-8b7a98572119","resolution":{"observed_at":"2026-08-08T20:45:47.113710Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:46.278677Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-12T00:17:52.433683Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.278677Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:08d732573e1a75729a216f350491858abc94fb3c91984a41253cc3e8e57393f2","observation_id":"fbff8ad6-8164-4a0c-857f-3db836924bc3","resolution":{"observed_at":"2026-08-08T20:45:46.278677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-08T20:45:46.283385Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-12T00:17:52.433683Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.283385Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:b6914a29aa5bec5012d31d46f608c55b705711269233c2176d08a90c78d91d70","observation_id":"622ef66a-81aa-4255-bf52-020aafbd6f7a","resolution":{"observed_at":"2026-08-08T20:45:46.283385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:46.287833Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-12T00:17:52.433683Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.287833Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:d1eeb04e5c6f19bb1b82b833a63ae96e51e0888bcba8f2eaf01a4236bac89c10","observation_id":"90649c17-889e-47d0-b6c5-4760afbe896e","resolution":{"observed_at":"2026-08-08T20:45:46.287833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-08T20:45:46.292008Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-12T00:17:52.433683Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.292008Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:0c76cc917a590ba5be32f6270e81675594520a0996a8644fd9f8066394ff722d","observation_id":"254441ba-aa16-4be5-9dac-dd0bdcad13f0","resolution":{"observed_at":"2026-08-08T20:45:46.292008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:47.095193Z","title":"Clarke, Gianluca Demartini, Matthias Hagen, Claudia Hauff, Noriko Kando, Evangelos Kanoulas, Martin Potthast, Benno Stein, and Henning Wachsmuth","venue":null,"work_id":"cce32e23-ea24-497a-8016-fdacfa02095f","year":2023},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-12T00:17:52.433683Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.296642Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:839dd5d482a7e41005782f2de5a928f8496e5ebfcab07a51226269679ada314d","observation_id":"5aa9b96f-c02a-4d9e-a43a-ab4988b7f0ff","resolution":{"observed_at":"2026-08-08T20:45:47.100523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:46.300819Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-12T00:17:52.433683Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.300819Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:2edc3be137426d668a7d4d797b594b6fdbeac6014059b9deada1e7f6cb07b1f6","observation_id":"86ab0998-45d3-4b91-a598-1b287848c2a9","resolution":{"observed_at":"2026-08-08T20:45:46.300819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:46.304959Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-12T00:17:52.433683Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.304959Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:cffc34b040bc91cbee69c829a1bc10b43ce93981533e6b42c6b590a30fdfc4a0","observation_id":"cf4e09c5-8204-4563-add3-4cc4a5f5c0bb","resolution":{"observed_at":"2026-08-08T20:45:46.304959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:47.081431Z","title":null,"venue":null,"work_id":"edbcb404-68c7-4489-a96d-834fd72e17a5","year":2023},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-12T00:17:52.433683Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.309139Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:ff52e9f6a14b8d947e386f808c02db2fa83514523825eb1ce4216cdd5b1613e5","observation_id":"99d68814-44f6-464a-aeb0-a2aff91eade3","resolution":{"observed_at":"2026-08-08T20:45:47.085821Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:46.313150Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-12T00:17:52.433683Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.313150Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:9cc8f6a1debf23e2ae76cb894b0bd95bdff1aa9810220e5a3a44e2676feac78e","observation_id":"f06b3004-d2b2-4e73-8dd0-1c7123850d1a","resolution":{"observed_at":"2026-08-08T20:45:46.313150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:46.317112Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-12T00:17:52.433683Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.317112Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:93b8680f8f40eeb89dc5a6168ea8a340a8f3085506d46895eca7165ba66c0b60","observation_id":"a71a05ad-45d4-480d-9d0d-c68b76c11208","resolution":{"observed_at":"2026-08-08T20:45:46.317112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:47.058352Z","title":null,"venue":null,"work_id":"c77289ae-858f-4504-8c05-611e50799797","year":2024},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-12T00:17:52.433683Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.321106Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:90198541bc0a336856e2dfcb86899092e7960d3c89a1fb2baa858736c222c5f8","observation_id":"82745105-bcef-4e67-97a7-f12fc685acbb","resolution":{"observed_at":"2026-08-08T20:45:47.062614Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:47.045348Z","title":null,"venue":null,"work_id":"92c68fd5-a82b-4787-ac1c-8764c772dde2","year":2023},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-12T00:17:52.433683Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.325123Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:0fc5f832f9675f5d39539e89fd57f1d282f2ea8cecdd269459172dfe028bbde3","observation_id":"a338e2ff-0fb5-421f-8db3-b07b930aa97e","resolution":{"observed_at":"2026-08-08T20:45:47.049538Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:47.031993Z","title":null,"venue":null,"work_id":"39e35596-5b58-45b4-b0f3-50a04f3ba811","year":1970},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-12T00:17:52.433683Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.329412Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:94ce34d70c4a27304bd2b6d3643f408c4859adfdf94f5ef60a3566423650af8d","observation_id":"82cff5a0-1a12-4155-b359-df1a249e99cb","resolution":{"observed_at":"2026-08-08T20:45:47.036428Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:47.018238Z","title":null,"venue":null,"work_id":"dcb4c23f-9243-4258-be78-a7501e029961","year":2024},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-12T00:17:52.433683Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.333419Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:d25e771dbd7d4323420eea5eb2b462139639bcb05b9977c95a294f223a21338b","observation_id":"f4dff6d2-90ac-417d-aac5-4378cb9e6f98","resolution":{"observed_at":"2026-08-08T20:45:47.022738Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:46.337470Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-12T00:17:52.433683Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.337470Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:d64a220bf74f9d40ef2f5722d1fb02b9d741060c7bd6696f668f191e81755c9a","observation_id":"d8cd5b4c-db56-4737-9dd3-7c9460c3acd8","resolution":{"observed_at":"2026-08-08T20:45:46.337470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:47.004238Z","title":"Jackson and Samuel Messick","venue":null,"work_id":"94bad356-eefc-4edc-8b50-169e7fc3accb","year":1958},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-12T00:17:52.433683Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.341626Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:07b84bc626204823a6a2889954a7e625c15bcc714bc489aa1a0606dc213fbb8d","observation_id":"52fe548e-7fff-4ad9-8c59-fea8efc72f2b","resolution":{"observed_at":"2026-08-08T20:45:47.008645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-13T19:43:49.936776Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-08T20:45:46.345893Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-12T00:17:52.433683Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.345893Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:b5005acadf47779451e8768412e60cf3abcd02a2ff61edc1ba90d06671b3ab5a","observation_id":"f3fca404-8e47-4d62-b12a-8392ce254678","resolution":{"observed_at":"2026-08-08T20:45:46.345893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:46.350732Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-12T00:17:52.433683Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.350732Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:e26b7e200a881b4a84a58a2fc1ea472a6db13758f6d910031904dc9ba5e7bcd2","observation_id":"a1919819-2f27-428a-8ac0-b4e7979c6ef1","resolution":{"observed_at":"2026-08-08T20:45:46.350732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:46.354777Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-12T00:17:52.433683Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.354777Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:b1f785bfbc725f1fa8159dd4e4c1b99178afff470f13f045ad736bd89f8ce8fb","observation_id":"3feaad36-890d-4b79-ba74-fe87121fbcc3","resolution":{"observed_at":"2026-08-08T20:45:46.354777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.03025","last_updated":"2022-04-06T18:17:09Z","snapshot_observed_at":"2026-08-13T16:07:24.431015Z","submitted_at":"2022-04-06T18:17:09Z","title":"Using Interactive Feedback to Improve the Accuracy and Explainability of Question Answering Systems Post-Deployment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.03025","snapshot_observed_at":"2026-08-08T20:45:46.358882Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-12T00:17:52.433683Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.358882Z"},"links":{"cited_paper":"/paper/2204.03025","citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:3bbf1a904b95b1531edaa1b8edf3e2a83b24510cc350417940785196e2f4a850","observation_id":"388a265d-6e1e-4e32-98a7-d39cfb7941f4","resolution":{"observed_at":"2026-08-08T20:45:46.358882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:46.364356Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-12T00:17:52.433683Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.364356Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:8347eb95810b9b28d8dab63cf8aa5611d31e060adb3985cee77269c66be3dec5","observation_id":"35cb33a1-32a8-4b63-bb6c-cd9e976f61eb","resolution":{"observed_at":"2026-08-08T20:45:46.364356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:46.982113Z","title":null,"venue":null,"work_id":"d83a9c58-0e70-4539-a968-158583dd97cb","year":2023},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-12T00:17:52.433683Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.368610Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:2d7bd45d0420e7079191f156813b68f1164a5645b44e3b39161102e369d212ef","observation_id":"12311ef5-463a-4ee5-bac2-c3cc8ca55ef1","resolution":{"observed_at":"2026-08-08T20:45:46.986303Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/b978-0-12-590241-0.50006-x","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":"Elsevier eBooks","work_id":"c6a6f26a-5105-4408-a8ad-8061e70904ba","year":1991},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-12T00:17:52.433683Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.372947Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:f2984657f0566c3e23d1c5bfa4294494effe29fc3149cd69b3898ae99e5e7839","observation_id":"cdd79145-d381-4534-806d-679522d6871b","resolution":{"observed_at":"2026-08-08T20:45:46.503759Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:46.968891Z","title":null,"venue":null,"work_id":"a2f6e5f9-4496-4cdc-964d-e7deb3641417","year":2024},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-12T00:17:52.433683Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.377307Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:2c7700d57c6771773d0d03eba5186eda3ee5885b84c5f6b62c0061b997135df3","observation_id":"05435747-f404-4008-a800-993c5aaf28ba","resolution":{"observed_at":"2026-08-08T20:45:46.973000Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:46.381451Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-12T00:17:52.433683Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.381451Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:bd282515e728eee3434eb29416cb3edafd8b69f3f9bf4c3dc7fb8d5cf6be7f80","observation_id":"eedd96ea-abe7-4b26-8ace-32fac4e5a6fd","resolution":{"observed_at":"2026-08-08T20:45:46.381451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s11336-015-9458-9","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Schoonees, Michel Van de Velden, and Patrick J","venue":"Psychometrika","work_id":"058406cb-02a6-4911-b0e7-3c2b89293a42","year":2015},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-12T00:17:52.433683Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.385722Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:c51c42c98223e3140913e5bab1777ec3cb773ca13570595b7ede05e0ec9d3805","observation_id":"86c3da3e-3219-4f24-99df-5cbc9e41eda6","resolution":{"observed_at":"2026-08-08T20:45:46.480160Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:46.389924Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-12T00:17:52.433683Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.389924Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:2d756ccf38e45650b42eee0b2931bab7282ef09e4d4aec31451b7f9f0f4b528b","observation_id":"1c9658af-d635-4474-8a35-a7f2fb7d51a3","resolution":{"observed_at":"2026-08-08T20:45:46.389924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06588","last_updated":"2023-04-13T14:51:40Z","snapshot_observed_at":"2026-08-14T06:42:17.710063Z","submitted_at":"2023-04-13T14:51:40Z","title":"ChatGPT-4 Outperforms Experts and Crowd Workers in Annotating Political Twitter Messages with Zero-Shot Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06588","snapshot_observed_at":"2026-08-08T20:45:46.394502Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-12T00:17:52.433683Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.394502Z"},"links":{"cited_paper":"/paper/2304.06588","citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:bf35413ae5ea6e0671f1587970f43535faac154c2430eaebc8689e3b8db62fd3","observation_id":"10260a13-2b83-484f-a1f7-109376bdedc8","resolution":{"observed_at":"2026-08-08T20:45:46.394502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"stable/2061896","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:46.795110Z","title":null,"venue":null,"work_id":"dd5ec9e0-40ad-4a66-bd62-284d7cec5b73","year":2010},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-12T00:17:52.433683Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.399414Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:76cf96f9c366f0a1d062fff47186bc1fba01c2d552a0842a632d44d1892a018f","observation_id":"70b19d40-96e2-4285-b35c-c635bd64dbc0","resolution":{"observed_at":"2026-08-08T20:45:46.803135Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18796","last_updated":"2024-05-01T15:37:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-29T15:33:23Z","title":"Replacing Judges with Juries: Evaluating LLM Generations with a Panel of Diverse Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18796","snapshot_observed_at":"2026-08-08T20:45:46.404348Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-12T00:17:52.433683Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.404348Z"},"links":{"cited_paper":"/paper/2404.18796","citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:9810f386c2d5535cfbe1ab56253fbe62719b771541c60abeeccb493034c7f73e","observation_id":"e4d132d8-f832-42b3-a66b-1aa75b111845","resolution":{"observed_at":"2026-08-08T20:45:46.404348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17926","last_updated":"2023-08-30T13:22:35Z","snapshot_observed_at":"2026-08-14T09:51:03.197404Z","submitted_at":"2023-05-29T07:41:03Z","title":"Large Language Models are not Fair Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17926","snapshot_observed_at":"2026-08-08T20:45:46.408949Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-12T00:17:52.433683Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.408949Z"},"links":{"cited_paper":"/paper/2305.17926","citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:f47bf30c310ce12a6a88817b75985d3693ef0f0c3dff31f1a6bae20d47905b68","observation_id":"096b69a6-1795-4ca5-990c-0896087c9502","resolution":{"observed_at":"2026-08-08T20:45:46.408949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03025","last_updated":"2023-11-12T06:25:32Z","snapshot_observed_at":"2026-08-13T20:16:44.835319Z","submitted_at":"2023-07-06T14:42:01Z","title":"Style Over Substance: Evaluation Biases for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03025","snapshot_observed_at":"2026-08-08T20:45:46.413279Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-12T00:17:52.433683Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.413279Z"},"links":{"cited_paper":"/paper/2307.03025","citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:60564058a7d3ce174fcd0e01a413dd5566c329a87f829902ae05f052fa6327c3","observation_id":"ac8ee51a-41a3-4b1b-87e6-4d869c392b52","resolution":{"observed_at":"2026-08-08T20:45:46.413279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:46.417726Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-12T00:17:52.433683Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.417726Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:28ad6f7d0c8d054042c09190db33211002887a1b3d0ebf9cb3e57df1896eeed2","observation_id":"ad7cfba8-1b75-4f1e-ae68-23e7c00c00c7","resolution":{"observed_at":"2026-08-08T20:45:46.417726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:46.947263Z","title":null,"venue":null,"work_id":"aa81ea29-68f6-4caa-8540-327a58c8488c","year":2021},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-12T00:17:52.433683Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.421751Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:32352b63f5b717904017a257f9530309c84d30385d015974352ba0ca5f5e0a2a","observation_id":"bb051c28-8f83-4cc8-91e0-e0f03f417a23","resolution":{"observed_at":"2026-08-08T20:45:46.951570Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:46.933939Z","title":null,"venue":null,"work_id":"fc80eb2d-2db9-4b96-aa1b-0346822d9b6c","year":2023},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-12T00:17:52.433683Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.425747Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:f4ee750b773bff67b437f7a03ce3a333a74d8368d7f25bf84b78ec8d262e99e6","observation_id":"23dc06c6-6fbc-4fc7-b80f-0b99b109b789","resolution":{"observed_at":"2026-08-08T20:45:46.938246Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:46.920884Z","title":null,"venue":null,"work_id":"2fbe7fe7-7191-4c78-b1c0-8930dcb5c5ff","year":2023},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-12T00:17:52.433683Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.429744Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:30e4d82620977cde8b60eb03b3163d4a95cc0ade7d1cc668770dfbc78ee198eb","observation_id":"2566f1ff-3245-4fa0-a4d9-18fb10246fed","resolution":{"observed_at":"2026-08-08T20:45:46.925107Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:46.907651Z","title":null,"venue":null,"work_id":"199b1f5d-e3fc-4584-91d5-5f156fee0ff2","year":2024},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-12T00:17:52.433683Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.434071Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:fcca2e18b67ca1342600abf9aae8073b23a0322992d135ac6a5902c5b0bf1373","observation_id":"9632e177-9f44-490e-ad70-27ea20562360","resolution":{"observed_at":"2026-08-08T20:45:46.911916Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-12T00:17:52.433683Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":3,"verified_fuzzy":2},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2502.04997."}