{"as_of":"2026-08-10T01:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:00ae6bd3dbb8b87c72868f0cecc777b37efbf59407e4dd349ecb1b1daa262b4b","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":8,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":8,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:17:47.053105Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.15754","last_updated":"2024-02-24T08:01:32Z","snapshot_observed_at":"2026-07-06T17:34:53.153463Z","submitted_at":"2024-02-24T08:01:32Z","title":"HD-Eval: Aligning Large Language Model Evaluators Through Hierarchical Criteria Decomposition","version":1},"cited_work":{"arxiv_id":"2402.15754","doi":"10.48550/arxiv.2402.15754","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.15754","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HD - Eval : Aligning Large Language Model Evaluators Through Hierarchical Criteria Decomposition , February 2024","venue":"arXiv (Cornell University)","work_id":"18e668b5-0860-495a-94d0-654a7076aa08","year":2024},"citing_paper":{"arxiv_id":"2412.05579","last_updated":"2024-12-10T05:49:12Z","snapshot_observed_at":"2026-07-31T01:42:39.468673Z","submitted_at":"2024-12-07T08:07:24Z","title":"LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods","version":2},"reference_index":152,"source":"pdf_text","source_observed_at":"2026-05-11T23:08:34.312466Z"},"links":{"cited_paper":"/paper/2402.15754","citing_paper":"/paper/2412.05579"},"observation_digest":"sha256:563e5fb4bdfc31d00abdc5033b49416623222b77a1e60b28cd48ac63d55d9366","observation_id":"11e491a1-2bd6-455c-abe7-d4b56addf389","resolution":{"observed_at":"2026-05-11T23:08:37.341931Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T23:53:01.460548+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T23:53:01.460548+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15754","last_updated":"2024-02-24T08:01:32Z","snapshot_observed_at":"2026-07-06T17:34:53.153463Z","submitted_at":"2024-02-24T08:01:32Z","title":"HD-Eval: Aligning Large Language Model Evaluators Through Hierarchical Criteria Decomposition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15754","snapshot_observed_at":"2026-08-07T10:17:47.053105Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10019","last_updated":"2025-06-06T11:09:46Z","snapshot_observed_at":"2026-08-08T16:55:23.964977Z","submitted_at":"2025-06-06T11:09:46Z","title":"A Survey of Automatic Evaluation Methods on Text, Visual and Speech Generations","version":1},"reference_index":232,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:47.053105Z"},"links":{"cited_paper":"/paper/2402.15754","citing_paper":"/paper/2506.10019"},"observation_digest":"sha256:a4eadc3bcc0b157e85d8fa22adc92b7d23cd648077627123022b47c782684728","observation_id":"079f109e-1ebb-443b-b672-28b8b4f858e0","resolution":{"observed_at":"2026-08-07T10:17:47.053105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15754","last_updated":"2024-02-24T08:01:32Z","snapshot_observed_at":"2026-07-06T17:34:53.153463Z","submitted_at":"2024-02-24T08:01:32Z","title":"HD-Eval: Aligning Large Language Model Evaluators Through Hierarchical Criteria Decomposition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15754","snapshot_observed_at":"2026-08-07T04:39:07.186704Z","title":"arXiv preprint arXiv:2402.15754 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10146","last_updated":"2025-06-11T19:51:06Z","snapshot_observed_at":"2026-08-09T06:08:30.766282Z","submitted_at":"2025-06-11T19:51:06Z","title":"Balanced Hyperbolic Embeddings Are Natural Out-of-Distribution Detectors","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T04:39:07.186704Z"},"links":{"cited_paper":"/paper/2402.15754","citing_paper":"/paper/2506.10146"},"observation_digest":"sha256:dfa8dcfea67b64a59a292bacff3df467cbde56baeae16fc77ba3582cf411c569","observation_id":"38b7b8a5-fa1b-472f-83df-95981658ea5c","resolution":{"observed_at":"2026-08-07T04:39:07.186704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15754","last_updated":"2024-02-24T08:01:32Z","snapshot_observed_at":"2026-07-06T17:34:53.153463Z","submitted_at":"2024-02-24T08:01:32Z","title":"HD-Eval: Aligning Large Language Model Evaluators Through Hierarchical Criteria Decomposition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15754","snapshot_observed_at":"2026-08-04T12:44:15.092166Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.06242","last_updated":"2025-10-03T08:37:33Z","snapshot_observed_at":"2026-08-08T08:11:38.246634Z","submitted_at":"2025-10-03T08:37:33Z","title":"Transparent Reference-free Automated Evaluation of Open-Ended User Survey Responses","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T12:44:15.092166Z"},"links":{"cited_paper":"/paper/2402.15754","citing_paper":"/paper/2510.06242"},"observation_digest":"sha256:881b1ca466ae595f73dcb0ed0cf0ab1052f22519e22fbfc06993e7fdbc37935a","observation_id":"369c7027-b1ad-4fd9-98bb-0f23ec2edc62","resolution":{"observed_at":"2026-08-04T12:44:15.092166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15754","last_updated":"2024-02-24T08:01:32Z","snapshot_observed_at":"2026-07-06T17:34:53.153463Z","submitted_at":"2024-02-24T08:01:32Z","title":"HD-Eval: Aligning Large Language Model Evaluators Through Hierarchical Criteria Decomposition","version":1},"cited_work":{"arxiv_id":"2402.15754","doi":"10.48550/arxiv.2402.15754","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.15754","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HD - Eval : Aligning Large Language Model Evaluators Through Hierarchical Criteria Decomposition , February 2024","venue":"arXiv (Cornell University)","work_id":"18e668b5-0860-495a-94d0-654a7076aa08","year":2024},"citing_paper":{"arxiv_id":"2601.03013","last_updated":"2026-04-08T16:28:19Z","snapshot_observed_at":"2026-08-02T17:59:54.247831Z","submitted_at":"2026-01-06T13:37:50Z","title":"LLMs, You Can Evaluate It! Design of Multi-perspective Report Evaluation for Security Operation Centers","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-16T17:01:47.603706Z"},"links":{"cited_paper":"/paper/2402.15754","citing_paper":"/paper/2601.03013"},"observation_digest":"sha256:629ee34e1a2eee760e99f0b513f14a679f482f94e40c3589e5b942a295e2b057","observation_id":"874e96cb-6304-4471-93d0-70d302bc59ba","resolution":{"observed_at":"2026-05-16T17:03:08.140918Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T23:53:01.460548+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T23:53:01.460548+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15754","last_updated":"2024-02-24T08:01:32Z","snapshot_observed_at":"2026-07-06T17:34:53.153463Z","submitted_at":"2024-02-24T08:01:32Z","title":"HD-Eval: Aligning Large Language Model Evaluators Through Hierarchical Criteria Decomposition","version":1},"cited_work":{"arxiv_id":"2402.15754","doi":"10.48550/arxiv.2402.15754","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.15754","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HD - Eval : Aligning Large Language Model Evaluators Through Hierarchical Criteria Decomposition , February 2024","venue":"arXiv (Cornell University)","work_id":"18e668b5-0860-495a-94d0-654a7076aa08","year":2024},"citing_paper":{"arxiv_id":"2605.16615","last_updated":"2026-05-15T20:33:52Z","snapshot_observed_at":"2026-08-02T08:13:51.251374Z","submitted_at":"2026-05-15T20:33:52Z","title":"Learning What Evaluators Value: A Reliable Approach to Modeling Evaluator Preferences","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-20T20:04:53.983505Z"},"links":{"cited_paper":"/paper/2402.15754","citing_paper":"/paper/2605.16615"},"observation_digest":"sha256:d8dec6ca901de3c3a33f5848e37b50a6fe20ea5ff1fe8fdcb169617b9209b330","observation_id":"fc689107-5c00-4232-8359-19832d7ab9e6","resolution":{"observed_at":"2026-05-20T20:08:58.747674Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T23:53:01.460548+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T23:53:01.460548+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15754","last_updated":"2024-02-24T08:01:32Z","snapshot_observed_at":"2026-07-06T17:34:53.153463Z","submitted_at":"2024-02-24T08:01:32Z","title":"HD-Eval: Aligning Large Language Model Evaluators Through Hierarchical Criteria Decomposition","version":1},"cited_work":{"arxiv_id":"2402.15754","doi":"10.48550/arxiv.2402.15754","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.15754","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HD - Eval : Aligning Large Language Model Evaluators Through Hierarchical Criteria Decomposition , February 2024","venue":"arXiv (Cornell University)","work_id":"18e668b5-0860-495a-94d0-654a7076aa08","year":2024},"citing_paper":{"arxiv_id":"2605.16615","last_updated":"2026-05-15T20:33:52Z","snapshot_observed_at":"2026-08-02T08:13:51.251374Z","submitted_at":"2026-05-15T20:33:52Z","title":"Learning What Evaluators Value: A Reliable Approach to Modeling Evaluator Preferences","version":1},"reference_index":111,"source":"arxiv_source","source_observed_at":"2026-05-20T20:04:53.983505Z"},"links":{"cited_paper":"/paper/2402.15754","citing_paper":"/paper/2605.16615"},"observation_digest":"sha256:173e2a38c69cbb66db2bb26dc46fb822c306b2f72287d52680998106ec60f9ae","observation_id":"f9173bd3-91a0-434b-99ee-354f45b8bb77","resolution":{"observed_at":"2026-05-20T20:08:59.301022Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T23:53:01.460548+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T23:53:01.460548+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15754","last_updated":"2024-02-24T08:01:32Z","snapshot_observed_at":"2026-07-06T17:34:53.153463Z","submitted_at":"2024-02-24T08:01:32Z","title":"HD-Eval: Aligning Large Language Model Evaluators Through Hierarchical Criteria Decomposition","version":1},"cited_work":{"arxiv_id":"2402.15754","doi":"10.48550/arxiv.2402.15754","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.15754","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HD - Eval : Aligning Large Language Model Evaluators Through Hierarchical Criteria Decomposition , February 2024","venue":"arXiv (Cornell University)","work_id":"18e668b5-0860-495a-94d0-654a7076aa08","year":2024},"citing_paper":{"arxiv_id":"2606.07936","last_updated":"2026-06-09T12:36:24Z","snapshot_observed_at":"2026-08-07T22:03:51.528110Z","submitted_at":"2026-06-06T01:55:56Z","title":"Illusions of the Gold Standard: A Large-scale Analysis of Human Evaluation Protocols for Long-form Text Generation","version":2},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-06-27T20:20:08.996005Z"},"links":{"cited_paper":"/paper/2402.15754","citing_paper":"/paper/2606.07936"},"observation_digest":"sha256:23b94001c0b14f6878bca34be37542bc2da94d6dd82aea54d707e573b76110ff","observation_id":"b8eb6e69-c084-4c87-b914-610b0f4c24ba","resolution":{"observed_at":"2026-07-02T20:37:22.686429Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-23T23:53:01.460548+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T23:53:01.460548+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2402.15754/citation-record","integrity":"/paper/2402.15754/integrity","json":"/paper/2402.15754/citation-record.json","paper":"/paper/2402.15754"},"outbound":[],"paper":{"arxiv_id":"2402.15754","last_updated":"2024-02-24T08:01:32Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T17:34:53.153463Z","submitted_at":"2024-02-24T08:01:32Z","title":"HD-Eval: Aligning Large Language Model Evaluators Through Hierarchical Criteria Decomposition"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 8 inbound Pith citation observations for arXiv:2402.15754."}