{"as_of":"2026-08-18T05:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cf7bfc622373f41bed22075f83fc32f39838c6979b2fb80f111f1ad2a6d9bbc2","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":11,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":11,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T20:05:54.291216Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":3,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.13308","last_updated":"2023-09-23T08:46:11Z","snapshot_observed_at":"2026-08-17T23:11:59.469252Z","submitted_at":"2023-09-23T08:46:11Z","title":"Calibrating LLM-Based Evaluator","version":1},"cited_work":{"arxiv_id":"2309.13308","doi":"10.48550/arxiv.2309.13308","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.13308","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Calibrating llm-based evaluator","venue":"arXiv (Cornell University)","work_id":"5f9e8311-a01d-4c62-a69d-de002e890d8d","year":2023},"citing_paper":{"arxiv_id":"2410.09024","last_updated":"2025-04-18T14:30:31Z","snapshot_observed_at":"2026-08-16T05:17:43.289570Z","submitted_at":"2024-10-11T17:39:22Z","title":"AgentHarm: A Benchmark for Measuring Harmfulness of LLM Agents","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-14T01:35:50.992477Z"},"links":{"cited_paper":"/paper/2309.13308","citing_paper":"/paper/2410.09024"},"observation_digest":"sha256:9cc47adcc733b6611f8f791f4221ba94a22209134747dd1723e198622f56f9bb","observation_id":"e8c32b91-489c-43ac-b4fa-8f140d97ad27","resolution":{"observed_at":"2026-05-14T01:35:51.204544Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.13308","last_updated":"2023-09-23T08:46:11Z","snapshot_observed_at":"2026-08-17T23:11:59.469252Z","submitted_at":"2023-09-23T08:46:11Z","title":"Calibrating LLM-Based Evaluator","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.13308","snapshot_observed_at":"2026-08-12T20:05:54.291216Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10055","last_updated":"2024-11-15T09:17:40Z","snapshot_observed_at":"2026-08-15T13:58:27.304887Z","submitted_at":"2024-11-15T09:17:40Z","title":"Towards unearthing neglected climate innovations from scientific literature using Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T20:05:54.291216Z"},"links":{"cited_paper":"/paper/2309.13308","citing_paper":"/paper/2411.10055"},"observation_digest":"sha256:9c8d8dd54f01e6949e578c0c6bcbfcaecb1193daf2e981829ef00dea3f980d0e","observation_id":"2784833e-994f-4b3d-b42f-4c80756c79fb","resolution":{"observed_at":"2026-08-12T20:05:54.291216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.13308","last_updated":"2023-09-23T08:46:11Z","snapshot_observed_at":"2026-08-17T23:11:59.469252Z","submitted_at":"2023-09-23T08:46:11Z","title":"Calibrating LLM-Based Evaluator","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.13308","snapshot_observed_at":"2026-08-12T11:59:18.339313Z","title":"Calibrating llm-based evaluator,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17793","last_updated":"2024-11-26T17:43:32Z","snapshot_observed_at":"2026-08-15T22:06:40.141239Z","submitted_at":"2024-11-26T17:43:32Z","title":"Engineering AI Judge Systems","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T11:59:18.339313Z"},"links":{"cited_paper":"/paper/2309.13308","citing_paper":"/paper/2411.17793"},"observation_digest":"sha256:e6590fd94fc3f62fe6ce699da823eda364bd4d23097618dba9187f0f85fa6f85","observation_id":"a57f28fd-7676-4364-9c5f-b975c931315e","resolution":{"observed_at":"2026-08-12T11:59:18.339313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.13308","last_updated":"2023-09-23T08:46:11Z","snapshot_observed_at":"2026-08-17T23:11:59.469252Z","submitted_at":"2023-09-23T08:46:11Z","title":"Calibrating LLM-Based Evaluator","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.13308","snapshot_observed_at":"2026-08-12T11:15:44.970534Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18444","last_updated":"2024-11-27T15:35:32Z","snapshot_observed_at":"2026-08-15T01:23:17.995892Z","submitted_at":"2024-11-27T15:35:32Z","title":"Is my Meeting Summary Good? Estimating Quality with a Multi-LLM Evaluator","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-12T11:15:44.970534Z"},"links":{"cited_paper":"/paper/2309.13308","citing_paper":"/paper/2411.18444"},"observation_digest":"sha256:bcd46f0113ea2cf2bc161c64de153cb091ceacdb9ca9a5a94dc6b939e9b6f0a8","observation_id":"ff2cbbb3-7af3-4f8b-927d-6c210e994160","resolution":{"observed_at":"2026-08-12T11:15:44.970534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.13308","last_updated":"2023-09-23T08:46:11Z","snapshot_observed_at":"2026-08-17T23:11:59.469252Z","submitted_at":"2023-09-23T08:46:11Z","title":"Calibrating LLM-Based Evaluator","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.13308","snapshot_observed_at":"2026-08-11T20:37:54.919951Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05563","last_updated":"2025-07-01T22:08:39Z","snapshot_observed_at":"2026-08-16T14:41:18.143042Z","submitted_at":"2024-12-07T06:56:01Z","title":"A Survey on Uncertainty Quantification of Large Language Models: Taxonomy, Open Research Challenges, and Future Directions","version":2},"reference_index":133,"source":"pdf_text","source_observed_at":"2026-08-11T20:37:54.919951Z"},"links":{"cited_paper":"/paper/2309.13308","citing_paper":"/paper/2412.05563"},"observation_digest":"sha256:ddd1d463c74443afdd6bddf10c74c67f145683024e08fa9c065c7f33139e862d","observation_id":"4ecfa734-88d1-454a-9f7f-1d66f2b609a9","resolution":{"observed_at":"2026-08-11T20:37:54.919951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.13308","last_updated":"2023-09-23T08:46:11Z","snapshot_observed_at":"2026-08-17T23:11:59.469252Z","submitted_at":"2023-09-23T08:46:11Z","title":"Calibrating LLM-Based Evaluator","version":1},"cited_work":{"arxiv_id":"2309.13308","doi":"10.48550/arxiv.2309.13308","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.13308","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Calibrating llm-based evaluator","venue":"arXiv (Cornell University)","work_id":"5f9e8311-a01d-4c62-a69d-de002e890d8d","year":2023},"citing_paper":{"arxiv_id":"2412.05579","last_updated":"2024-12-10T05:49:12Z","snapshot_observed_at":"2026-08-17T10:18:05.650518Z","submitted_at":"2024-12-07T08:07:24Z","title":"LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods","version":2},"reference_index":151,"source":"pdf_text","source_observed_at":"2026-05-11T23:08:34.312466Z"},"links":{"cited_paper":"/paper/2309.13308","citing_paper":"/paper/2412.05579"},"observation_digest":"sha256:7bf03caabf08e04605215373f1db775dea2933ff0c0327cc8feffcf14f4edc96","observation_id":"d7b9ddb2-75e4-42d3-903a-7ffacf660847","resolution":{"observed_at":"2026-05-11T23:08:37.331051Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.13308","last_updated":"2023-09-23T08:46:11Z","snapshot_observed_at":"2026-08-17T23:11:59.469252Z","submitted_at":"2023-09-23T08:46:11Z","title":"Calibrating LLM-Based Evaluator","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.13308","snapshot_observed_at":"2026-08-08T22:36:35.260875Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04498","last_updated":"2025-02-06T20:57:36Z","snapshot_observed_at":"2026-08-13T05:00:36.654030Z","submitted_at":"2025-02-06T20:57:36Z","title":"Verifiable Format Control for Large Language Model Generations","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T22:36:35.260875Z"},"links":{"cited_paper":"/paper/2309.13308","citing_paper":"/paper/2502.04498"},"observation_digest":"sha256:7bd5f6c43c47ec5e607b37c12c04c9b4a709f70ed314e8002b0e8b99805cec10","observation_id":"90b2acb0-4145-43dc-98de-32ca74b6b5e4","resolution":{"observed_at":"2026-08-08T22:36:35.260875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.13308","last_updated":"2023-09-23T08:46:11Z","snapshot_observed_at":"2026-08-17T23:11:59.469252Z","submitted_at":"2023-09-23T08:46:11Z","title":"Calibrating LLM-Based Evaluator","version":1},"cited_work":{"arxiv_id":"2309.13308","doi":"10.48550/arxiv.2309.13308","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.13308","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Calibrating llm-based evaluator","venue":"arXiv (Cornell University)","work_id":"5f9e8311-a01d-4c62-a69d-de002e890d8d","year":2023},"citing_paper":{"arxiv_id":"2506.21582","last_updated":"2026-05-07T20:27:26Z","snapshot_observed_at":"2026-08-12T16:17:13.752430Z","submitted_at":"2025-06-17T05:24:58Z","title":"VIDEE: Visual and Interactive Decomposition, Execution, and Evaluation of Text Analytics with Intelligent Agents","version":5},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-19T09:36:50.323723Z"},"links":{"cited_paper":"/paper/2309.13308","citing_paper":"/paper/2506.21582"},"observation_digest":"sha256:e1f1c86686c60abf9c55ec743f4ce39b1cde7adc9f1e4f262522b98a748d7c8a","observation_id":"8a8ceceb-ed1b-4e88-874f-d08af2c85220","resolution":{"observed_at":"2026-05-19T09:37:13.894987Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.13308","last_updated":"2023-09-23T08:46:11Z","snapshot_observed_at":"2026-08-17T23:11:59.469252Z","submitted_at":"2023-09-23T08:46:11Z","title":"Calibrating LLM-Based Evaluator","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.13308","snapshot_observed_at":"2026-08-05T12:52:55.567886Z","title":"Calibrating llm-based evaluator, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01186","last_updated":"2025-09-01T07:10:22Z","snapshot_observed_at":"2026-08-14T02:05:34.014533Z","submitted_at":"2025-09-01T07:10:22Z","title":"Statutory Construction and Interpretation for Artificial Intelligence","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T12:52:55.567886Z"},"links":{"cited_paper":"/paper/2309.13308","citing_paper":"/paper/2509.01186"},"observation_digest":"sha256:7e6b278cdc48e8c4d8ce618e23136f4a0c1c415cc86e9a86f39193ef04dd1a44","observation_id":"5d5550e5-0e70-4a49-92f3-1286aa587f9c","resolution":{"observed_at":"2026-08-05T12:52:55.567886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.13308","last_updated":"2023-09-23T08:46:11Z","snapshot_observed_at":"2026-08-17T23:11:59.469252Z","submitted_at":"2023-09-23T08:46:11Z","title":"Calibrating LLM-Based Evaluator","version":1},"cited_work":{"arxiv_id":"2309.13308","doi":"10.48550/arxiv.2309.13308","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.13308","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Calibrating llm-based evaluator","venue":"arXiv (Cornell University)","work_id":"5f9e8311-a01d-4c62-a69d-de002e890d8d","year":2023},"citing_paper":{"arxiv_id":"2604.17200","last_updated":"2026-04-19T02:04:14Z","snapshot_observed_at":"2026-08-16T11:37:39.866059Z","submitted_at":"2026-04-19T02:04:14Z","title":"Calibrating Model-Based Evaluation Metrics for Summarization","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-10T06:36:55.334742Z"},"links":{"cited_paper":"/paper/2309.13308","citing_paper":"/paper/2604.17200"},"observation_digest":"sha256:49473d10021508e72df0a4caccfb4b89406c02d2b060855332818d75abc1a902","observation_id":"3e8a5565-b587-45dd-90df-fa8a37b56243","resolution":{"observed_at":"2026-05-10T06:41:36.954717Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.13308","last_updated":"2023-09-23T08:46:11Z","snapshot_observed_at":"2026-08-17T23:11:59.469252Z","submitted_at":"2023-09-23T08:46:11Z","title":"Calibrating LLM-Based Evaluator","version":1},"cited_work":{"arxiv_id":"2309.13308","doi":"10.48550/arxiv.2309.13308","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.13308","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Calibrating llm-based evaluator","venue":"arXiv (Cornell University)","work_id":"5f9e8311-a01d-4c62-a69d-de002e890d8d","year":2023},"citing_paper":{"arxiv_id":"2606.22329","last_updated":"2026-06-21T04:35:43Z","snapshot_observed_at":"2026-07-31T23:50:31.635694Z","submitted_at":"2026-06-21T04:35:43Z","title":"BabelJudge: Measuring LLM-as-a-Judge Reliability Across Languages and Agent Trajectories","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T11:06:07.303335Z"},"links":{"cited_paper":"/paper/2309.13308","citing_paper":"/paper/2606.22329"},"observation_digest":"sha256:1f672f0106c3fb80c670884aad64d397aa28eef254f5ff6b48aee630a317402b","observation_id":"3ae689bf-abfe-4479-937f-c253e9ab8569","resolution":{"observed_at":"2026-07-04T08:49:41.496695Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2309.13308/citation-record","integrity":"/paper/2309.13308/integrity","json":"/paper/2309.13308/citation-record.json","paper":"/paper/2309.13308"},"outbound":[],"paper":{"arxiv_id":"2309.13308","last_updated":"2023-09-23T08:46:11Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-17T23:11:59.469252Z","submitted_at":"2023-09-23T08:46:11Z","title":"Calibrating LLM-Based Evaluator"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 11 inbound Pith citation observations for arXiv:2309.13308."}