{"as_of":"2026-08-09T16:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d5f6a69b15237b7ec7e745d111fdeb7c79d8c1331ac8463148642cf4f55f5651","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":28,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T05:35:36.355786Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T08:49:41.498619Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":"2310.19736","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-07-04T08:49:41.498619Z","title":"Evaluating large language models: A comprehensive survey","venue":null,"work_id":"1b7a504a-b89c-45ab-a187-59f93ae19f6f","year":2023},"citing_paper":{"arxiv_id":"2404.13501","last_updated":"2024-04-21T01:49:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-21T01:49:46Z","title":"A Survey on the Memory Mechanism of Large Language Model based Agents","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-15T07:21:39.440092Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2404.13501"},"observation_digest":"sha256:3d064952abe8180d2d9658178da6a7c1c06c910ae9d935e5d25d1bc64a807410","observation_id":"f25dd113-06c5-482c-85d7-af39db2e81b7","resolution":{"observed_at":"2026-05-15T07:21:39.777329Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":"2310.19736","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-07-04T08:49:41.498619Z","title":"Evaluating large language models: A comprehensive survey","venue":null,"work_id":"1b7a504a-b89c-45ab-a187-59f93ae19f6f","year":2023},"citing_paper":{"arxiv_id":"2412.05579","last_updated":"2024-12-10T05:49:12Z","snapshot_observed_at":"2026-07-31T01:42:39.468673Z","submitted_at":"2024-12-07T08:07:24Z","title":"LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-11T23:08:34.312466Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2412.05579"},"observation_digest":"sha256:b2f9eb67f67049dfb78c9786c444d297723325faea401769cf7c732416590276","observation_id":"9e34b787-346b-4e4c-b9b9-2ffb293d6fa7","resolution":{"observed_at":"2026-05-11T23:08:36.614193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":"2310.19736","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-07-04T08:49:41.498619Z","title":"Evaluating large language models: A comprehensive survey","venue":null,"work_id":"1b7a504a-b89c-45ab-a187-59f93ae19f6f","year":2023},"citing_paper":{"arxiv_id":"2501.09775","last_updated":"2026-05-03T15:15:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T10:27:51Z","title":"Multiple Choice Questions: Reasoning Makes Large Language Models (LLMs) More Self-Confident, Especially When They are Wrong","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-23T05:37:22.955895Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2501.09775"},"observation_digest":"sha256:d60dba238c8375f3bf894eefce5a0b09d945db2d67c3a5bc2ea879495a5c0b7a","observation_id":"c5cee3cf-8b6c-408a-bb3a-5ad66676cb23","resolution":{"observed_at":"2026-05-23T05:37:36.032998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-08-08T05:35:36.355786Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08333","last_updated":"2025-02-12T11:57:11Z","snapshot_observed_at":"2026-08-08T05:29:34.567357Z","submitted_at":"2025-02-12T11:57:11Z","title":"Foundation Models in Computational Pathology: A Review of Challenges, Opportunities, and Impact","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-08T05:35:36.355786Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2502.08333"},"observation_digest":"sha256:bb7408552ab63e58769fbc2eddc25413bfa4bf8af0955bbdb7ecc49c139b0a61","observation_id":"a24a0a9f-4ac6-4fea-9d7a-f8c312a689e8","resolution":{"observed_at":"2026-08-08T05:35:36.355786Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-08-07T23:35:42.695574Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.695574Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:f2fffc478ae33f575c5efa7b0716d6624e81b560e70e9217b9d71467628c6ad5","observation_id":"c49507bc-c841-4861-a8c9-d433c0f1f365","resolution":{"observed_at":"2026-08-07T23:35:42.695574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-08-07T14:35:03.725406Z","title":", Jin, R","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18464","last_updated":"2025-05-24T02:07:32Z","snapshot_observed_at":"2026-08-07T18:04:52.579875Z","submitted_at":"2025-05-24T02:07:32Z","title":"From Reddit to Generative AI: Evaluating Large Language Models for Anxiety Support Fine-tuned on Social Media Data","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T14:35:03.725406Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2505.18464"},"observation_digest":"sha256:2280c5b403ec108ac7bb5dbd5ab1ab940ed64b0fb39c18e7bc7e132bdb269441","observation_id":"06f07d09-4a10-4598-9100-985f02458367","resolution":{"observed_at":"2026-08-07T14:35:03.725406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-08-07T11:36:09.124209Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-07T12:17:10.730587Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:09.124209Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2506.01793"},"observation_digest":"sha256:95fabcbfa5868c32724f754f57c2ec800eb866993cfd8110f63832a9d601404a","observation_id":"8b0f499c-efa2-4a89-b27c-39659bdb72cf","resolution":{"observed_at":"2026-08-07T11:36:09.124209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-08-07T10:54:26.263848Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04142","last_updated":"2025-06-04T16:33:44Z","snapshot_observed_at":"2026-08-07T21:43:19.257599Z","submitted_at":"2025-06-04T16:33:44Z","title":"Establishing Trustworthy LLM Evaluation via Shortcut Neuron Analysis","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:26.263848Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2506.04142"},"observation_digest":"sha256:9ebe699fe2de94bc7c8355a807217f5115bf50f47acc0a3b3b1c9d3ae18f781f","observation_id":"ae2a5157-fa04-47d9-af21-e7a9e5c61a1a","resolution":{"observed_at":"2026-08-07T10:54:26.263848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-08-07T10:17:26.624960Z","title":"Evaluating large language models: A comprehensive survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.624960Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:374c088f9624fdc44f85b8bd7e7c97b8e91a230181bacd2d01a1d1a4ef706a38","observation_id":"d8a0c089-0661-4617-a4b5-db7137f29cea","resolution":{"observed_at":"2026-08-07T10:17:26.624960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-08-07T06:00:16.603597Z","title":"Evaluating large language models: A comprehensive survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11102","last_updated":"2025-06-06T17:52:18Z","snapshot_observed_at":"2026-08-07T05:54:56.593167Z","submitted_at":"2025-06-06T17:52:18Z","title":"Evolutionary Perspectives on the Evaluation of LLM-Based AI Agents: A Comprehensive Survey","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T06:00:16.603597Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2506.11102"},"observation_digest":"sha256:8b20b0cd20b0db2917186434b6ce75ae9e354c5038800b5d9b64a3c2b901b093","observation_id":"a6a852ba-7372-4622-9b0c-2306905712da","resolution":{"observed_at":"2026-08-07T06:00:16.603597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-08-06T23:20:18.098093Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-09T05:11:24.858564Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:18.098093Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:b169adca9a593ff5e69268cc02d9a030ff740ad55d9f8052ed526c548ee754d0","observation_id":"b0f66b31-b1ae-4858-8d25-f3f518ecbbc3","resolution":{"observed_at":"2026-08-06T23:20:18.098093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-08-07T12:41:39.388006Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22439","last_updated":"2025-05-29T20:56:48Z","snapshot_observed_at":"2026-08-07T12:35:44.372305Z","submitted_at":"2025-05-29T20:56:48Z","title":"Psycholinguistic Word Features: a New Approach for the Evaluation of LLMs Alignment with Humans","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T12:41:39.388006Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2506.22439"},"observation_digest":"sha256:525bac89a87643ea8d20f55c3b7feef60dec5d996cc93c264c1359dfe60868fc","observation_id":"f3488155-84cf-43bb-8959-c2b068c75164","resolution":{"observed_at":"2026-08-07T12:41:39.388006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-08-06T21:36:31.666043Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23762","last_updated":"2025-06-30T12:09:29Z","snapshot_observed_at":"2026-08-06T21:29:49.550137Z","submitted_at":"2025-06-30T12:09:29Z","title":"Software Engineering for Large Language Models: Research Status, Challenges and the Road Ahead","version":1},"reference_index":110,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:31.666043Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2506.23762"},"observation_digest":"sha256:e3d6376805bc2c8c1b32f38be075ca7d1545ed9cc0eadb2a517b4e79670dc1e3","observation_id":"360b283c-c81c-4884-a279-da2d7e445a4c","resolution":{"observed_at":"2026-08-06T21:36:31.666043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-08-06T21:43:34.962660Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05266","last_updated":"2025-06-30T06:14:32Z","snapshot_observed_at":"2026-08-06T21:36:14.853232Z","submitted_at":"2025-06-30T06:14:32Z","title":"User Behavior Prediction as a Generic, Robust, Scalable, and Low-Cost Evaluation Strategy for Estimating Generalization in LLMs","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T21:43:34.962660Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2507.05266"},"observation_digest":"sha256:38a340ab433f3c38ef86ac90cacfc9f9dd4f0b34ca7d72b18a487077943f79fa","observation_id":"528253e7-3801-47df-a54b-7e0035840e8d","resolution":{"observed_at":"2026-08-06T21:43:34.962660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-08-06T19:20:16.530237Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05965","last_updated":"2025-07-08T13:19:00Z","snapshot_observed_at":"2026-08-08T21:20:33.389224Z","submitted_at":"2025-07-08T13:19:00Z","title":"OpenFActScore: Open-Source Atomic Evaluation of Factuality in Text Generation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T19:20:16.530237Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2507.05965"},"observation_digest":"sha256:f3e0998d6f0cdc971f491764166ac22e4bd74cd311b8fe389eb3fe875f86a515","observation_id":"5be48bf6-ad10-44dc-9d1a-6adb070acf96","resolution":{"observed_at":"2026-08-06T19:20:16.530237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-08-06T14:58:57.803410Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17178","last_updated":"2025-08-29T06:52:20Z","snapshot_observed_at":"2026-08-07T04:04:05.944205Z","submitted_at":"2025-07-23T03:52:24Z","title":"SKA-Bench: A Fine-Grained Benchmark for Evaluating Structured Knowledge Understanding of LLMs","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T14:58:57.803410Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2507.17178"},"observation_digest":"sha256:987836632e58330f6dcfe8f5fe6536f2bfd281caefa996125966cc74abcd03f6","observation_id":"c4bcdf86-1881-40d4-9496-8652eec1d50a","resolution":{"observed_at":"2026-08-06T14:58:57.803410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-08-05T17:59:24.676630Z","title":"Evaluating Large Language Models: A Comprehensive Survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16678","last_updated":"2025-08-21T09:19:08Z","snapshot_observed_at":"2026-08-09T14:27:16.522120Z","submitted_at":"2025-08-21T09:19:08Z","title":"Cognitive Agents Powered by Large Language Models for Agile Software Project Management","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T17:59:24.676630Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2508.16678"},"observation_digest":"sha256:5d147eb54f5a63dd90b8e79e8c84e736906d224cb5c577ba03f6a2c54f1816f7","observation_id":"1187c08b-4c1b-4e7e-bd62-b098dec4c48b","resolution":{"observed_at":"2026-08-05T17:59:24.676630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-08-05T15:44:14.813109Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19598","last_updated":"2025-08-27T06:19:50Z","snapshot_observed_at":"2026-08-05T15:44:13.449330Z","submitted_at":"2025-08-27T06:19:50Z","title":"Encouraging Good Processes Without the Need for Good Answers: Reinforcement Learning for LLM Agent Planning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T15:44:14.813109Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2508.19598"},"observation_digest":"sha256:19cb652640954b92618d677fe65013da16e13bcfef9b3c788182874dbc8f51b9","observation_id":"ae6c1ce3-75fb-492e-a33a-e27906e55ab4","resolution":{"observed_at":"2026-08-05T15:44:14.813109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":"2310.19736","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-07-04T08:49:41.498619Z","title":"Evaluating large language models: A comprehensive survey","venue":null,"work_id":"1b7a504a-b89c-45ab-a187-59f93ae19f6f","year":2023},"citing_paper":{"arxiv_id":"2602.17170","last_updated":"2026-04-27T13:58:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-19T08:37:21Z","title":"When LLM Judges Inflate Scores: Exploring Overrating in Relevance Assessment","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T21:09:29.669360Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2602.17170"},"observation_digest":"sha256:893fba139b921d5e315b76fee2e9eb7808bf428b076246af0f9921604b893aba","observation_id":"7bf470c6-62b3-40cb-8c0c-45de6b616bc7","resolution":{"observed_at":"2026-05-15T21:10:18.500779Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":"2310.19736","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-07-04T08:49:41.498619Z","title":"Evaluating large language models: A comprehensive survey","venue":null,"work_id":"1b7a504a-b89c-45ab-a187-59f93ae19f6f","year":2023},"citing_paper":{"arxiv_id":"2605.07883","last_updated":"2026-05-08T15:33:54Z","snapshot_observed_at":"2026-07-06T23:20:11.042952Z","submitted_at":"2026-05-08T15:33:54Z","title":"Beyond \"I cannot fulfill this request\": Alleviating Rigid Rejection in LLMs via Label Enhancement","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-11T01:53:10.245859Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2605.07883"},"observation_digest":"sha256:b93620917234a0efbcacb9bec622faab8dd2383da54893825a36562efc965826","observation_id":"9877ca53-ae81-4513-ad56-8ba2ef3c504e","resolution":{"observed_at":"2026-05-11T04:15:55.758821Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":"2310.19736","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-07-04T08:49:41.498619Z","title":"Evaluating large language models: A comprehensive survey","venue":null,"work_id":"1b7a504a-b89c-45ab-a187-59f93ae19f6f","year":2023},"citing_paper":{"arxiv_id":"2605.10851","last_updated":"2026-05-11T17:00:18Z","snapshot_observed_at":"2026-08-03T03:33:06.244554Z","submitted_at":"2026-05-11T17:00:18Z","title":"The Generalized Turing Test: A Foundation for Comparing Intelligence","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-12T03:25:48.145137Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2605.10851"},"observation_digest":"sha256:b69b2a360245692d2d9884b13cfc4cb7bc18a27c4ec3a7754e90ca5bac9fbdda","observation_id":"aa005585-e4db-472f-8abe-51cfaac554ca","resolution":{"observed_at":"2026-05-12T03:26:18.923707Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":"2310.19736","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-07-04T08:49:41.498619Z","title":"Evaluating large language models: A comprehensive survey","venue":null,"work_id":"1b7a504a-b89c-45ab-a187-59f93ae19f6f","year":2023},"citing_paper":{"arxiv_id":"2605.12055","last_updated":"2026-05-14T07:07:27Z","snapshot_observed_at":"2026-07-31T12:10:28.537993Z","submitted_at":"2026-05-12T12:37:06Z","title":"Do Language Models Encode Knowledge of Linguistic Constraint Violations?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T06:24:16.157548Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2605.12055"},"observation_digest":"sha256:dba42a46c884cc24a2a16fe9e2946b556961bf22c9358f1ac32078e3eb1cf810","observation_id":"aebc6e71-8859-4a49-bc08-35f047881fe5","resolution":{"observed_at":"2026-05-13T06:27:24.749420Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":"2310.19736","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-07-04T08:49:41.498619Z","title":"Evaluating large language models: A comprehensive survey","venue":null,"work_id":"1b7a504a-b89c-45ab-a187-59f93ae19f6f","year":2023},"citing_paper":{"arxiv_id":"2605.12055","last_updated":"2026-05-14T07:07:27Z","snapshot_observed_at":"2026-07-31T12:10:28.537993Z","submitted_at":"2026-05-12T12:37:06Z","title":"Do Language Models Encode Knowledge of Linguistic Constraint Violations?","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T05:44:52.491280Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2605.12055"},"observation_digest":"sha256:9cf71db6505b91c345e2759542c0ff93a02b49f75d179275be43cdeaf048cae5","observation_id":"dc48d998-456e-4a0f-8bf0-7edb31d9a7e4","resolution":{"observed_at":"2026-05-15T05:45:05.695669Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":"2310.19736","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-07-04T08:49:41.498619Z","title":"Evaluating large language models: A comprehensive survey","venue":null,"work_id":"1b7a504a-b89c-45ab-a187-59f93ae19f6f","year":2023},"citing_paper":{"arxiv_id":"2605.15761","last_updated":"2026-05-15T09:21:33Z","snapshot_observed_at":"2026-07-06T23:27:01.213106Z","submitted_at":"2026-05-15T09:21:33Z","title":"A Unified Perturbation Framework for Analyzing Leaderboard Stability and Manipulation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-20T21:26:13.698051Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2605.15761"},"observation_digest":"sha256:b10ab29dfe8d008ff251647f1e74f1df676b614681d28fcd14dc10ce5b239bd9","observation_id":"ea682319-30d1-4e82-9876-74b6fad82272","resolution":{"observed_at":"2026-05-20T21:29:03.254380Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":"2310.19736","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-07-04T08:49:41.498619Z","title":"Evaluating large language models: A comprehensive survey","venue":null,"work_id":"1b7a504a-b89c-45ab-a187-59f93ae19f6f","year":2023},"citing_paper":{"arxiv_id":"2606.21939","last_updated":"2026-06-20T08:15:41Z","snapshot_observed_at":"2026-08-05T14:43:01.168641Z","submitted_at":"2026-06-20T08:15:41Z","title":"Beyond Value Benchmarks: Measuring Value-Structure Alignment in Large Language Models via Symmetric Q-Sorts","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-06-26T12:13:12.018506Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2606.21939"},"observation_digest":"sha256:4d7794f718c999ae5853af771ff5abb51dc98d9d766ce11cf77e59b3324c25a3","observation_id":"111567ad-3fca-4fe1-a757-df8f0a1fddfe","resolution":{"observed_at":"2026-07-04T08:09:40.882307Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":"2310.19736","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-07-04T08:49:41.498619Z","title":"Evaluating large language models: A comprehensive survey","venue":null,"work_id":"1b7a504a-b89c-45ab-a187-59f93ae19f6f","year":2023},"citing_paper":{"arxiv_id":"2606.22329","last_updated":"2026-06-21T04:35:43Z","snapshot_observed_at":"2026-07-31T23:50:31.635694Z","submitted_at":"2026-06-21T04:35:43Z","title":"BabelJudge: Measuring LLM-as-a-Judge Reliability Across Languages and Agent Trajectories","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-26T11:06:07.303335Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2606.22329"},"observation_digest":"sha256:3c59510b8402a64beb684470916a93dfa6e669d2b5b7f808e677881f901c089d","observation_id":"99f47601-be53-42f7-8a80-d43eb53c6843","resolution":{"observed_at":"2026-07-04T08:49:41.500046Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-08-01T18:08:18.676413Z","title":"Evaluating large language models: A comprehensive survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17409","last_updated":"2026-07-19T21:01:34Z","snapshot_observed_at":"2026-08-07T07:49:46.040713Z","submitted_at":"2026-07-19T21:01:34Z","title":"Efficient Sequential Evaluation of Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T18:08:18.676413Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2607.17409"},"observation_digest":"sha256:c993b8028bbc205cb86d1a824d01b51f895ca5bafaa2686da2406b6d5b618b2b","observation_id":"edd30526-0248-4d70-8c0d-f389042da49e","resolution":{"observed_at":"2026-08-01T18:08:18.676413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-08-01T02:21:22.521574Z","title":"arXiv preprint arXiv:2310.19736 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25485","last_updated":"2026-07-28T09:24:04Z","snapshot_observed_at":"2026-08-08T05:57:13.194969Z","submitted_at":"2026-07-28T09:24:04Z","title":"PatientAgentBench: A Benchmark Framework for Evaluating Patient-Facing Health AI Agents","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-01T02:21:22.521574Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2607.25485"},"observation_digest":"sha256:52a76e58e27d2370863aa1dad0b71190551f04ec38fa647364da758419017200","observation_id":"f3c6c9d6-cbec-4b73-bb34-fc4e24f7b3d7","resolution":{"observed_at":"2026-08-01T02:21:22.521574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2310.19736/citation-record","integrity":"/paper/2310.19736/integrity","json":"/paper/2310.19736/citation-record.json","paper":"/paper/2310.19736"},"outbound":[],"paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 28 inbound Pith citation observations for arXiv:2310.19736."}