{"as_of":"2026-08-10T10:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9eec9b8dacfb6d1a337af3d247b3ef5134e242fea4b2df10f0161f25598db7bb","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":12,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":12,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T15:06:55.041880Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-10T06:15:00.866473Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2306.03100","last_updated":"2025-01-31T14:59:17Z","snapshot_observed_at":"2026-08-10T01:04:14.922510Z","submitted_at":"2023-06-01T00:01:43Z","title":"Rethinking Model Evaluation as Narrowing the Socio-Technical Gap","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03100","snapshot_observed_at":"2026-08-08T15:06:55.041880Z","title":"Vera Liao and Ziang Xiao","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06559","last_updated":"2025-05-25T23:36:47Z","snapshot_observed_at":"2026-08-08T23:28:10.897343Z","submitted_at":"2025-02-10T15:25:06Z","title":"Can We Trust AI Benchmarks? An Interdisciplinary Review of Current Issues in AI Evaluation","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-08T15:06:55.041880Z"},"links":{"cited_paper":"/paper/2306.03100","citing_paper":"/paper/2502.06559"},"observation_digest":"sha256:28e494e863a2c57084b009acacba322f3d74f6cc6a62ac4baecdccdef61f2e76","observation_id":"b8bf805d-b04c-4813-a1ca-07f82e07f1f8","resolution":{"observed_at":"2026-08-08T15:06:55.041880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03100","last_updated":"2025-01-31T14:59:17Z","snapshot_observed_at":"2026-08-10T01:04:14.922510Z","submitted_at":"2023-06-01T00:01:43Z","title":"Rethinking Model Evaluation as Narrowing the Socio-Technical Gap","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03100","snapshot_observed_at":"2026-08-07T14:28:03.775256Z","title":"Vera Liao and Ziang Xiao","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18792","last_updated":"2025-05-24T17:11:32Z","snapshot_observed_at":"2026-08-08T23:39:53.900505Z","submitted_at":"2025-05-24T17:11:32Z","title":"On the Dual-Use Dilemma in Physical Reasoning and Force","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:28:03.775256Z"},"links":{"cited_paper":"/paper/2306.03100","citing_paper":"/paper/2505.18792"},"observation_digest":"sha256:d50cdb9fc592c6835b0ee4c0e57a52db946c80bbc85a240bf4e14c5c455f9bbe","observation_id":"a71a28eb-6ca8-4033-bad5-f10441bcf5af","resolution":{"observed_at":"2026-08-07T14:28:03.775256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03100","last_updated":"2025-01-31T14:59:17Z","snapshot_observed_at":"2026-08-10T01:04:14.922510Z","submitted_at":"2023-06-01T00:01:43Z","title":"Rethinking Model Evaluation as Narrowing the Socio-Technical Gap","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03100","snapshot_observed_at":"2026-08-06T23:25:48.867513Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18213","last_updated":"2025-06-23T00:19:27Z","snapshot_observed_at":"2026-08-07T10:41:05.932475Z","submitted_at":"2025-06-23T00:19:27Z","title":"A Conceptual Framework for AI Capability Evaluations","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T23:25:48.867513Z"},"links":{"cited_paper":"/paper/2306.03100","citing_paper":"/paper/2506.18213"},"observation_digest":"sha256:8e9c2bdb6e386dc2488b822dcf253bcd6907deeb470b9483e5d32c14a85b9724","observation_id":"8cb3e554-1745-4e84-98c6-229d9424ab14","resolution":{"observed_at":"2026-08-06T23:25:48.867513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03100","last_updated":"2025-01-31T14:59:17Z","snapshot_observed_at":"2026-08-10T01:04:14.922510Z","submitted_at":"2023-06-01T00:01:43Z","title":"Rethinking Model Evaluation as Narrowing the Socio-Technical Gap","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03100","snapshot_observed_at":"2026-08-06T15:29:39.408794Z","title":"Rethinking model evaluation as narrowing the socio-technical gap","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15715","last_updated":"2025-08-05T20:19:37Z","snapshot_observed_at":"2026-08-09T11:28:54.946827Z","submitted_at":"2025-07-21T15:26:58Z","title":"From Queries to Criteria: Understanding How Astronomers Evaluate LLMs","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:39.408794Z"},"links":{"cited_paper":"/paper/2306.03100","citing_paper":"/paper/2507.15715"},"observation_digest":"sha256:14db4ac51ab3fc4ee96c81f8b21bef35cd71bd7b70d4e05f95d212d5420192d6","observation_id":"64e7b96d-dc3b-424a-bdb2-ee5f5deb5e4b","resolution":{"observed_at":"2026-08-06T15:29:39.408794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03100","last_updated":"2025-01-31T14:59:17Z","snapshot_observed_at":"2026-08-10T01:04:14.922510Z","submitted_at":"2023-06-01T00:01:43Z","title":"Rethinking Model Evaluation as Narrowing the Socio-Technical Gap","version":4},"cited_work":{"arxiv_id":"2306.03100","doi":"10.48550/arxiv.2306.03100version","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.03100","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"arXiv preprint arXiv:2306.03100 , year=","venue":null,"work_id":"280e7290-6f40-43ec-97af-cdf99b029cb1","year":2025},"citing_paper":{"arxiv_id":"2511.05501","last_updated":"2026-04-28T16:06:15Z","snapshot_observed_at":"2026-07-06T22:35:13.699594Z","submitted_at":"2025-09-30T21:36:23Z","title":"Towards Real-World Validity in Generative AI Benchmarks: Understanding and Designing Domain-Centered Evaluations for Journalism Practitioners","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-18T10:59:16.139525Z"},"links":{"cited_paper":"/paper/2306.03100","citing_paper":"/paper/2511.05501"},"observation_digest":"sha256:521f8da9f26291c8ea96db797616229e0e53505982a4ddc82d0e80da79df6186","observation_id":"b7e5a324-debf-4bf7-bec0-babf37f323d1","resolution":{"observed_at":"2026-05-18T11:01:17.060795Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03100","last_updated":"2025-01-31T14:59:17Z","snapshot_observed_at":"2026-08-10T01:04:14.922510Z","submitted_at":"2023-06-01T00:01:43Z","title":"Rethinking Model Evaluation as Narrowing the Socio-Technical Gap","version":4},"cited_work":{"arxiv_id":"2306.03100","doi":"10.48550/arxiv.2306.03100version","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.03100","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"arXiv preprint arXiv:2306.03100 , year=","venue":null,"work_id":"280e7290-6f40-43ec-97af-cdf99b029cb1","year":2025},"citing_paper":{"arxiv_id":"2512.20761","last_updated":"2026-04-24T08:49:50Z","snapshot_observed_at":"2026-07-06T22:39:58.137482Z","submitted_at":"2025-12-23T20:48:11Z","title":"TS-Arena -- A Live Forecast Pre-Registration Platform","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-16T19:58:42.707636Z"},"links":{"cited_paper":"/paper/2306.03100","citing_paper":"/paper/2512.20761"},"observation_digest":"sha256:82097f442af7cebe25ceeac2c8d35a2369ce9f9c32f97726cde0d011c07a5b9d","observation_id":"30937516-66d6-417e-8f9a-56f63f39d180","resolution":{"observed_at":"2026-05-16T20:01:13.122720Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03100","last_updated":"2025-01-31T14:59:17Z","snapshot_observed_at":"2026-08-10T01:04:14.922510Z","submitted_at":"2023-06-01T00:01:43Z","title":"Rethinking Model Evaluation as Narrowing the Socio-Technical Gap","version":4},"cited_work":{"arxiv_id":"2306.03100","doi":"10.48550/arxiv.2306.03100version","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.03100","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"arXiv preprint arXiv:2306.03100 , year=","venue":null,"work_id":"280e7290-6f40-43ec-97af-cdf99b029cb1","year":2025},"citing_paper":{"arxiv_id":"2604.16304","last_updated":"2026-01-25T10:36:59Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-01-25T10:36:59Z","title":"Results-Actionability Gap: Understanding How Practitioners Evaluate LLM Products in the Wild","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-16T11:26:38.634540Z"},"links":{"cited_paper":"/paper/2306.03100","citing_paper":"/paper/2604.16304"},"observation_digest":"sha256:90a96ccb22b054b8479dd2d594a601a109f00b00b5674bc55ef3617c7c1e8dfa","observation_id":"fe8eb688-3b1f-421d-afc1-47a3f38d2548","resolution":{"observed_at":"2026-05-16T11:27:48.140243Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03100","last_updated":"2025-01-31T14:59:17Z","snapshot_observed_at":"2026-08-10T01:04:14.922510Z","submitted_at":"2023-06-01T00:01:43Z","title":"Rethinking Model Evaluation as Narrowing the Socio-Technical Gap","version":4},"cited_work":{"arxiv_id":"2306.03100","doi":"10.48550/arxiv.2306.03100version","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.03100","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"arXiv preprint arXiv:2306.03100 , year=","venue":null,"work_id":"280e7290-6f40-43ec-97af-cdf99b029cb1","year":2025},"citing_paper":{"arxiv_id":"2604.16403","last_updated":"2026-03-31T12:18:56Z","snapshot_observed_at":"2026-07-06T23:03:43.854612Z","submitted_at":"2026-03-31T12:18:56Z","title":"Computational Hermeneutics: Evaluating generative AI as a cultural technology","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-13T23:48:24.354896Z"},"links":{"cited_paper":"/paper/2306.03100","citing_paper":"/paper/2604.16403"},"observation_digest":"sha256:d321a4e20dbea30844d539f606ca5692a68cc927c447f933f0c821896dd4a88f","observation_id":"9da5e635-3f10-44e8-b2ba-8bc120adad5e","resolution":{"observed_at":"2026-05-13T23:48:27.120228Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03100","last_updated":"2025-01-31T14:59:17Z","snapshot_observed_at":"2026-08-10T01:04:14.922510Z","submitted_at":"2023-06-01T00:01:43Z","title":"Rethinking Model Evaluation as Narrowing the Socio-Technical Gap","version":4},"cited_work":{"arxiv_id":"2306.03100","doi":"10.48550/arxiv.2306.03100version","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.03100","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"arXiv preprint arXiv:2306.03100 , year=","venue":null,"work_id":"280e7290-6f40-43ec-97af-cdf99b029cb1","year":2025},"citing_paper":{"arxiv_id":"2604.23842","last_updated":"2026-04-26T19:04:49Z","snapshot_observed_at":"2026-08-06T20:38:26.981584Z","submitted_at":"2026-04-26T19:04:49Z","title":"Reheat Nachos for Dinner? Evaluating AI Support for Cross-Cultural Communication of Neologisms","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-08T06:20:10.348010Z"},"links":{"cited_paper":"/paper/2306.03100","citing_paper":"/paper/2604.23842"},"observation_digest":"sha256:8867bb06cfcb5fb098cb97c198e45b0d07bf0e03e09c7b3d009a94ffe5c856c8","observation_id":"d9825e56-3552-430f-bba6-cf2f7b5a340c","resolution":{"observed_at":"2026-05-11T21:16:11.509583Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03100","last_updated":"2025-01-31T14:59:17Z","snapshot_observed_at":"2026-08-10T01:04:14.922510Z","submitted_at":"2023-06-01T00:01:43Z","title":"Rethinking Model Evaluation as Narrowing the Socio-Technical Gap","version":4},"cited_work":{"arxiv_id":"2306.03100","doi":"10.48550/arxiv.2306.03100version","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.03100","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"arXiv preprint arXiv:2306.03100 , year=","venue":null,"work_id":"280e7290-6f40-43ec-97af-cdf99b029cb1","year":2025},"citing_paper":{"arxiv_id":"2605.15205","last_updated":"2026-04-28T15:38:31Z","snapshot_observed_at":"2026-08-08T12:32:02.265510Z","submitted_at":"2026-04-28T15:38:31Z","title":"Does Theory of Mind Improvement Really Benefit Human-AI Interactions? Empirical Findings from Interactive Evaluations","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-19T17:55:04.458343Z"},"links":{"cited_paper":"/paper/2306.03100","citing_paper":"/paper/2605.15205"},"observation_digest":"sha256:275823b6be8873e59a0d4abcec3ef9ad2aff8f256309be52cc6440852f936613","observation_id":"e18f3a49-a31a-4a84-b1a5-5f44c72caa21","resolution":{"observed_at":"2026-05-19T17:57:42.600070Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03100","last_updated":"2025-01-31T14:59:17Z","snapshot_observed_at":"2026-08-10T01:04:14.922510Z","submitted_at":"2023-06-01T00:01:43Z","title":"Rethinking Model Evaluation as Narrowing the Socio-Technical Gap","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03100","snapshot_observed_at":"2026-07-12T05:51:08.101805Z","title":"Luo, X., Li, Y ., Huang, Q., and Zhan, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02955","last_updated":"2026-07-03T04:59:03Z","snapshot_observed_at":"2026-08-06T03:14:27.339658Z","submitted_at":"2026-07-03T04:59:03Z","title":"The Foreign Policy AI Evaluation Gap","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-12T05:51:08.101805Z"},"links":{"cited_paper":"/paper/2306.03100","citing_paper":"/paper/2607.02955"},"observation_digest":"sha256:7a63759fa7cf9065f5815fe360824c49a2b5ce2fa96169453ea1fbe0d4f47d3e","observation_id":"54e0411b-851e-4599-a05f-0242dadd39d5","resolution":{"observed_at":"2026-07-12T05:51:08.101805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03100","last_updated":"2025-01-31T14:59:17Z","snapshot_observed_at":"2026-08-10T01:04:14.922510Z","submitted_at":"2023-06-01T00:01:43Z","title":"Rethinking Model Evaluation as Narrowing the Socio-Technical Gap","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03100","snapshot_observed_at":"2026-08-01T00:37:07.107149Z","title":"Vera Liao and Ziang Xiao , title =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26191","last_updated":"2026-07-28T18:50:39Z","snapshot_observed_at":"2026-08-09T11:28:52.826166Z","submitted_at":"2026-07-28T18:50:39Z","title":"Position: Evaluation Scores Are Perishable Knowledge Claims","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-01T00:37:07.107149Z"},"links":{"cited_paper":"/paper/2306.03100","citing_paper":"/paper/2607.26191"},"observation_digest":"sha256:086b20d6d4656450a4600d5b7bea36e330f4fed29ff51d7f3730e1258a320b53","observation_id":"846c95ea-afae-499c-a5f3-ceff7c7a4989","resolution":{"observed_at":"2026-08-01T00:37:07.107149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2306.03100/citation-record","integrity":"/paper/2306.03100/integrity","json":"/paper/2306.03100/citation-record.json","paper":"/paper/2306.03100"},"outbound":[],"paper":{"arxiv_id":"2306.03100","last_updated":"2025-01-31T14:59:17Z","latest_version":4,"primary_category":"cs.HC","snapshot_observed_at":"2026-08-10T01:04:14.922510Z","submitted_at":"2023-06-01T00:01:43Z","title":"Rethinking Model Evaluation as Narrowing the Socio-Technical Gap"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 12 inbound Pith citation observations for arXiv:2306.03100."}