{"as_of":"2026-08-07T16:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b8b4b9605c5939f1b87d3d6ffee850ebcccf479f1af80cdd40102781e5457716","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:30:32.913920Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:20:14.933677Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-19T04:12:02.502599Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"cited_work":{"arxiv_id":"2506.21521","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21521","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Potemkin understanding in large language models","venue":null,"work_id":"4b8ee427-7512-4dec-8562-8a7531fbc16e","year":2025},"citing_paper":{"arxiv_id":"2507.12549","last_updated":"2026-04-28T23:40:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-16T18:01:26Z","title":"The Serial Scaling Hypothesis","version":4},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-19T04:08:11.344622Z"},"links":{"cited_paper":"/paper/2506.21521","citing_paper":"/paper/2507.12549"},"observation_digest":"sha256:196596b76280c6d1a6e2af837fd6889e9f53faa8d05d96525a8363c4fb47a672","observation_id":"e47380ed-7f27-40ba-9c70-a07012ce052f","resolution":{"observed_at":"2026-05-19T04:12:02.504578Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21521","snapshot_observed_at":"2026-08-06T15:20:14.933677Z","title":"Potemkin understanding in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.16331","last_updated":"2026-07-03T09:17:03Z","snapshot_observed_at":"2026-08-07T04:15:41.914807Z","submitted_at":"2025-07-22T08:13:01Z","title":"Re:Form -- Reducing Human Annotations in Scalable Formal Software Verification with RL in LLMs: A Preliminary Study on Dafny","version":4},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T15:20:14.933677Z"},"links":{"cited_paper":"/paper/2506.21521","citing_paper":"/paper/2507.16331"},"observation_digest":"sha256:c8356ed76751e89e31be58ca193e5be4e6293d741869aa2ba63d41a3524cfa1b","observation_id":"b920a734-a6e2-4c40-8dfb-4b2310026e8f","resolution":{"observed_at":"2026-08-06T15:20:14.933677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21521","snapshot_observed_at":"2026-08-06T14:12:02.086965Z","title":"Potemkin understanding in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.19703","last_updated":"2025-07-30T07:58:56Z","snapshot_observed_at":"2026-08-06T14:12:01.325068Z","submitted_at":"2025-07-25T22:48:37Z","title":"The wall confronting large language models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T14:12:02.086965Z"},"links":{"cited_paper":"/paper/2506.21521","citing_paper":"/paper/2507.19703"},"observation_digest":"sha256:70ec1d64af32978500862acae9bb44883f0591f4324d7b7f0d837b200bf34f0f","observation_id":"d3377b6c-ba71-43ca-a1e9-e72554f74392","resolution":{"observed_at":"2026-08-06T14:12:02.086965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"cited_work":{"arxiv_id":"2506.21521","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21521","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Potemkin understanding in large language models","venue":null,"work_id":"4b8ee427-7512-4dec-8562-8a7531fbc16e","year":2025},"citing_paper":{"arxiv_id":"2604.25905","last_updated":"2026-04-28T17:51:13Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:51:13Z","title":"A paradox of AI fluency","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-07T16:17:48.531790Z"},"links":{"cited_paper":"/paper/2506.21521","citing_paper":"/paper/2604.25905"},"observation_digest":"sha256:683e379965f09515ae8bd86672f96b63be1af1188dcb94814f729d29a6f82e92","observation_id":"4f151f5c-19ea-4c68-a39f-a7fdbbbd2f34","resolution":{"observed_at":"2026-05-11T23:46:52.218393Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21521","snapshot_observed_at":"2026-07-15T07:32:36.632338Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.12125","last_updated":"2026-07-13T20:17:43Z","snapshot_observed_at":"2026-08-02T05:46:41.863716Z","submitted_at":"2026-07-13T20:17:43Z","title":"Faster AI, Uneven Frontier: Rapid Crossings, a Jagged Frontier, and the Repositioning of Human Judgment","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-15T07:32:36.632338Z"},"links":{"cited_paper":"/paper/2506.21521","citing_paper":"/paper/2607.12125"},"observation_digest":"sha256:d28189e5752bb778e63eb358ecd782e64d3113c4fcd3b28189130ac6161fbb7e","observation_id":"23d6e3c3-18ed-4570-9836-ee238b71a00a","resolution":{"observed_at":"2026-07-15T07:32:36.632338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.21521/citation-record","integrity":"/paper/2506.21521/integrity","json":"/paper/2506.21521/citation-record.json","paper":"/paper/2506.21521"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:30:28.435106Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:28.435106Z"},"links":{"citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:b10a11baca49eb34d8946e4ef3b3fc551679ba472183d442433f7acb6454f2b1","observation_id":"d63f77aa-6ef6-49ee-a283-79eb99afab8a","resolution":{"observed_at":"2026-08-06T22:30:28.435106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03762","last_updated":"2023-08-10T14:24:37Z","snapshot_observed_at":"2026-08-05T14:37:13.469156Z","submitted_at":"2023-07-21T17:04:25Z","title":"GPT-4 Can't Reason","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03762","snapshot_observed_at":"2026-08-06T22:30:28.514523Z","title":"Gpt-4 can't reason","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:28.514523Z"},"links":{"cited_paper":"/paper/2308.03762","citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:6acbf69e96d9455174eb31db16eb35fba913cb819c10bc3f94e8a4220f03b300","observation_id":"f1e6da37-5ba4-4f69-8fa9-0c59c9d581ff","resolution":{"observed_at":"2026-08-06T22:30:28.514523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.02173","last_updated":"2018-02-24T19:44:38Z","snapshot_observed_at":"2026-07-06T06:08:03.192267Z","submitted_at":"2017-11-06T20:59:58Z","title":"Synthetic and Natural Noise Both Break Neural Machine Translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.02173","snapshot_observed_at":"2026-08-06T22:30:28.626627Z","title":"and Bisk, Y","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:28.626627Z"},"links":{"cited_paper":"/paper/1711.02173","citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:c9d960c8ca4ff41844494ae1b137dbaee80ebae6066a4d7845a532b64977ec55","observation_id":"f2924307-bf4f-46d0-8620-46c553022461","resolution":{"observed_at":"2026-08-06T22:30:28.626627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.12288","last_updated":"2024-05-26T17:45:21Z","snapshot_observed_at":"2026-07-06T16:21:57.649550Z","submitted_at":"2023-09-21T17:52:19Z","title":"The Reversal Curse: LLMs trained on \"A is B\" fail to learn \"B is A\"","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.12288","snapshot_observed_at":"2026-08-06T22:30:28.715765Z","title":"a is b\" fail to learn","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:28.715765Z"},"links":{"cited_paper":"/paper/2309.12288","citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:435213a181abf1038ef436a75618e9d81020fdafbb2dd6ed35ff01581c5aca80","observation_id":"da117aa1-2c46-4bef-ab57-ea86758a63f7","resolution":{"observed_at":"2026-08-06T22:30:28.715765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.02145","last_updated":"2021-10-15T19:10:43Z","snapshot_observed_at":"2026-08-03T16:37:49.472964Z","submitted_at":"2021-04-05T20:36:11Z","title":"What Will it Take to Fix Benchmarking in Natural Language Understanding?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.02145","snapshot_observed_at":"2026-08-06T22:30:28.809315Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:28.809315Z"},"links":{"cited_paper":"/paper/2104.02145","citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:8645f281b3e965004287504ef968afeda221350f379d0ff0e4baf769c474cc85","observation_id":"2aadb985-3932-4443-9b5c-20ebf50d25b2","resolution":{"observed_at":"2026-08-06T22:30:28.809315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1508.05326","last_updated":"2015-08-21T16:17:01Z","snapshot_observed_at":"2026-08-05T22:08:24.004344Z","submitted_at":"2015-08-21T16:17:01Z","title":"A large annotated corpus for learning natural language inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1508.05326","snapshot_observed_at":"2026-08-06T22:30:28.890401Z","title":"R., Angeli, G., Potts, C., and Manning, C","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:28.890401Z"},"links":{"cited_paper":"/paper/1508.05326","citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:b271c4354afd1ff8dc9006903f0a6d16b880d2a5cab68bacec12b259617a616c","observation_id":"acad158d-780c-4e01-9d25-2f7b9e40fe4f","resolution":{"observed_at":"2026-08-06T22:30:28.890401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:30:37.120060Z","title":"T., Li, Y., Lundberg, S., et al","venue":null,"work_id":"068361ad-26b8-4d83-8404-985f09f2edd4","year":2023},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:28.992268Z"},"links":{"citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:f7da4b38a0f7d1980d18f7665e520c83add3a0eb63fc97e2bdb7068e80e632e5","observation_id":"2b23d7a8-3d0b-4c30-9521-1a1bfc1a288f","resolution":{"observed_at":"2026-08-06T22:30:37.175863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.06595","last_updated":"2020-10-13T18:00:02Z","snapshot_observed_at":"2026-07-06T10:04:08.581238Z","submitted_at":"2020-10-13T18:00:02Z","title":"With Little Power Comes Great Responsibility","version":1},"cited_work":{"arxiv_id":"2010.06595","doi":null,"metadata_source":"pith","pith_arxiv_id":"2010.06595","snapshot_observed_at":"2026-08-06T22:30:33.712445Z","title":"With Little Power Comes Great Responsibility","venue":"cs.CL","work_id":"cca99a9d-94a6-46dc-931d-f756f8cbbd07","year":2020},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:29.088514Z"},"links":{"cited_paper":"/paper/2010.06595","citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:a9ef33d1a2b0b524466ae253a223bc1328278b58d718932b89f7d1a5c39a3c32","observation_id":"3c13f625-6a91-4d56-bd70-58eeb0d90de1","resolution":{"observed_at":"2026-08-06T22:30:33.752650Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07114","last_updated":"2025-08-12T01:53:40Z","snapshot_observed_at":"2026-08-07T16:44:44.128963Z","submitted_at":"2025-03-22T01:21:40Z","title":"ChatBench: From Static Benchmarks to Human-AI Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07114","snapshot_observed_at":"2026-08-06T22:30:29.181666Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:29.181666Z"},"links":{"cited_paper":"/paper/2504.07114","citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:589f8c8ebb7e97b794c2cf7c4e4d389fd55228bd337dc6cc6d21d08a070d4f23","observation_id":"570370e0-e76e-4430-9284-c1068694b47e","resolution":{"observed_at":"2026-08-06T22:30:29.181666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:30:36.950887Z","title":"N., Li, T., Li, D., Zhu, B., Zhang, H., Jordan, M., Gonzalez, J","venue":null,"work_id":"20efc19b-660e-43b3-ac56-ccd2fca71ea5","year":2024},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:29.278520Z"},"links":{"citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:6347acfc56fba9b141c4009ee9149bfd9f528c0813d4aa7d924c3706ecb281db","observation_id":"ebe472ad-7448-4859-924d-4375114536cb","resolution":{"observed_at":"2026-08-06T22:30:37.015281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:30:36.814470Z","title":null,"venue":null,"work_id":"3f76e824-7e59-40dc-bdff-72d5bb75cf55","year":2019},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:29.378079Z"},"links":{"citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:dcd432b281c8dd89a5f2c1e2184ab5122d85f0416a5c08829926f2bcea9031d9","observation_id":"f0562646-d1d9-4fd3-b47a-e047e37a74de","resolution":{"observed_at":"2026-08-06T22:30:36.872633Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:30:36.673310Z","title":"and Etzioni, O","venue":null,"work_id":"2560e82a-eb7f-4920-b709-67e6d1a3e180","year":2016},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:29.481957Z"},"links":{"citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:3407a3cab87aff16bc2459b97db81283e65ede98c07e086661d4ba769813122c","observation_id":"c9b3191d-80f6-4b06-9503-beaa37bb8d3c","resolution":{"observed_at":"2026-08-06T22:30:36.720223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:30:36.534892Z","title":"Recognizing textual entailment: Rational, evaluation and approaches--erratum","venue":null,"work_id":"b645ed11-1fb4-4756-aa6c-f99cc1ff0b62","year":2010},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:29.559562Z"},"links":{"citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:03af5be8339d72d64c88c49969079d9f371ed057e7d85751e8b55b898efb2c79","observation_id":"1ff9d6c6-be20-479b-8761-9cabe6a83991","resolution":{"observed_at":"2026-08-06T22:30:36.600044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:30:36.355434Z","title":"Testing ai on language comprehension tasks reveals insensitivity to underlying meaning","venue":null,"work_id":"1224cdb0-2f1e-4b0a-a980-d36f6775459a","year":2024},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:29.621688Z"},"links":{"citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:94faf1f95a03a9f53684605231f247b00ffd242ae1a6ab8fcb8beffad4893b48","observation_id":"4cb16b18-fd89-4569-94ca-464bf44350d6","resolution":{"observed_at":"2026-08-06T22:30:36.453392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:30:36.195795Z","title":"and Meurers, D","venue":null,"work_id":"54c1ca34-8ed2-4f7d-94bf-cd0ace8928f7","year":2003},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:29.666182Z"},"links":{"citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:71a4a12ea952999c4ba3368eba481e40f89586ed5c62c3fd527965ac0670bf02","observation_id":"a0ea739a-535a-4172-8f46-2181181d8d19","resolution":{"observed_at":"2026-08-06T22:30:36.269650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:30:36.026178Z","title":"Measuring and improving consistency in pretrained language models","venue":null,"work_id":"7e984d28-d5d7-45ae-a205-595a5c591468","year":2021},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:29.750083Z"},"links":{"citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:2cd58f258c78750a379d6cd4a5ab60da56163a88d3fdee70931cf59346c20023","observation_id":"6077b6e3-a40e-4ede-a49f-cc31384401c8","resolution":{"observed_at":"2026-08-06T22:30:36.131723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:30:35.867755Z","title":"Evaluating superhuman models with consistency checks","venue":null,"work_id":"854b2111-58b3-4558-9c41-dd4ac30ed757","year":2024},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:29.825513Z"},"links":{"citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:7c7f05fbd75ceec5dca6f00bd83d1120080fdea0931c888d7e3ba6c8afdfc192","observation_id":"795b1987-0c86-46cd-9f60-e2fbbe755337","resolution":{"observed_at":"2026-08-06T22:30:35.945909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:30:35.762281Z","title":"W., Wallach, H., Iii, H","venue":null,"work_id":"3e1d415a-46d6-438e-8861-fc6b6413ce1c","year":2021},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:29.888225Z"},"links":{"citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:559718c1ab91b07dbbeb5f71eb4d18648bbc12202129f90a9eb93e75ed442052","observation_id":"df50e5bb-3e3c-4b1c-88ec-df9aaa6f1fe7","resolution":{"observed_at":"2026-08-06T22:30:35.807415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:30:35.630652Z","title":null,"venue":null,"work_id":"7e95917f-c3c8-451a-aae2-0777cc67c49e","year":2020},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:29.949572Z"},"links":{"citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:e53f47e2ef3bee401097a65d7e0193ee412de4d5787f54d841bedf16a8838e26","observation_id":"4ef75983-0583-4e5c-bdb5-f556c86df559","resolution":{"observed_at":"2026-08-06T22:30:35.689875Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.14913","last_updated":"2021-09-05T17:32:27Z","snapshot_observed_at":"2026-08-02T07:29:08.108809Z","submitted_at":"2020-12-29T19:12:05Z","title":"Transformer Feed-Forward Layers Are Key-Value Memories","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.14913","snapshot_observed_at":"2026-08-06T22:30:30.028454Z","title":"Transformer feed-forward layers are key-value memories","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:30.028454Z"},"links":{"cited_paper":"/paper/2012.14913","citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:ff002daf76f60b196ed6c03ecd9b33c1d4eff2076fc2b15e9b3b049f1f229a59","observation_id":"9d7a95cd-1d8f-4e3a-ad3e-c7466b06c8a0","resolution":{"observed_at":"2026-08-06T22:30:30.028454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14680","last_updated":"2022-10-12T18:01:23Z","snapshot_observed_at":"2026-08-03T05:22:23.916601Z","submitted_at":"2022-03-28T12:26:00Z","title":"Transformer Feed-Forward Layers Build Predictions by Promoting Concepts in the Vocabulary Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.14680","snapshot_observed_at":"2026-08-06T22:30:30.090564Z","title":"R., and Goldberg, Y","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:30.090564Z"},"links":{"cited_paper":"/paper/2203.14680","citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:4b407cd532364a820c5f50b503a28a8f3776614c6df52fb44733b8153328e0b2","observation_id":"ad7f7eb0-fd01-4e0f-82f0-18976d86aa83","resolution":{"observed_at":"2026-08-06T22:30:30.090564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14767","last_updated":"2023-10-13T19:01:20Z","snapshot_observed_at":"2026-08-06T20:03:14.316115Z","submitted_at":"2023-04-28T11:26:17Z","title":"Dissecting Recall of Factual Associations in Auto-Regressive Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14767","snapshot_observed_at":"2026-08-06T22:30:30.137112Z","title":"Dissecting recall of factual associations in auto-regressive language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:30.137112Z"},"links":{"cited_paper":"/paper/2304.14767","citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:44074d5abb038ee454799625e76723006b09b3d432728da989c5516b910da4a6","observation_id":"882665b5-e390-4393-a700-f7ee81ed8000","resolution":{"observed_at":"2026-08-06T22:30:30.137112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:30:35.517386Z","title":"What can large language models do in chemistry? a comprehensive benchmark on eight tasks","venue":null,"work_id":"811e5479-c1b4-468d-8b10-d5bdc90d6f8c","year":2023},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:30.184234Z"},"links":{"citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:83cc67a857e2854ab70fe91b2fa9b046ec085799dd0cf7fe89cec4132c6ddf36","observation_id":"57ecf5a2-459b-4cc0-8b2b-0afe2ce9ee84","resolution":{"observed_at":"2026-08-06T22:30:35.569299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-06T22:30:30.241460Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:30.241460Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:c0744832bef95b2d3b326c91615b247a205d736b6cef3caa663a6b4d782eac16","observation_id":"bb395e0f-87b7-47c5-b22f-19332a00494b","resolution":{"observed_at":"2026-08-06T22:30:30.241460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.03519","last_updated":"2021-05-07T21:58:35Z","snapshot_observed_at":"2026-07-06T11:07:25.043727Z","submitted_at":"2021-05-07T21:58:35Z","title":"Understanding by Understanding Not: Modeling Negation in Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.03519","snapshot_observed_at":"2026-08-06T22:30:30.327528Z","title":"D., Sordoni, A., and Courville, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:30.327528Z"},"links":{"cited_paper":"/paper/2105.03519","citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:17e9dce07bf9c6d233471c3bea5fc9e65fae329a2de433b72d2f5460e36fda92","observation_id":"9ed4d6bd-64af-43c2-8e0e-b91ee427f5ac","resolution":{"observed_at":"2026-08-06T22:30:30.327528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09605","last_updated":"2025-07-03T20:10:24Z","snapshot_observed_at":"2026-07-06T18:14:54.506051Z","submitted_at":"2024-05-15T17:19:42Z","title":"Elements of World Knowledge (EWoK): A Cognition-Inspired Framework for Evaluating Basic World Knowledge in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09605","snapshot_observed_at":"2026-08-06T22:30:30.380612Z","title":"A., Sathe, A., Lipkin, B., Kumar, U., Radkani, S., Clark, T","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:30.380612Z"},"links":{"cited_paper":"/paper/2405.09605","citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:1542c67bcc944aadbfb914b7f85b2323f71851483da818efb58e932a93737a54","observation_id":"f80f7806-56f6-4f3a-adde-ab4af24c94be","resolution":{"observed_at":"2026-08-06T22:30:30.380612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.06059","last_updated":"2018-04-17T06:12:36Z","snapshot_observed_at":"2026-08-04T02:43:37.385970Z","submitted_at":"2018-04-17T06:12:36Z","title":"Adversarial Example Generation with Syntactically Controlled Paraphrase Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.06059","snapshot_observed_at":"2026-08-06T22:30:30.427899Z","title":"Adversarial example generation with syntactically controlled paraphrase networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:30.427899Z"},"links":{"cited_paper":"/paper/1804.06059","citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:0516834a181aeff55ce411c452f09663cca7ac54499ec6176ffdb845eecd55d2","observation_id":"0a12bff8-1508-4e41-9956-e1d2c96a5a6b","resolution":{"observed_at":"2026-08-06T22:30:30.427899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.06665","last_updated":"2021-08-15T06:25:07Z","snapshot_observed_at":"2026-07-06T11:38:22.579530Z","submitted_at":"2021-08-15T06:25:07Z","title":"Accurate, yet inconsistent? Consistency Analysis on Language Understanding Models","version":1},"cited_work":{"arxiv_id":"2108.06665","doi":null,"metadata_source":"pith","pith_arxiv_id":"2108.06665","snapshot_observed_at":"2026-08-06T22:30:33.457132Z","title":"Accurate, yet inconsistent? Consistency Analysis on Language Understanding Models","venue":"cs.CL","work_id":"b118ac6b-3c82-4106-93f1-75efe227f72b","year":2021},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:30.469419Z"},"links":{"cited_paper":"/paper/2108.06665","citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:22889d417776bb059110ea2543afec3115bcfeac7a86cb8604609e047812a7cd","observation_id":"bd4c4a24-c70e-48cf-a109-fd0779d6db79","resolution":{"observed_at":"2026-08-06T22:30:33.511891Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:30:35.440041Z","title":"S., and Lukasiewicz, T","venue":null,"work_id":"781ac3e7-3868-4173-a8e0-cf183450dee7","year":2022},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:30.557719Z"},"links":{"citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:10523f98978992483a1b0b24913b5674735731af123d60780c3eb3011613a195","observation_id":"4ecb5384-98e1-4909-99a9-00cfd77fb317","resolution":{"observed_at":"2026-08-06T22:30:35.468299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.06273","last_updated":"2023-11-14T00:20:20Z","snapshot_observed_at":"2026-08-06T05:06:21.795803Z","submitted_at":"2023-03-11T01:19:01Z","title":"Consistency Analysis of ChatGPT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.06273","snapshot_observed_at":"2026-08-06T22:30:30.615032Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:30.615032Z"},"links":{"cited_paper":"/paper/2303.06273","citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:a60e292672ceaf02ff0ca40f38e540adb4804773b27f095b6ef51abdb9b52b7f","observation_id":"68983c8b-c899-4210-9d69-74e87fd3f5a1","resolution":{"observed_at":"2026-08-06T22:30:30.615032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:30:35.326519Z","title":"What disease does this patient have? a large-scale open domain question answering dataset from medical exams","venue":null,"work_id":"bc9193c3-d9fc-4deb-a586-d6c4ffef666b","year":2021},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:30.655859Z"},"links":{"citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:a52463e4c228ffeddde9a71224dc05d23c3902c2135dfb5c193d0dd976ea6fe7","observation_id":"354c96c6-6b8a-4b97-9c6b-027e9347c2bc","resolution":{"observed_at":"2026-08-06T22:30:35.375868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.14337","last_updated":"2021-04-07T17:49:17Z","snapshot_observed_at":"2026-08-03T23:24:34.241550Z","submitted_at":"2021-04-07T17:49:17Z","title":"Dynabench: Rethinking Benchmarking in NLP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.14337","snapshot_observed_at":"2026-08-06T22:30:30.708684Z","title":"Dynabench: Rethinking benchmarking in nlp","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:30.708684Z"},"links":{"cited_paper":"/paper/2104.14337","citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:86018db014af6322427b43925fbd0e20cb9b5e42f89cbf304adab04dc161f158","observation_id":"6c072be9-1d61-4f5e-97e5-5ac8b700aab8","resolution":{"observed_at":"2026-08-06T22:30:30.708684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:30:35.243411Z","title":"a ldchen, S., Binder, A., Montavon, G., Samek, W., and M \\","venue":null,"work_id":"2331764e-fa10-49a1-80b4-c340fdeb36e3","year":2019},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:30.785634Z"},"links":{"citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:6f8ef59dfd4e3fb88b1c72596168d8d0223a0043091c65a2317c9d56beae92c1","observation_id":"0186b315-2370-42f2-bcec-d4c750206225","resolution":{"observed_at":"2026-08-06T22:30:35.273866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01846","last_updated":"2023-10-03T07:23:22Z","snapshot_observed_at":"2026-08-01T16:42:52.001854Z","submitted_at":"2023-10-03T07:23:22Z","title":"Benchmarking and Improving Generator-Validator Consistency of Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01846","snapshot_observed_at":"2026-08-06T22:30:30.853855Z","title":"L., Shrivastava, V., Li, S., Hashimoto, T., and Liang, P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:30.853855Z"},"links":{"cited_paper":"/paper/2310.01846","citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:8c93a23ee76c5917f942f5b554412a6244d543964db4c81bdb4f482961d67bc4","observation_id":"61a4b5d1-70c0-452f-accd-f2ac542cbe02","resolution":{"observed_at":"2026-08-06T22:30:30.853855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-01T19:14:56.803459Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-06T22:30:30.910951Z","title":"Holistic evaluation of language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:30.910951Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:b0b19825c108102ba0fed803e17144c50fd77c3ae739756dbfbf04319907dbd0","observation_id":"34dd9cdc-8b85-4a39-9792-2ecfad2c4309","resolution":{"observed_at":"2026-08-06T22:30:30.910951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.07958","last_updated":"2022-05-08T02:43:02Z","snapshot_observed_at":"2026-08-03T16:26:48.747700Z","submitted_at":"2021-09-08T17:15:27Z","title":"TruthfulQA: Measuring How Models Mimic Human Falsehoods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.07958","snapshot_observed_at":"2026-08-06T22:30:30.965179Z","title":"Truthfulqa: Measuring how models mimic human falsehoods","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:30.965179Z"},"links":{"cited_paper":"/paper/2109.07958","citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:7f50235aabb5569d68824b9bb7b0e58b423d4616c10aec94b7d25e5310b97fcf","observation_id":"21d94355-3964-424e-89e1-753c74677884","resolution":{"observed_at":"2026-08-06T22:30:30.965179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12209","last_updated":"2024-05-20T17:52:29Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:52:29Z","title":"MathBench: Evaluating the Theory and Application Proficiency of LLMs with a Hierarchical Mathematics Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12209","snapshot_observed_at":"2026-08-06T22:30:31.067924Z","title":"Mathbench: Evaluating the theory and application proficiency of llms with a hierarchical mathematics benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:31.067924Z"},"links":{"cited_paper":"/paper/2405.12209","citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:cc39a535d4467ee2bcd73e71c02b5f590207fe5eb82516ab69293211d529daaf","observation_id":"2549b930-ffc8-4b3d-934c-a762e4745d65","resolution":{"observed_at":"2026-08-06T22:30:31.067924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15287","last_updated":"2024-11-22T16:56:49Z","snapshot_observed_at":"2026-07-06T19:55:46.467982Z","submitted_at":"2024-11-22T16:56:49Z","title":"Sycophancy in Large Language Models: Causes and Mitigations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15287","snapshot_observed_at":"2026-08-06T22:30:31.121504Z","title":"Sycophancy in large language models: Causes and mitigations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:31.121504Z"},"links":{"cited_paper":"/paper/2411.15287","citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:e787f2f55d5a8dd2b8e5bffbcf0f91148939edc1df8f448e1fb695fba2192232","observation_id":"be411334-3402-45b3-8c6d-ce53abf7f192","resolution":{"observed_at":"2026-08-06T22:30:31.121504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:30:35.152669Z","title":"Locating and editing factual associations in gpt","venue":null,"work_id":"7f47de42-3222-49a1-bceb-3466c04cca0d","year":2022},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:31.176258Z"},"links":{"citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:ba96290825211c348d31db12cad6c355903f32e741477f7212ee8a0df690f18c","observation_id":"091c2206-b1ef-4a53-bb76-a814cce90897","resolution":{"observed_at":"2026-08-06T22:30:35.195017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.11309","last_updated":"2022-06-13T23:26:16Z","snapshot_observed_at":"2026-08-03T23:42:31.942314Z","submitted_at":"2021-10-21T17:41:56Z","title":"Fast Model Editing at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.11309","snapshot_observed_at":"2026-08-06T22:30:31.224912Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:31.224912Z"},"links":{"cited_paper":"/paper/2110.11309","citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:39132ba76ed935fc73f16926e6c3de31f0a8270ff2185ac57026caba2f49d206","observation_id":"6035467f-3a81-400a-b0d5-cc888ce0ad89","resolution":{"observed_at":"2026-08-06T22:30:31.224912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.12871","last_updated":"2021-04-28T15:51:25Z","snapshot_observed_at":"2026-07-06T11:03:50.046405Z","submitted_at":"2021-04-26T20:39:18Z","title":"Why AI is Harder Than We Think","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.12871","snapshot_observed_at":"2026-08-06T22:30:31.291743Z","title":"Why ai is harder than we think","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:31.291743Z"},"links":{"cited_paper":"/paper/2104.12871","citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:f6e1103b855668ba51f5dca64b883fdf1c67951e4ec35b3c23c7d9fb903fb869","observation_id":"f5d35c09-92f8-4221-b27e-3e9898934714","resolution":{"observed_at":"2026-08-06T22:30:31.291743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:30:35.078227Z","title":"D., Bender, E","venue":null,"work_id":"f7bef173-efd5-4888-8959-52b582526d5f","year":2021},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:31.379058Z"},"links":{"citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:486f2bda994bd0e5a1de3fcc7698bf24683a37103c9f4bb01a70ecbc5fce8ff8","observation_id":"3f0bdea2-db8d-4924-b014-b67fb3794e51","resolution":{"observed_at":"2026-08-06T22:30:35.113972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.01066","last_updated":"2019-09-04T09:33:20Z","snapshot_observed_at":"2026-07-06T08:18:37.267833Z","submitted_at":"2019-09-03T11:11:08Z","title":"Language Models as Knowledge Bases?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.01066","snapshot_observed_at":"2026-08-06T22:30:31.430923Z","title":"H., and Riedel, S","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:31.430923Z"},"links":{"cited_paper":"/paper/1909.01066","citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:0ac72083ba7d94d42b86e311f47c6e7cd58815e41b584d5bbdcdc4ab7155d3ea","observation_id":"4d8bd2d3-03dd-41a4-b40a-9090106f3e7f","resolution":{"observed_at":"2026-08-06T22:30:31.430923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03350","last_updated":"2023-10-17T18:57:17Z","snapshot_observed_at":"2026-07-31T15:52:06.089691Z","submitted_at":"2022-10-07T06:50:23Z","title":"Measuring and Narrowing the Compositionality Gap in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03350","snapshot_observed_at":"2026-08-06T22:30:31.483348Z","title":"A., and Lewis, M","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:31.483348Z"},"links":{"cited_paper":"/paper/2210.03350","citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:917edf03e0431f69db026a20ecb9e768629294d87de2a25610231af009d8be47","observation_id":"c7fccb6c-5ef1-4c84-ad1c-c551ef3259a2","resolution":{"observed_at":"2026-08-06T22:30:31.483348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.15366","last_updated":"2021-11-26T19:39:34Z","snapshot_observed_at":"2026-08-07T00:21:07.584753Z","submitted_at":"2021-11-26T19:39:34Z","title":"AI and the Everything in the Whole Wide World Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.15366","snapshot_observed_at":"2026-08-06T22:30:31.598191Z","title":"D., Bender, E","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:31.598191Z"},"links":{"cited_paper":"/paper/2111.15366","citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:43319a4ead4547e4e9e84c3c9c78991c058f7d8dd0c20bb0172a7f0322e8e399","observation_id":"6c20d737-f59a-4e24-a439-fe41835ade21","resolution":{"observed_at":"2026-08-06T22:30:31.598191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:30:34.990080Z","title":"Do imagenet classifiers generalize to imagenet? In International conference on machine learning","venue":null,"work_id":"87c0dc4e-f18b-4833-b40f-84a2edacc28e","year":2019},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:31.642476Z"},"links":{"citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:e801cb3865dd0c5d1312e8044139eddf2f381b119ae52d0536b49c3fcd923c83","observation_id":"8654d9be-99c3-404f-9f7e-8492fb9d6de5","resolution":{"observed_at":"2026-08-06T22:30:35.017358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12990","last_updated":"2024-11-20T02:38:24Z","snapshot_observed_at":"2026-07-06T19:52:55.369337Z","submitted_at":"2024-11-20T02:38:24Z","title":"BetterBench: Assessing AI Benchmarks, Uncovering Issues, and Establishing Best Practices","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12990","snapshot_observed_at":"2026-08-06T22:30:31.722951Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:31.722951Z"},"links":{"cited_paper":"/paper/2411.12990","citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:919d944e52669061f3ebb04268156eb306949c300531bf0386166fa6ae4e1d6d","observation_id":"efe6e90d-51f8-4d07-8a1b-e0d52e412b8e","resolution":{"observed_at":"2026-08-06T22:30:31.722951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:30:34.893664Z","title":"why should i trust you?","venue":null,"work_id":"94305865-1e6a-411b-b1ad-c2071a6f9cdf","year":2016},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:31.791629Z"},"links":{"citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:b47f77f4a086b30f801b6a1dc7279e12a10b6b1df865d93ae59d2f5aaa6aa75a","observation_id":"bf318aeb-57fe-4762-ba40-f4bb1662706d","resolution":{"observed_at":"2026-08-06T22:30:34.941864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:30:34.787616Z","title":"T., Singh, S., and Guestrin, C","venue":null,"work_id":"aa2f08ff-7b7e-4ad5-96d1-abeee4223ba1","year":2018},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:31.837348Z"},"links":{"citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:d1d0a68175022a5857d9d9971de4111ca1db35463ee702e189be92560ed97134","observation_id":"59283c74-da0b-44ab-9b13-74f0e61b7f41","resolution":{"observed_at":"2026-08-06T22:30:34.829170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:30:34.680597Z","title":"T., Guestrin, C., and Singh, S","venue":null,"work_id":"23a567cf-1f16-4917-8496-bc2b93f65194","year":2019},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:31.909318Z"},"links":{"citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:94b0bc8aeba0aa9bebd9a3887bdd491fb4fb545711e99618decf6254a0530928","observation_id":"d13db075-ea71-430e-a719-e1007ab4d794","resolution":{"observed_at":"2026-08-06T22:30:34.720084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.04118","last_updated":"2020-05-08T15:48:31Z","snapshot_observed_at":"2026-07-06T09:18:47.555571Z","submitted_at":"2020-05-08T15:48:31Z","title":"Beyond Accuracy: Behavioral Testing of NLP models with CheckList","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.04118","snapshot_observed_at":"2026-08-06T22:30:31.993054Z","title":"T., Wu, T., Guestrin, C., and Singh, S","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:31.993054Z"},"links":{"cited_paper":"/paper/2005.04118","citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:7d89b168d483f3fc2d860dc82428232ff49b09684512ebd96a1fef90070377a5","observation_id":"1bbb4541-0b04-4f46-83a6-dcf80abbd733","resolution":{"observed_at":"2026-08-06T22:30:31.993054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:30:34.576286Z","title":"Models in the wild: On corruption robustness of neural nlp systems","venue":null,"work_id":"406299b7-aa5d-4764-a06f-8ed789dbe3bf","year":2019},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:32.060512Z"},"links":{"citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:e8d5032cb37745ed9969e8c81ecd7677dc9343be8271f3bb4b7224d0ececdf4d","observation_id":"3e4ec196-89d8-4a30-a34d-ea2f8cffbdc8","resolution":{"observed_at":"2026-08-06T22:30:34.619733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19630","last_updated":"2024-08-02T11:26:12Z","snapshot_observed_at":"2026-07-06T18:53:05.207665Z","submitted_at":"2024-07-29T01:21:11Z","title":"LLMs' Understanding of Natural Language Revealed","version":2},"cited_work":{"arxiv_id":"2407.19630","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.19630","snapshot_observed_at":"2026-08-06T22:30:33.126995Z","title":"LLMs' Understanding of Natural Language Revealed","venue":"cs.AI","work_id":"b9ebe7a3-819b-4af5-b87a-2142cd8d7aa5","year":2024},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:32.137478Z"},"links":{"cited_paper":"/paper/2407.19630","citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:cc31684466e793bc8c96dced753c26dc089b7cc5a2340b944f38ccbd1c38898e","observation_id":"756778bd-8b0b-448d-86bc-517d7c6e4844","resolution":{"observed_at":"2026-08-06T22:30:33.173737Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:30:34.486274Z","title":"everyone wants to do the model work, not the data work","venue":null,"work_id":"59abc459-3143-4bb6-85c8-6ad4193fdc30","year":2021},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:32.192447Z"},"links":{"citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:d896f46e50684fcab8a4eb848005dfa87c8b2bf3c7a8678e16baa61e69464e4a","observation_id":"2cc69fd1-3dd3-41b0-864e-6fd6c07ae10a","resolution":{"observed_at":"2026-08-06T22:30:34.533005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:30:34.409047Z","title":"H., Sch \\\"a rli, N., and Zhou, D","venue":null,"work_id":"aeee4913-ae10-48ea-bb83-f992859598b4","year":2023},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:32.275321Z"},"links":{"citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:9d376cfdf1c7ebab9cbd7123d00e520fbd51afa34fc43e527091183cebf4f89b","observation_id":"216fad6c-c506-449f-8b23-6b8a3e88fbca","resolution":{"observed_at":"2026-08-06T22:30:34.449212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:30:34.296429Z","title":"and Choi, Y","venue":null,"work_id":"171e8ad3-8100-42dc-89d2-1414054decfc","year":2020},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:32.351314Z"},"links":{"citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:28e368ee6e26338e2765fb4840aa3a97fd521aba6d071e94de71c632b21c9e61","observation_id":"016182a3-c9ea-4dc4-b952-cf87cc9e0a17","resolution":{"observed_at":"2026-08-06T22:30:34.348695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:30:34.192583Z","title":"S., Wei, J., Chung, H","venue":null,"work_id":"53ca3379-17d1-45ed-aba9-d4ae7bcc9b7f","year":2023},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:32.415105Z"},"links":{"citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:30708c2692c647d0ede27f1181d722c30bd974b8a52b7be3a16e8760b0d72a59","observation_id":"14bf4e05-0d71-4d7b-82bf-cfe53b9e85b6","resolution":{"observed_at":"2026-08-06T22:30:34.232060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.08412","last_updated":"2023-12-02T18:10:15Z","snapshot_observed_at":"2026-07-06T14:18:45.878111Z","submitted_at":"2022-11-15T18:50:34Z","title":"Evaluating the Factual Consistency of Large Language Models Through News Summarization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.08412","snapshot_observed_at":"2026-08-06T22:30:32.462098Z","title":"Evaluating the factual consistency of large language models through summarization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:32.462098Z"},"links":{"cited_paper":"/paper/2211.08412","citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:121e6c92c3387c644c38708d80eec48e6bedcbfd0d59c7b475142a60fa42f310","observation_id":"fc60529a-e377-4d7f-bff1-68ebb3aa1c42","resolution":{"observed_at":"2026-08-06T22:30:32.462098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03689","last_updated":"2024-11-10T23:47:33Z","snapshot_observed_at":"2026-07-06T18:26:15.151211Z","submitted_at":"2024-06-06T02:20:31Z","title":"Evaluating the World Model Implicit in a Generative Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03689","snapshot_observed_at":"2026-08-06T22:30:32.551668Z","title":"Y., Kleinberg, J., Mullainathan, S., and Rambachan, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:32.551668Z"},"links":{"cited_paper":"/paper/2406.03689","citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:e00b7ff2feb9fd7abb86b12e425e9e053d0b7913dcb903e635375b177eff4821","observation_id":"e7ad8acb-9e25-4e00-a2f2-9ec75fa9b2f0","resolution":{"observed_at":"2026-08-06T22:30:32.551668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01382","last_updated":"2024-06-03T14:45:21Z","snapshot_observed_at":"2026-08-05T01:23:40.882645Z","submitted_at":"2024-06-03T14:45:21Z","title":"Do Large Language Models Perform the Way People Expect? Measuring the Human Generalization Function","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01382","snapshot_observed_at":"2026-08-06T22:30:32.594808Z","title":"Do large language models perform the way people expect? measuring the human generalization function","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:32.594808Z"},"links":{"cited_paper":"/paper/2406.01382","citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:b75ff1a6441ff6f4bcccdadda995d04baa255a8c844efc92632377139b08ae72","observation_id":"c9c5fe9e-7c31-43b3-91c9-c7e8ec64e601","resolution":{"observed_at":"2026-08-06T22:30:32.594808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:30:34.113036Z","title":"On the planning abilities of large language models-a critical investigation","venue":null,"work_id":"b1df7dec-6305-4412-8ac3-7367887f6220","year":2023},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:32.648173Z"},"links":{"citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:175ae52e3e34d9dad5242ec63c34a7f6d3de80eaa8abddfa0dcf107e3a177424","observation_id":"c157b09a-1b97-49fd-b6bb-facc38aef7bc","resolution":{"observed_at":"2026-08-06T22:30:34.145704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:30:34.009426Z","title":"T., Heer, J., and Weld, D","venue":null,"work_id":"6116d788-c078-4f9b-b13e-58d17fe60d74","year":2019},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:32.704793Z"},"links":{"citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:29227d2928daa46d5e1a08fd1424a6b3de2c9c0a431d5cb08ecead4a7581c10e","observation_id":"ee7bcbd8-a32b-439c-88b7-95a1bbc9be8c","resolution":{"observed_at":"2026-08-06T22:30:34.056585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:30:33.891357Z","title":"Kformer: Knowledge injection in transformer feed-forward layers","venue":null,"work_id":"5ee78a09-9f1e-49cd-972a-5eb341ae2852","year":2022},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:32.766649Z"},"links":{"citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:ef708c54b4ce49423bb14bef3c9e89f9a6e45b66ed994c655d9730b868b16e34","observation_id":"c4931cb1-6d7c-4e55-a8b2-411fe52458cc","resolution":{"observed_at":"2026-08-06T22:30:33.948182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01470","last_updated":"2024-05-02T17:00:02Z","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:00:02Z","title":"WildChat: 1M ChatGPT Interaction Logs in the Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01470","snapshot_observed_at":"2026-08-06T22:30:32.834986Z","title":"Wildchat: 1m chatgpt interaction logs in the wild","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:32.834986Z"},"links":{"cited_paper":"/paper/2405.01470","citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:6de4f4249b81ea473b5fd2d51499dff0865ca3c698efc1715737358faf189f4f","observation_id":"360749ae-3ffb-43ba-a9d3-9645dd258d68","resolution":{"observed_at":"2026-08-06T22:30:32.834986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.00363","last_updated":"2020-12-01T09:39:13Z","snapshot_observed_at":"2026-08-05T02:17:18.735542Z","submitted_at":"2020-12-01T09:39:13Z","title":"Modifying Memories in Transformer Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.00363","snapshot_observed_at":"2026-08-06T22:30:32.913920Z","title":"S., Zaheer, M., Bhojanapalli, S., Li, D., Yu, F., and Kumar, S","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:32.913920Z"},"links":{"cited_paper":"/paper/2012.00363","citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:806a3106cde60648628f1561f992f77cf5915eaf9fc35483d30b9cce21127d86","observation_id":"0468593e-4a93-42a7-8b83-bf4510fa936e","resolution":{"observed_at":"2026-08-06T22:30:32.913920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T22:21:16.447968Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":35,"verified_exact":2,"verified_fuzzy":27},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 5 inbound Pith citation observations for arXiv:2506.21521."}