{"as_of":"2026-08-21T00:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a56942cdd90c1caf823294cc79af93ca2b823cec1f84be73be75e938a61b5ba5","coverage":[{"denominator":19,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:28:11.181361Z","state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.07947/citation-record","integrity":"/paper/2506.07947/integrity","json":"/paper/2506.07947/citation-record.json","paper":"/paper/2506.07947"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2010.07100","last_updated":"2020-10-14T13:58:53Z","snapshot_observed_at":"2026-08-19T22:09:52.326812Z","submitted_at":"2020-10-14T13:58:53Z","title":"Re-evaluating Evaluation in Text Summarization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.07100","snapshot_observed_at":"2026-08-07T05:28:11.120511Z","title":"Re-evaluating evaluation in text summarization.arXiv preprint arXiv:2010.07100,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.07947","last_updated":"2025-06-09T17:11:07Z","snapshot_observed_at":"2026-08-16T05:42:28.140890Z","submitted_at":"2025-06-09T17:11:07Z","title":"Statistical Hypothesis Testing for Auditing Robustness in Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:28:11.120511Z"},"links":{"cited_paper":"/paper/2010.07100","citing_paper":"/paper/2506.07947"},"observation_digest":"sha256:cf280a8b49cc98fef44a79e4db7199be859acc1d125d57e835ac300174abfb7f","observation_id":"29d4592b-fa06-4d7c-803b-04f41a7120f1","resolution":{"observed_at":"2026-08-07T05:28:11.120511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6572","last_updated":"2015-03-20T20:19:16Z","snapshot_observed_at":"2026-08-19T07:17:20.004918Z","submitted_at":"2014-12-20T01:17:12Z","title":"Explaining and Harnessing Adversarial Examples","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6572","snapshot_observed_at":"2026-08-07T05:28:11.142515Z","title":"J., Shlens, J., and Szegedy, C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07947","last_updated":"2025-06-09T17:11:07Z","snapshot_observed_at":"2026-08-16T05:42:28.140890Z","submitted_at":"2025-06-09T17:11:07Z","title":"Statistical Hypothesis Testing for Auditing Robustness in Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:28:11.142515Z"},"links":{"cited_paper":"/paper/1412.6572","citing_paper":"/paper/2506.07947"},"observation_digest":"sha256:333dd7673d30c98ac5044d33ecb66d6399bbe78a4af49a5b694edf6d8d338b64","observation_id":"77c6bbc9-e814-4d60-a18c-b83fa3f9270d","resolution":{"observed_at":"2026-08-07T05:28:11.142515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.07231","last_updated":"2018-08-22T06:00:56Z","snapshot_observed_at":"2026-08-14T18:38:30.586613Z","submitted_at":"2018-08-22T06:00:56Z","title":"Reducing Gender Bias in Abusive Language Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.07231","snapshot_observed_at":"2026-08-07T05:28:11.159775Z","title":"H., Shin, J., and Fung, P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07947","last_updated":"2025-06-09T17:11:07Z","snapshot_observed_at":"2026-08-16T05:42:28.140890Z","submitted_at":"2025-06-09T17:11:07Z","title":"Statistical Hypothesis Testing for Auditing Robustness in Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:28:11.159775Z"},"links":{"cited_paper":"/paper/1808.07231","citing_paper":"/paper/2506.07947"},"observation_digest":"sha256:8ca53f4c87f2ca652fccfd6dca738298068f431f4836ad2a4eda697a8d0edff8","observation_id":"4bbcbe76-0111-4f28-b4b2-36f41321738c","resolution":{"observed_at":"2026-08-07T05:28:11.159775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12558","last_updated":"2024-04-01T21:55:06Z","snapshot_observed_at":"2026-08-18T00:47:44.502507Z","submitted_at":"2023-10-19T08:09:58Z","title":"Large Language Models Help Humans Verify Truthfulness -- Except When They Are Convincingly Wrong","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12558","snapshot_observed_at":"2026-08-07T05:28:11.165754Z","title":"T., Zhao, C., Feng, S., Daumé III, H., and Boyd-Graber, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07947","last_updated":"2025-06-09T17:11:07Z","snapshot_observed_at":"2026-08-16T05:42:28.140890Z","submitted_at":"2025-06-09T17:11:07Z","title":"Statistical Hypothesis Testing for Auditing Robustness in Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:28:11.165754Z"},"links":{"cited_paper":"/paper/2310.12558","citing_paper":"/paper/2506.07947"},"observation_digest":"sha256:6deed76d25eaf2e2ee5df8e66c758b5c996aa7de3d04f8665470a79c5f7a9c91","observation_id":"2cd5e4bc-436f-4365-9b47-c76d90088f13","resolution":{"observed_at":"2026-08-07T05:28:11.165754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00746","last_updated":"2024-06-18T13:08:24Z","snapshot_observed_at":"2026-08-19T12:40:58.780256Z","submitted_at":"2023-10-01T17:52:59Z","title":"RoleLLM: Benchmarking, Eliciting, and Enhancing Role-Playing Abilities of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00746","snapshot_observed_at":"2026-08-07T05:28:11.168723Z","title":"M., Peng, Z., Que, H., Liu, J., Zhou, W., Wu, Y ., Guo, H., Gan, R., Ni, Z., Yang, J., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07947","last_updated":"2025-06-09T17:11:07Z","snapshot_observed_at":"2026-08-16T05:42:28.140890Z","submitted_at":"2025-06-09T17:11:07Z","title":"Statistical Hypothesis Testing for Auditing Robustness in Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:28:11.168723Z"},"links":{"cited_paper":"/paper/2310.00746","citing_paper":"/paper/2506.07947"},"observation_digest":"sha256:269cf66f5d31fb547b844f7374cee39b6aaea3136a453754a8c3568ff45411eb","observation_id":"428fe31f-9dfc-4ecf-9332-74760eb580f7","resolution":{"observed_at":"2026-08-07T05:28:11.168723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-07T05:28:11.171948Z","title":"React: Synergizing reasoning and acting in language models.arXiv preprint arXiv:2210.03629,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07947","last_updated":"2025-06-09T17:11:07Z","snapshot_observed_at":"2026-08-16T05:42:28.140890Z","submitted_at":"2025-06-09T17:11:07Z","title":"Statistical Hypothesis Testing for Auditing Robustness in Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:28:11.171948Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2506.07947"},"observation_digest":"sha256:82a9e6f3a7331eb6bd5d3e1a0af513e9f85136b690f139158215d490394e5f23","observation_id":"17e6e69e-9328-4e50-8104-cb8b67cf9315","resolution":{"observed_at":"2026-08-07T05:28:11.171948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.02622","last_updated":"2019-09-26T09:56:23Z","snapshot_observed_at":"2026-08-18T00:26:27.692472Z","submitted_at":"2019-09-05T20:26:44Z","title":"MoverScore: Text Generation Evaluating with Contextualized Embeddings and Earth Mover Distance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.02622","snapshot_observed_at":"2026-08-07T05:28:11.177892Z","title":"M., and Eger, S","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2506.07947","last_updated":"2025-06-09T17:11:07Z","snapshot_observed_at":"2026-08-16T05:42:28.140890Z","submitted_at":"2025-06-09T17:11:07Z","title":"Statistical Hypothesis Testing for Auditing Robustness in Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:28:11.177892Z"},"links":{"cited_paper":"/paper/1909.02622","citing_paper":"/paper/2506.07947"},"observation_digest":"sha256:2646235e8b4b7bc1f7fb642942d91640ea3fa34adec8e753743676167dcdbaea","observation_id":"1ae77d9e-a123-457e-97d1-4f6f0074a7b8","resolution":{"observed_at":"2026-08-07T05:28:11.177892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09675","last_updated":"2020-02-24T18:59:28Z","snapshot_observed_at":"2026-07-29T15:42:51.774083Z","submitted_at":"2019-04-21T23:08:53Z","title":"BERTScore: Evaluating Text Generation with BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09675","snapshot_observed_at":"2026-08-07T05:28:11.174703Z","title":"Q., and Artzi, Y","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2506.07947","last_updated":"2025-06-09T17:11:07Z","snapshot_observed_at":"2026-08-16T05:42:28.140890Z","submitted_at":"2025-06-09T17:11:07Z","title":"Statistical Hypothesis Testing for Auditing Robustness in Language Models","version":1},"reference_index":2003,"source":"pdf_text","source_observed_at":"2026-08-07T05:28:11.174703Z"},"links":{"cited_paper":"/paper/1904.09675","citing_paper":"/paper/2506.07947"},"observation_digest":"sha256:4f95e4230b8091801eceec5ddcf4c9b853d04eaa04ba329d8fe3aeabbc9c70ef","observation_id":"4d8d9b65-ca47-4d27-99ad-70cf5a3378af","resolution":{"observed_at":"2026-08-07T05:28:11.174703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03172","last_updated":"2023-11-20T23:09:34Z","snapshot_observed_at":"2026-07-06T15:51:12.179086Z","submitted_at":"2023-07-06T17:54:11Z","title":"Lost in the Middle: How Language Models Use Long Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03172","snapshot_observed_at":"2026-08-07T05:28:11.156193Z","title":"F., Lin, K., Hewitt, J., Paranjape, A., Bevilac- qua, M., Petroni, F., and Liang, P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07947","last_updated":"2025-06-09T17:11:07Z","snapshot_observed_at":"2026-08-16T05:42:28.140890Z","submitted_at":"2025-06-09T17:11:07Z","title":"Statistical Hypothesis Testing for Auditing Robustness in Language Models","version":1},"reference_index":2004,"source":"pdf_text","source_observed_at":"2026-08-07T05:28:11.156193Z"},"links":{"cited_paper":"/paper/2307.03172","citing_paper":"/paper/2506.07947"},"observation_digest":"sha256:9f154d2808cf01608ebf55ea9c9e0d9c271c8d2de42ec56ae338c85bec917517","observation_id":"b73b1547-da50-4877-909b-94f8ff8fb7fb","resolution":{"observed_at":"2026-08-07T05:28:11.156193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.07702","last_updated":"2024-03-14T02:07:11Z","snapshot_observed_at":"2026-08-17T04:49:44.143162Z","submitted_at":"2023-08-15T11:08:30Z","title":"Better Zero-Shot Reasoning with Role-Play Prompting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.07702","snapshot_observed_at":"2026-08-07T05:28:11.152894Z","title":"Better zero-shot reasoning with role-play prompting.arXiv preprint arXiv:2308.07702,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07947","last_updated":"2025-06-09T17:11:07Z","snapshot_observed_at":"2026-08-16T05:42:28.140890Z","submitted_at":"2025-06-09T17:11:07Z","title":"Statistical Hypothesis Testing for Auditing Robustness in Language Models","version":1},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-07T05:28:11.152894Z"},"links":{"cited_paper":"/paper/2308.07702","citing_paper":"/paper/2506.07947"},"observation_digest":"sha256:1f73c5f2d901619de44d8ce29577e1f64c9fe7757bd4219abd2657a99bd7e69b","observation_id":"dc38017d-7887-44c6-9ea6-aedfd7cd2b39","resolution":{"observed_at":"2026-08-07T05:28:11.152894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05201","last_updated":"2024-10-02T20:17:49Z","snapshot_observed_at":"2026-08-20T02:17:35.566934Z","submitted_at":"2024-02-07T19:11:23Z","title":"The Effect of Sampling Temperature on Problem Solving in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05201","snapshot_observed_at":"2026-08-07T05:28:11.162864Z","title":"and Guven, E","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07947","last_updated":"2025-06-09T17:11:07Z","snapshot_observed_at":"2026-08-16T05:42:28.140890Z","submitted_at":"2025-06-09T17:11:07Z","title":"Statistical Hypothesis Testing for Auditing Robustness in Language Models","version":1},"reference_index":2010,"source":"pdf_text","source_observed_at":"2026-08-07T05:28:11.162864Z"},"links":{"cited_paper":"/paper/2402.05201","citing_paper":"/paper/2506.07947"},"observation_digest":"sha256:775ee2836a91e489c8ea6f51238b8d3f0012c9409ce4778d7ebc5fc1be2830b5","observation_id":"5d19118c-c010-4eab-a08a-2495128f71d3","resolution":{"observed_at":"2026-08-07T05:28:11.162864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14992","last_updated":"2023-10-23T07:24:28Z","snapshot_observed_at":"2026-08-15T11:39:07.998070Z","submitted_at":"2023-05-24T10:28:28Z","title":"Reasoning with Language Model is Planning with World Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14992","snapshot_observed_at":"2026-08-07T05:28:11.146164Z","title":"J., Wang, Z., Wang, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07947","last_updated":"2025-06-09T17:11:07Z","snapshot_observed_at":"2026-08-16T05:42:28.140890Z","submitted_at":"2025-06-09T17:11:07Z","title":"Statistical Hypothesis Testing for Auditing Robustness in Language Models","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-07T05:28:11.146164Z"},"links":{"cited_paper":"/paper/2305.14992","citing_paper":"/paper/2506.07947"},"observation_digest":"sha256:7d402e6d8d1254abaa0fed1f6efb63ff473a354a64b176c0a2243a662cf2efa8","observation_id":"147bf186-03e4-45d1-ab88-b11ee143e6be","resolution":{"observed_at":"2026-08-07T05:28:11.146164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.01134","last_updated":"2019-12-20T20:03:56Z","snapshot_observed_at":"2026-08-20T18:59:47.099368Z","submitted_at":"2017-11-03T12:54:51Z","title":"Accountability of AI Under the Law: The Role of Explanation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.01134","snapshot_observed_at":"2026-08-07T05:28:11.135904Z","title":"Accountability of ai under the law: The role of explanation.arXiv preprint arXiv:1711.01134,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07947","last_updated":"2025-06-09T17:11:07Z","snapshot_observed_at":"2026-08-16T05:42:28.140890Z","submitted_at":"2025-06-09T17:11:07Z","title":"Statistical Hypothesis Testing for Auditing Robustness in Language Models","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T05:28:11.135904Z"},"links":{"cited_paper":"/paper/1711.01134","citing_paper":"/paper/2506.07947"},"observation_digest":"sha256:55dc0a9cf7c08dfe88a9b4fb3b139bee573611e730f0d9dca28a4f2f4ed79bf6","observation_id":"e67ac1fe-e122-4f2a-bcdb-f818cd8f996f","resolution":{"observed_at":"2026-08-07T05:28:11.135904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11484","last_updated":"2025-01-10T02:18:01Z","snapshot_observed_at":"2026-08-16T13:33:52.135139Z","submitted_at":"2024-07-16T08:20:39Z","title":"The Oscars of AI Theater: A Survey on Role-Playing with Language Models","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11484","snapshot_observed_at":"2026-08-07T05:28:11.128582Z","title":"The oscars of ai theater: A survey on role-playing with language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07947","last_updated":"2025-06-09T17:11:07Z","snapshot_observed_at":"2026-08-16T05:42:28.140890Z","submitted_at":"2025-06-09T17:11:07Z","title":"Statistical Hypothesis Testing for Auditing Robustness in Language Models","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T05:28:11.128582Z"},"links":{"cited_paper":"/paper/2407.11484","citing_paper":"/paper/2506.07947"},"observation_digest":"sha256:bbefa4afe363217ad0999bb70e3bea6951fc6b0a038ceb51efb2fdc22d17c0a7","observation_id":"85c28076-f0a8-4bda-96a6-365fa331faa0","resolution":{"observed_at":"2026-08-07T05:28:11.128582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:28:11.374910Z","title":"Nuanced metrics for measuring unintended bias with real data for text classification","venue":null,"work_id":"7801e97b-8c6b-4e45-a3bc-efb763cf443a","year":2019},"citing_paper":{"arxiv_id":"2506.07947","last_updated":"2025-06-09T17:11:07Z","snapshot_observed_at":"2026-08-16T05:42:28.140890Z","submitted_at":"2025-06-09T17:11:07Z","title":"Statistical Hypothesis Testing for Auditing Robustness in Language Models","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T05:28:11.124720Z"},"links":{"citing_paper":"/paper/2506.07947"},"observation_digest":"sha256:be54bd66fcb907c4770bc02179e4b0cbb6472e3a7742d4d09ac733eb48f39172","observation_id":"d4e88715-6dc5-4cf4-8afd-4b96ce44151b","resolution":{"observed_at":"2026-08-07T05:28:11.377978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:28:11.356472Z","title":"H., and Beutel, A","venue":null,"work_id":"a3287eca-cd73-4469-8fe1-c126cf1b9983","year":2019},"citing_paper":{"arxiv_id":"2506.07947","last_updated":"2025-06-09T17:11:07Z","snapshot_observed_at":"2026-08-16T05:42:28.140890Z","submitted_at":"2025-06-09T17:11:07Z","title":"Statistical Hypothesis Testing for Auditing Robustness in Language Models","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T05:28:11.139337Z"},"links":{"citing_paper":"/paper/2506.07947"},"observation_digest":"sha256:38cad388e8009b09a3ddb28891c1d3864250dafec403cc6309d4efe8199e66e7","observation_id":"d28078df-5dbd-4f44-8ddd-96eab8434b9c","resolution":{"observed_at":"2026-08-07T05:28:11.359472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.05807","last_updated":"2016-11-17T16:41:21Z","snapshot_observed_at":"2026-08-15T21:21:58.666896Z","submitted_at":"2016-09-19T16:08:51Z","title":"Inherent Trade-Offs in the Fair Determination of Risk Scores","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.05807","snapshot_observed_at":"2026-08-07T05:28:11.149472Z","title":"Inherent trade-offs in the fair determination of risk scores.arXiv preprint arXiv:1609.05807,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07947","last_updated":"2025-06-09T17:11:07Z","snapshot_observed_at":"2026-08-16T05:42:28.140890Z","submitted_at":"2025-06-09T17:11:07Z","title":"Statistical Hypothesis Testing for Auditing Robustness in Language Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T05:28:11.149472Z"},"links":{"cited_paper":"/paper/1609.05807","citing_paper":"/paper/2506.07947"},"observation_digest":"sha256:7b886adadbfe33c84f1251d0081a7b5d5c0e4365cdec6a29377ed6067577b045","observation_id":"0f2037af-455c-43a2-ba48-929b64b276c9","resolution":{"observed_at":"2026-08-07T05:28:11.149472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:28:11.365867Z","title":"Measuring and mitigating unintended bias in text classification","venue":null,"work_id":"9e6f83af-11f5-4a1f-8148-af6a8a4a2d90","year":2018},"citing_paper":{"arxiv_id":"2506.07947","last_updated":"2025-06-09T17:11:07Z","snapshot_observed_at":"2026-08-16T05:42:28.140890Z","submitted_at":"2025-06-09T17:11:07Z","title":"Statistical Hypothesis Testing for Auditing Robustness in Language Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T05:28:11.132613Z"},"links":{"citing_paper":"/paper/2506.07947"},"observation_digest":"sha256:0b1250370f4336482dbe1efa1dae33e38f1a8f397d3b834e033ceda40bbc708d","observation_id":"cc23a211-5d07-40e3-ab79-55eafc25767c","resolution":{"observed_at":"2026-08-07T05:28:11.368946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:28:11.345173Z","title":"Dollar amounts are shown in parentheses for costs exceeding 100¢ (1 USD)","venue":null,"work_id":"3ae3588d-f5a2-4361-8848-a13481618a1b","year":null},"citing_paper":{"arxiv_id":"2506.07947","last_updated":"2025-06-09T17:11:07Z","snapshot_observed_at":"2026-08-16T05:42:28.140890Z","submitted_at":"2025-06-09T17:11:07Z","title":"Statistical Hypothesis Testing for Auditing Robustness in Language Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T05:28:11.181361Z"},"links":{"citing_paper":"/paper/2506.07947"},"observation_digest":"sha256:0727c81c9165b5c5f02a738a1fcda3a70d36df971ed602c4560308e334713705","observation_id":"4664fcd8-01d4-434f-8881-e3dba60bafb1","resolution":{"observed_at":"2026-08-07T05:28:11.349868Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.07947","last_updated":"2025-06-09T17:11:07Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T05:42:28.140890Z","submitted_at":"2025-06-09T17:11:07Z","title":"Statistical Hypothesis Testing for Auditing Robustness in Language Models"},"reference_resolution":{"displayed":19,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":19},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 19 of 19 outbound references and 0 inbound Pith citation observations for arXiv:2506.07947."}