{"as_of":"2026-08-11T06:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dab70f0011dc54b23b928a03f1ef90c29188bda92d4cd81bfd5b1e3aa39e99ef","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T16:19:48.082702Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T18:41:54.081628Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T00:05:50.801220Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-10T21:01:24.041556Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"cited_work":{"arxiv_id":"2501.13302","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.13302","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d7484b8a-f1b0-4283-8647-605c33f546df","year":2025},"citing_paper":{"arxiv_id":"2604.06552","last_updated":"2026-04-08T01:02:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-08T01:02:54Z","title":"To Lie or Not to Lie? Investigating The Biased Spread of Global Lies by LLMs","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-10T18:41:54.081628Z"},"links":{"cited_paper":"/paper/2501.13302","citing_paper":"/paper/2604.06552"},"observation_digest":"sha256:1de4d80c85e65282ae0a027717d858e1d91d132681938f6dcce73f56ae873a6c","observation_id":"cae08519-4457-440f-886f-b526fbb18938","resolution":{"observed_at":"2026-05-11T00:05:50.803437Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.13302/citation-record","integrity":"/paper/2501.13302/integrity","json":"/paper/2501.13302/citation-record.json","paper":"/paper/2501.13302"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-10T16:19:47.910889Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-10T21:01:24.041556Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:47.910889Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:5dade66be5c356f902171a26b53e4cb65abb71e7253febb07fe2dddeb5017eee","observation_id":"957accdd-a6af-408f-9936-4feae9a131a4","resolution":{"observed_at":"2026-08-10T16:19:47.910889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10403","last_updated":"2023-09-13T20:35:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T17:46:53Z","title":"PaLM 2 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10403","snapshot_observed_at":"2026-08-10T16:19:47.915189Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-10T21:01:24.041556Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:47.915189Z"},"links":{"cited_paper":"/paper/2305.10403","citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:96ef8704cb577d26a9d9b6a6a3224dc4e53122cae720cb84d95e3b43113b83f6","observation_id":"994b7894-04d6-4678-b01f-86d99dcb43e4","resolution":{"observed_at":"2026-08-10T16:19:47.915189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:48.551287Z","title":null,"venue":null,"work_id":"a8fb5aba-15e5-43b4-8aa6-9f7d72c2edab","year":2018},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-10T21:01:24.041556Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:47.919481Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:a4d9ecd9651b7a5575c95bc08aa24df2eee538843ab127e5f12bc98e9094a9bd","observation_id":"fdf210e6-af58-4c6f-9439-bbbd01208ec2","resolution":{"observed_at":"2026-08-10T16:19:48.555144Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:48.539095Z","title":null,"venue":null,"work_id":"8e336799-07ac-4791-8650-6b70f85fc361","year":2024},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-10T21:01:24.041556Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:47.923447Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:434ee2109de04362ef53c91c3008b666607cb259fe96160c2549cc07ee9f300f","observation_id":"b387d232-52ee-40ff-98bc-53a7a506ca64","resolution":{"observed_at":"2026-08-10T16:19:48.543327Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18932","last_updated":"2024-03-27T18:22:48Z","snapshot_observed_at":"2026-07-06T17:52:13.812196Z","submitted_at":"2024-03-27T18:22:48Z","title":"Measuring Political Bias in Large Language Models: What Is Said and How It Is Said","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18932","snapshot_observed_at":"2026-08-10T16:19:47.927230Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-10T21:01:24.041556Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:47.927230Z"},"links":{"cited_paper":"/paper/2403.18932","citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:09c09ac6761883c6153c645843b1605f8e9a8fa3ed237b0f66f73ae525e69cb7","observation_id":"94bda893-9bd1-4600-a460-f0db83ae7d79","resolution":{"observed_at":"2026-08-10T16:19:47.927230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:48.527053Z","title":null,"venue":null,"work_id":"91f4ca94-39eb-4b6d-ab7f-b58db3d5060d","year":2019},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-10T21:01:24.041556Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:47.931343Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:c132345ab17fb879d810be969d38fd7d1812c74189c58ac41685ce0725c64d7b","observation_id":"6f5ed728-a3d1-4782-85af-0560f4be0bde","resolution":{"observed_at":"2026-08-10T16:19:48.531178Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00897","last_updated":"2024-05-04T00:33:06Z","snapshot_observed_at":"2026-07-31T08:43:52.761839Z","submitted_at":"2024-04-01T03:49:42Z","title":"Machine Learning Robustness: A Primer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00897","snapshot_observed_at":"2026-08-10T16:19:47.935427Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-10T21:01:24.041556Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:47.935427Z"},"links":{"cited_paper":"/paper/2404.00897","citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:b8c6b02095f0cd2339399df4ae00d46f87b60f204ca40d5e0514c97a26aa9436","observation_id":"6aaee4bf-019f-4f79-b7d8-6cd9bc434e03","resolution":{"observed_at":"2026-08-10T16:19:47.935427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:47.939518Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-10T21:01:24.041556Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:47.939518Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:b509f7739a688b2983f9abb7ec5342338193a69886f676d901634ef5acd24045","observation_id":"40ba0447-1e27-4fa7-986e-7cfc3f37fe33","resolution":{"observed_at":"2026-08-10T16:19:47.939518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:48.507777Z","title":null,"venue":null,"work_id":"8bc80196-25a6-4a26-b42a-2f213d1e42e7","year":2024},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-10T21:01:24.041556Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:47.942816Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:b4d8a3e04b4cb5c6846515aa8182185cd945feda9e6e94f98b460f17b87ba885","observation_id":"b9a4ae2d-2986-44c0-86ae-2c1bfcfde9ab","resolution":{"observed_at":"2026-08-10T16:19:48.511482Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:48.495281Z","title":null,"venue":null,"work_id":"8ca9f4f2-8cd0-411b-a12a-6a683d593fac","year":2024},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-10T21:01:24.041556Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:47.946449Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:6552d2585be42410067bc79e175d80e4a406a362f7324b1f3fb96b666d325f5e","observation_id":"5f466b0d-35e0-453c-9b36-1ab2527b282c","resolution":{"observed_at":"2026-08-10T16:19:48.499247Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:48.483148Z","title":null,"venue":null,"work_id":"30005a5c-c288-4e98-88f3-ab9dfc2206d4","year":2023},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-10T21:01:24.041556Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:47.949889Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:e733b12ade177671446209bbb04ec6fb32d3e96001002760daf63dbf74fc4637","observation_id":"6d38a130-b64e-4e27-bce1-906b147fc153","resolution":{"observed_at":"2026-08-10T16:19:48.486852Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:48.471240Z","title":"what data benefits my classifier?","venue":null,"work_id":"f81b36d0-26b2-41b6-ac7a-a9e75cb38262","year":2024},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-10T21:01:24.041556Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:47.953417Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:86087ca101aea7d36318b80a60e44492adf6379496f0b90911a6514ee538cda1","observation_id":"6d49dfe9-edeb-466e-88ca-990fdb6f3091","resolution":{"observed_at":"2026-08-10T16:19:48.475115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:48.459733Z","title":null,"venue":null,"work_id":"a98ed67c-6072-433d-91c9-906a59eeba4b","year":2021},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-10T21:01:24.041556Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:47.956787Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:eb763ea61a73982b4f9662a2a15977dd1c7c81459b3c031fb96c019da7e2a2f1","observation_id":"01d6af94-8c05-4917-8193-7f0a93522893","resolution":{"observed_at":"2026-08-10T16:19:48.463442Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:48.447706Z","title":"Towards F air V ideo S ummarization","venue":null,"work_id":"4a7eee0f-f20d-41af-9040-63050d3f8a18","year":null},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-10T21:01:24.041556Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:47.960199Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:546fd25e90a1664a81858c3bf126e4caf36fe49388c5476c597e3461ed294fd6","observation_id":"0b158943-e49e-4194-a188-d673ef496a69","resolution":{"observed_at":"2026-08-10T16:19:48.451843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:48.435504Z","title":"https://clarifai.com/clarifai/main/models/moderation-english-text-classification","venue":null,"work_id":"6fea6a83-bd10-4694-8f36-8c1b32314ba1","year":null},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-10T21:01:24.041556Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:47.963889Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:e5f30baac45f00d6ca10d36db9131f461ebd7d4ce0d8c9a636e8e1a12d657940","observation_id":"469152dd-23c9-4741-bc33-b57b8f86194a","resolution":{"observed_at":"2026-08-10T16:19:48.439695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:47.967288Z","title":null,"venue":null,"work_id":null,"year":1960},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-10T21:01:24.041556Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:47.967288Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:c3481015c23b2f9bf4b0f86b002acbc3dcc9aa05efc047dfcccd8eb942217ead","observation_id":"833e1be4-6313-4157-b8b2-71756fda40d8","resolution":{"observed_at":"2026-08-10T16:19:47.967288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:48.416963Z","title":null,"venue":null,"work_id":"1ea58af4-42e5-4371-ac2a-7946e4a2f6cc","year":2017},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-10T21:01:24.041556Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:47.970743Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:fe7f4c1fa86759bac8a7dad178f9daafeccc5006ebb5613cb7faa13ecd2bb303","observation_id":"7eb2e53b-6f52-4a39-9029-3be0d4989878","resolution":{"observed_at":"2026-08-10T16:19:48.420477Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:47.974101Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-10T21:01:24.041556Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:47.974101Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:762496ca9d714fdc371a68f9a91e2226640651e84844dde7a7bdc15e0ab1966a","observation_id":"37171bea-4513-4777-a01f-b934a5d8eb45","resolution":{"observed_at":"2026-08-10T16:19:47.974101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:47.977419Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-10T21:01:24.041556Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:47.977419Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:a72f7a6b059aefbe62a64a25fe201d82d706021b2a53a5b2cb2fd358a0482d25","observation_id":"4e01e04b-652c-40d9-b9fe-89ec5d468370","resolution":{"observed_at":"2026-08-10T16:19:47.977419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01822","last_updated":"2024-05-29T12:57:01Z","snapshot_observed_at":"2026-08-05T10:31:48.540037Z","submitted_at":"2024-02-02T16:35:00Z","title":"Building Guardrails for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01822","snapshot_observed_at":"2026-08-10T16:19:47.980860Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-10T21:01:24.041556Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:47.980860Z"},"links":{"cited_paper":"/paper/2402.01822","citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:d8aab48502a7057f1647bb99843b117bdb5f1810efc05044a808b85249d8e9f8","observation_id":"fd54c1ef-1759-49df-99fb-9369e50a2a02","resolution":{"observed_at":"2026-08-10T16:19:47.980860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.16388","last_updated":"2024-04-12T00:05:53Z","snapshot_observed_at":"2026-07-30T00:01:16.818092Z","submitted_at":"2023-06-28T17:31:53Z","title":"Towards Measuring the Representation of Subjective Global Opinions in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.16388","snapshot_observed_at":"2026-08-10T16:19:47.984874Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-10T21:01:24.041556Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:47.984874Z"},"links":{"cited_paper":"/paper/2306.16388","citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:fb84fcd3d0a41f7d6003f1ce6c2ab71c85a3fcde9531008a85212ec50513c64a","observation_id":"1c56b1aa-31a9-4a15-ab87-aa275dbc12f6","resolution":{"observed_at":"2026-08-10T16:19:47.984874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:47.988841Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-10T21:01:24.041556Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:47.988841Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:d1ecf7b9dee106b719e3b93c7034c8948bb4c3f25b8482f2b3cddfb0aea253e5","observation_id":"ffe43d74-258e-45a0-ba09-5ebafb5619d2","resolution":{"observed_at":"2026-08-10T16:19:47.988841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.11462","last_updated":"2020-09-25T20:22:26Z","snapshot_observed_at":"2026-08-09T05:10:26.091710Z","submitted_at":"2020-09-24T03:17:19Z","title":"RealToxicityPrompts: Evaluating Neural Toxic Degeneration in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.11462","snapshot_observed_at":"2026-08-10T16:19:47.992480Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-10T21:01:24.041556Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:47.992480Z"},"links":{"cited_paper":"/paper/2009.11462","citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:8e0dc3d7c3c31841a06d182a7b35170c9a7c47dc7160944dfa668cf8ebd355e1","observation_id":"40265bf1-2d53-4cea-b645-f9dc54041843","resolution":{"observed_at":"2026-08-10T16:19:47.992480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:48.385787Z","title":null,"venue":null,"work_id":"6b1ffb57-8444-43e6-838e-00ba3009fa33","year":null},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-10T21:01:24.041556Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:47.996348Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:48e07052be0585c93969fa0d48fc956d61231449f9405cd4edbf0888dafd6573","observation_id":"4f7fc283-4ac4-4a98-8f4a-69a3027413e7","resolution":{"observed_at":"2026-08-10T16:19:48.389553Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:48.374454Z","title":null,"venue":null,"work_id":"576757e1-3f3e-47b4-b037-05662da6aa65","year":null},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-10T21:01:24.041556Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:47.999917Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:c695c9df29798f4b2957728d3a1633a63b8723a3668c2796911e209fde37ece3","observation_id":"3120bf2e-c8d9-4288-96e8-ce3b560ca2d2","resolution":{"observed_at":"2026-08-10T16:19:48.378264Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.05794","last_updated":"2022-03-11T08:35:15Z","snapshot_observed_at":"2026-07-06T12:46:41.057346Z","submitted_at":"2022-03-11T08:35:15Z","title":"BERTopic: Neural topic modeling with a class-based TF-IDF procedure","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.05794","snapshot_observed_at":"2026-08-10T16:19:48.003786Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-10T21:01:24.041556Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:48.003786Z"},"links":{"cited_paper":"/paper/2203.05794","citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:465937fcb8d51027b13335b56f93cedb87a8376a516ecd82ca4a46fe0da82ebf","observation_id":"b5a3957c-06e0-43b3-a3ec-8e97510de234","resolution":{"observed_at":"2026-08-10T16:19:48.003786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:48.363071Z","title":null,"venue":null,"work_id":"d41ecb76-74ee-4ee6-a55f-5c028084ec0f","year":2020},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-10T21:01:24.041556Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:48.007666Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:4196a03158a95f68cc4e914fdb3fe11eae4bcdf58ae15bc9b3d0a9b6b83b05fb","observation_id":"c3e0b635-8d6d-444f-89b2-965b6abd3673","resolution":{"observed_at":"2026-08-10T16:19:48.367010Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:48.011118Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-10T21:01:24.041556Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:48.011118Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:b5170137e5b8742a1e5f9a054f73f0862a2760c6b08327d9c542fb6a6877fb42","observation_id":"d24dd804-9b07-43ef-b486-3422c813e1bc","resolution":{"observed_at":"2026-08-10T16:19:48.011118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:48.345232Z","title":null,"venue":null,"work_id":"a6780110-3583-4b17-b7c0-c8f1e47a17fd","year":2017},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-10T21:01:24.041556Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:48.014641Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:d1adfce6f9b558de4696324c342f88460e6bba96bc521110c3cc832f33bbfe9a","observation_id":"9f120699-f8b7-414f-992a-24852e974628","resolution":{"observed_at":"2026-08-10T16:19:48.349006Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:48.334055Z","title":null,"venue":null,"work_id":"8d1cbfa8-0e78-4941-9a73-31c79f83e0a4","year":2022},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-10T21:01:24.041556Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:48.018074Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:6618f911f0dcc9dc4a0481544d22e085e768e813128776a616058f9819da1def","observation_id":"3b0804cd-4ab9-4b74-986a-422a78b03bca","resolution":{"observed_at":"2026-08-10T16:19:48.337606Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04451","last_updated":"2024-03-20T21:34:56Z","snapshot_observed_at":"2026-08-06T02:57:30.438059Z","submitted_at":"2023-10-03T19:44:37Z","title":"AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04451","snapshot_observed_at":"2026-08-10T16:19:48.024738Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-10T21:01:24.041556Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:48.024738Z"},"links":{"cited_paper":"/paper/2310.04451","citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:74aedd6ddb39d302739f008f8b48f9859d8d9553e9bb4b5b2a757aca865e682b","observation_id":"735f0aa3-ae13-4d38-a391-cdb011a368c0","resolution":{"observed_at":"2026-08-10T16:19:48.024738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08747","last_updated":"2025-01-05T04:09:00Z","snapshot_observed_at":"2026-08-10T01:52:30.559515Z","submitted_at":"2023-08-17T02:53:23Z","title":"An Empirical Study of Catastrophic Forgetting in Large Language Models During Continual Fine-tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08747","snapshot_observed_at":"2026-08-10T16:19:48.028776Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-10T21:01:24.041556Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:48.028776Z"},"links":{"cited_paper":"/paper/2308.08747","citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:9d837b3fe1571260196ee5b6fe06401688ff123f3063073f321d868b17af7a44","observation_id":"e62d96b7-2b9c-4e4c-a03b-dbf15871af17","resolution":{"observed_at":"2026-08-10T16:19:48.028776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:48.032831Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-10T21:01:24.041556Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:48.032831Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:a8614b4f886f871b408880b60b0b5ec23441cafead1ea332a80814cd8b89a906","observation_id":"f3ca1292-2bac-4aa4-91bc-0f9598203d2e","resolution":{"observed_at":"2026-08-10T16:19:48.032831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:48.317280Z","title":null,"venue":null,"work_id":"232be5b1-01f4-4a0c-815f-f7ab558ebe85","year":2021},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-10T21:01:24.041556Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:48.036579Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:7c10351ff928826361d2a53543cf5a59d0cc0d3ab107875aea0d2d914c53e486","observation_id":"4c83c018-6e34-4c78-8582-53e0e3149d44","resolution":{"observed_at":"2026-08-10T16:19:48.320838Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12651","last_updated":"2024-07-17T07:03:57Z","snapshot_observed_at":"2026-08-10T12:18:25.194309Z","submitted_at":"2023-12-19T22:52:51Z","title":"Toxic Bias: Perspective API Misreads German as More Toxic","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.12651","snapshot_observed_at":"2026-08-10T16:19:48.040346Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-10T21:01:24.041556Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:48.040346Z"},"links":{"cited_paper":"/paper/2312.12651","citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:0c93e7161b696ed0a13ce01523b151b21620b0f4fd9d923aa15f42f52d32009e","observation_id":"cc62cd94-0d3a-422c-b00f-eebbb86aed88","resolution":{"observed_at":"2026-08-10T16:19:48.040346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:48.305134Z","title":"https://platform.openai.com/docs/guides/moderation","venue":null,"work_id":"cbec3b01-d0b9-4397-acac-9a1bcc87caf5","year":null},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-10T21:01:24.041556Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:48.044231Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:7c091bb6a47bc6dacfeb392216630497c1f3930d0c1ec2d3c94999127807600b","observation_id":"7957712b-2d95-451e-83a7-b446cda18662","resolution":{"observed_at":"2026-08-10T16:19:48.309591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:48.294722Z","title":null,"venue":null,"work_id":"2faa20fc-1197-44cc-b244-7f0e35466df4","year":2019},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-10T21:01:24.041556Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:48.048144Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:df88b9e7fd2f04ae3513e319d9b80f4beafcb8a9edc3454db832f7ab60269d41","observation_id":"c8a19fc6-0376-434a-b9a3-6de65f6886d0","resolution":{"observed_at":"2026-08-10T16:19:48.298317Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-10T16:19:48.051712Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-10T21:01:24.041556Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:48.051712Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:d0da2b31870469e2242c493971e78e4f0875096eaa806d8a80f5173145be5f0c","observation_id":"81c6a5ad-2387-4b42-af6e-661b23d00fd4","resolution":{"observed_at":"2026-08-10T16:19:48.051712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:48.055948Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-10T21:01:24.041556Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:48.055948Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:9ade7284189abfe6d599ea0c9f6eb4bb6a8453cd1337b5a0f5322debc2c2e385","observation_id":"87807929-10c4-4f5a-acdf-3ba5921ceb0e","resolution":{"observed_at":"2026-08-10T16:19:48.055948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.01326","last_updated":"2019-10-23T18:55:16Z","snapshot_observed_at":"2026-08-10T02:41:09.905723Z","submitted_at":"2019-09-03T17:50:44Z","title":"The Woman Worked as a Babysitter: On Biases in Language Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.01326","snapshot_observed_at":"2026-08-10T16:19:48.059776Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-10T21:01:24.041556Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:48.059776Z"},"links":{"cited_paper":"/paper/1909.01326","citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:e0aea6c4026d8a55be407df5fe7e676a46569d335a7bae08a3c2fd03def63305","observation_id":"be32b94c-a11a-42f4-91ad-6f8b2e6f96a6","resolution":{"observed_at":"2026-08-10T16:19:48.059776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:48.282484Z","title":null,"venue":null,"work_id":"a484556a-3224-4453-b7c5-25fa3609b74e","year":2023},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-10T21:01:24.041556Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:48.063813Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:ea0b6bea96a55758e09c5046744331e8aeb6aeb6d8d47cc4e61ce13af6448491","observation_id":"5501aa05-f5be-4440-b8c3-fc48a7402fea","resolution":{"observed_at":"2026-08-10T16:19:48.287544Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.10420","last_updated":"2023-12-23T12:53:02Z","snapshot_observed_at":"2026-08-10T21:00:36.639546Z","submitted_at":"2023-03-18T14:02:04Z","title":"A Comprehensive Capability Analysis of GPT-3 and GPT-3.5 Series Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.10420","snapshot_observed_at":"2026-08-10T16:19:48.067303Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-10T21:01:24.041556Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:48.067303Z"},"links":{"cited_paper":"/paper/2303.10420","citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:3916ae12d6d239092f2c69817202dad7bd88805af99b07f1e512bf720ede11bd","observation_id":"8308824a-6f8c-404f-a3d3-d3f10e695b8d","resolution":{"observed_at":"2026-08-10T16:19:48.067303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06373","last_updated":"2024-01-23T22:46:12Z","snapshot_observed_at":"2026-08-10T11:13:59.778209Z","submitted_at":"2024-01-12T16:13:24Z","title":"How Johnny Can Persuade LLMs to Jailbreak Them: Rethinking Persuasion to Challenge AI Safety by Humanizing LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06373","snapshot_observed_at":"2026-08-10T16:19:48.071026Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-10T21:01:24.041556Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:48.071026Z"},"links":{"cited_paper":"/paper/2401.06373","citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:51bc484896372586c973c829229053cd1a40b97aaf18d73bd997c80108df45df","observation_id":"1c7a6349-470a-42d5-a062-b6dd14613b53","resolution":{"observed_at":"2026-08-10T16:19:48.071026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-10T16:19:48.074807Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-10T21:01:24.041556Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:48.074807Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:bc8ac6d6e5244e2b45e08da3818774d142ad01eefbeea9c8cdc032b611cdaa32","observation_id":"232e39aa-c4af-45bb-a4fa-bde25f02c480","resolution":{"observed_at":"2026-08-10T16:19:48.074807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:48.078510Z","title":"URL: \" 'urlintro :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-10T21:01:24.041556Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:48.078510Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:7d44a09d680b9087cfab2bd9271aa624b97760b4dc66e6774fb5a6464178c75b","observation_id":"4a1c3282-f29a-4686-a57d-3e52fbfca083","resolution":{"observed_at":"2026-08-10T16:19:48.078510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:19:48.082702Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","snapshot_observed_at":"2026-08-10T21:01:24.041556Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-10T16:19:48.082702Z"},"links":{"citing_paper":"/paper/2501.13302"},"observation_digest":"sha256:1a0ff27713611187a9b18acef8f5dd21e37ca02b6218b3c2092ef93b3a2d8401","observation_id":"8d0b8269-2142-4f6b-92f0-ff69ef57c879","resolution":{"observed_at":"2026-08-10T16:19:48.082702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.13302","last_updated":"2025-01-23T01:04:00Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-10T21:01:24.041556Z","submitted_at":"2025-01-23T01:04:00Z","title":"Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":0,"verified_fuzzy":4},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 1 inbound Pith citation observation for arXiv:2501.13302."}