{"as_of":"2026-08-14T13:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c0ad807901ef21066f2eff4d6a742118751e7f481f85da250b971a41ad682a15","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T16:40:31.250299Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.12672/citation-record","integrity":"/paper/2509.12672/integrity","json":"/paper/2509.12672/citation-record.json","paper":"/paper/2509.12672"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.116422Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-10T12:24:50.454370Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.116422Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:d44e64259f27b94403e4e17d30b98493f175682e17f326649d311067a748164c","observation_id":"618cc52e-9b6b-4065-b6ed-9e5c3d55ef56","resolution":{"observed_at":"2026-08-04T16:40:31.116422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.120087Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-10T12:24:50.454370Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.120087Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:9e3a14730353524e47fcff2e7d73a8a4f33a655308fd79a8873b24ed92451cde","observation_id":"46cdf308-c29a-430e-aa6a-821fff51889b","resolution":{"observed_at":"2026-08-04T16:40:31.120087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.123713Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-10T12:24:50.454370Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.123713Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:6227c9a06a44645aa4534382cfcb05773f6d02f31657224fd58abbab4e5144f9","observation_id":"d3614bcb-5916-431c-86c4-dcebb732c7e2","resolution":{"observed_at":"2026-08-04T16:40:31.123713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.126880Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-10T12:24:50.454370Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.126880Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:17d1e29996fbef002d19581b5efe16bdd66f75fc9468642fa8c5287a8347d329","observation_id":"6bc19f82-69af-4133-aee9-b35823587b2e","resolution":{"observed_at":"2026-08-04T16:40:31.126880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14082","last_updated":"2024-08-23T23:02:28Z","snapshot_observed_at":"2026-07-06T18:03:38.397804Z","submitted_at":"2024-04-22T11:01:51Z","title":"Mechanistic Interpretability for AI Safety -- A Review","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14082","snapshot_observed_at":"2026-08-04T16:40:31.129847Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-10T12:24:50.454370Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.129847Z"},"links":{"cited_paper":"/paper/2404.14082","citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:5e4f53418b248a9fcdb80b9c2f0e0336f00e84c79714b59e621c8f97d7888ce7","observation_id":"b74c5b7a-dd7d-4c18-81a7-a2f8c38e83cc","resolution":{"observed_at":"2026-08-04T16:40:31.129847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08690","last_updated":"2024-04-09T22:56:05Z","snapshot_observed_at":"2026-08-13T00:33:49.581234Z","submitted_at":"2024-04-09T22:56:05Z","title":"Towards Building a Robust Toxicity Predictor","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08690","snapshot_observed_at":"2026-08-04T16:40:31.133163Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-10T12:24:50.454370Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.133163Z"},"links":{"cited_paper":"/paper/2404.08690","citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:546a90a1f14ff3f4557973f710937f124371faa41ab4dfdaa051c8c4291b0056","observation_id":"072c8864-8fc0-4f1c-94cf-4981912c04ea","resolution":{"observed_at":"2026-08-04T16:40:31.133163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.136971Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-10T12:24:50.454370Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.136971Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:ca6c21b6c11cd123b7c8c2b2533cc01bf34b69adfed237c0208063256f56ae79","observation_id":"247f0cce-2568-4a35-a002-e7f5d21532c6","resolution":{"observed_at":"2026-08-04T16:40:31.136971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.140263Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-10T12:24:50.454370Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.140263Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:e195d2a0c9ea58d19708dc2da98776edfb839f0c7ea4d53d18247d8062052c33","observation_id":"38b51520-2d7a-4a6f-9c57-3c6830720a52","resolution":{"observed_at":"2026-08-04T16:40:31.140263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.143456Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-10T12:24:50.454370Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.143456Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:c73213ec9cc518b8b0d18df3ecbb55707af84a274d757297aaa897479abae87c","observation_id":"1390aade-ade4-4013-b84e-7deb1b97cd2f","resolution":{"observed_at":"2026-08-04T16:40:31.143456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.146244Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-10T12:24:50.454370Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.146244Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:cd02c006ae6b70b8bf1e8fe801dc1cfb86846274c9a44d73dd0ce54af55d8b64","observation_id":"a1e91bfd-b394-45b8-af01-0d6b5052dbca","resolution":{"observed_at":"2026-08-04T16:40:31.146244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14997","last_updated":"2023-10-28T20:05:52Z","snapshot_observed_at":"2026-08-13T11:53:06.701897Z","submitted_at":"2023-04-28T17:36:53Z","title":"Towards Automated Circuit Discovery for Mechanistic Interpretability","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14997","snapshot_observed_at":"2026-08-04T16:40:31.149122Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-10T12:24:50.454370Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.149122Z"},"links":{"cited_paper":"/paper/2304.14997","citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:77e72d1208507dcec2f7026f2181774e594e2b580f4b2ac126bac4ae6375ac0c","observation_id":"7e2e582d-84cf-4b6f-af44-3536a0ba7fa2","resolution":{"observed_at":"2026-08-04T16:40:31.149122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-04T16:40:31.153001Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-10T12:24:50.454370Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.153001Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:91e06b3be6c1909ab74ee23cfcb6eb22905af1c4802161ecd3509266a3e416f7","observation_id":"1133c7a5-f396-47a1-9fb7-8b5b823790ba","resolution":{"observed_at":"2026-08-04T16:40:31.153001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.156541Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-10T12:24:50.454370Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.156541Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:a76ca20b48c2ebad99bfcb7cdfb7c0c67d04a1c87493dd37bdce06f15f6859e5","observation_id":"8163cfac-a653-45b1-8e2d-aaa7b94838d6","resolution":{"observed_at":"2026-08-04T16:40:31.156541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.159467Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-10T12:24:50.454370Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.159467Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:92646769b80833f1bcd86387873ff3d95064bc454ae6fc2720c6e5ea0d18a3ce","observation_id":"a59922d2-4c9d-4813-8857-b2829dc5399b","resolution":{"observed_at":"2026-08-04T16:40:31.159467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.162193Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-10T12:24:50.454370Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.162193Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:26f1f0416e2322f67aa963063119ad33e6278e5ee65b9bc0cd2641bf5ccfb7eb","observation_id":"5aaad299-99cd-4808-9824-4eb97b536c99","resolution":{"observed_at":"2026-08-04T16:40:31.162193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.165692Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-10T12:24:50.454370Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.165692Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:e00c76249855135a2235c3f3ae848fb11db85ac8d3b2c94bdece8bb0a343dd56","observation_id":"140d4b5f-71ba-4710-b87a-debafd5c72a4","resolution":{"observed_at":"2026-08-04T16:40:31.165692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.168451Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-10T12:24:50.454370Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.168451Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:709b1ac098f3d9dbd59748887bb3e51b3d3f80759539e7e5907c825b8a5c94ad","observation_id":"af396301-d35d-4ef6-a04d-098c5fb597c9","resolution":{"observed_at":"2026-08-04T16:40:31.168451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.171648Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-10T12:24:50.454370Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.171648Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:b52d570d0ed04a76465681cf9e66d1a6549ff3512fb693bdc771eadf12924062","observation_id":"94337268-ddd3-4ed5-bd4a-6ba7e201cbd3","resolution":{"observed_at":"2026-08-04T16:40:31.171648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.174811Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-10T12:24:50.454370Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.174811Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:e904987e59ecb1ecb7affdda576c3f21caecde066648f362e0774950b3c9da6a","observation_id":"26eea721-1a69-4a69-a7b5-ac85284641c2","resolution":{"observed_at":"2026-08-04T16:40:31.174811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.178582Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-10T12:24:50.454370Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.178582Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:5ba4520699a93cd143d90fa500c99be3a087827046c206744e3f8ebb7aae172f","observation_id":"50d3bb49-f4db-49aa-92d6-7022dbbacd81","resolution":{"observed_at":"2026-08-04T16:40:31.178582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.181797Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-10T12:24:50.454370Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.181797Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:1af33d0dfd131457abc5b9977e4043aa54af85c60383fb26b21262f41ddba57c","observation_id":"cc9cd95e-1d06-44e1-9fe2-c423bae08b88","resolution":{"observed_at":"2026-08-04T16:40:31.181797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.184837Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-10T12:24:50.454370Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.184837Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:9108f9d5ad80bdecc06c5872389c699ee11e9d8d1951ad48145afefe722610ed","observation_id":"cf8c2438-d63d-4082-803e-d1245e896c3f","resolution":{"observed_at":"2026-08-04T16:40:31.184837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.11176","last_updated":"2022-02-22T20:55:31Z","snapshot_observed_at":"2026-08-13T16:35:49.117838Z","submitted_at":"2022-02-22T20:55:31Z","title":"A New Generation of Perspective API: Efficient Multilingual Character-level Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.11176","snapshot_observed_at":"2026-08-04T16:40:31.187575Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-10T12:24:50.454370Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.187575Z"},"links":{"cited_paper":"/paper/2202.11176","citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:7e889cb77c2546f03f98be61a6ac26bd21018605356b232f6808ea9b8411d7be","observation_id":"a04ecd64-ce82-4bcb-b222-78843b17a1a3","resolution":{"observed_at":"2026-08-04T16:40:31.187575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.190708Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-10T12:24:50.454370Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.190708Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:097580f551ac8d4feca05248360ed6aad115df607c96433a0fa1324cc6ce194c","observation_id":"63aee8c0-e72c-4077-a558-d254dc22d77c","resolution":{"observed_at":"2026-08-04T16:40:31.190708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.193428Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-10T12:24:50.454370Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.193428Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:c76f17b93333c69541ff525c454d94a6c8a673fcb3b0e36d1e897feb815bb3cb","observation_id":"1a99733c-38c0-447e-aaf8-0988630fe711","resolution":{"observed_at":"2026-08-04T16:40:31.193428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.196217Z","title":"D.; and Finn, C","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-10T12:24:50.454370Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.196217Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:469264ff548e5e532835e5372ee3f55765271dc3a8a55f02ae1f3de724f67e86","observation_id":"c8773139-94a8-4f6e-a960-35935bf51f31","resolution":{"observed_at":"2026-08-04T16:40:31.196217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.198929Z","title":"R.; Li, G.; and Crespi, N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-10T12:24:50.454370Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.198929Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:a3673978f4eb91807256f49b3cd63f29b3002cd36115a9338387ca9e3a9ae0d0","observation_id":"b20839b2-68a0-4c99-9fbe-5a70fe119bb5","resolution":{"observed_at":"2026-08-04T16:40:31.198929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.202127Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-10T12:24:50.454370Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.202127Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:4f45bd7471b2872c96a0942bfdae304560160689642f66b9ac75a299f89a8639","observation_id":"1ff28abf-a7b1-45b6-8beb-025ff87e9613","resolution":{"observed_at":"2026-08-04T16:40:31.202127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.204983Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-10T12:24:50.454370Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.204983Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:36e3fd33d6b57dfc74e8b34081d7831a92518f8f1d47750f81b26855f607c200","observation_id":"8b40be0b-e29d-4760-b373-2f63355c226f","resolution":{"observed_at":"2026-08-04T16:40:31.204983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.207748Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-10T12:24:50.454370Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.207748Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:b51141d4009cf9ea0446054ac0e417ee48bb384ec63c3d77bc46b0a05d24b445","observation_id":"ad8a4e2f-5d17-4a7f-9ef6-42f3e805f4a1","resolution":{"observed_at":"2026-08-04T16:40:31.207748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.210447Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-10T12:24:50.454370Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.210447Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:a2e24dd995aae5846c78f446003835629880268e4cef5e3a6c8b32330f1ba5a2","observation_id":"e1b7ddb6-f539-44e8-a6dd-12d2629bb605","resolution":{"observed_at":"2026-08-04T16:40:31.210447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.213577Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-10T12:24:50.454370Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.213577Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:c8b44bde9063ff49f412e9d18d9bde76962958e5bbc09fde30517e53de003fd9","observation_id":"293bf6f3-d479-4531-a742-f2abe67f3e14","resolution":{"observed_at":"2026-08-04T16:40:31.213577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00676","last_updated":"2024-01-07T08:00:31Z","snapshot_observed_at":"2026-08-13T20:07:17.290844Z","submitted_at":"2021-03-01T01:00:09Z","title":"Token-Modification Adversarial Attacks for Natural Language Processing: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00676","snapshot_observed_at":"2026-08-04T16:40:31.216119Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-10T12:24:50.454370Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.216119Z"},"links":{"cited_paper":"/paper/2103.00676","citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:d2bfc6b641bacbbb1aa04cd82aa892f6ad11eb0285971df077aadfbe7ddbe224","observation_id":"f0ec7491-8aa0-4f1d-8f17-166cf60effcd","resolution":{"observed_at":"2026-08-04T16:40:31.216119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.219115Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-10T12:24:50.454370Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.219115Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:c4fac98a5609c90203ad2d382c6ebc85b015f4638e2e1169480ee785212cbdc1","observation_id":"cce6712f-334d-4d41-9a63-1f8030cf7501","resolution":{"observed_at":"2026-08-04T16:40:31.219115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.222044Z","title":"o ck, F.; and Wagner, C. 2021. “Call me sexist, but","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-10T12:24:50.454370Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.222044Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:f082ad15f26ed3dd638c2384e0e3e5f140b3ae9d8d5b6628679f6724798bdec3","observation_id":"8aaaba9b-adf5-48c8-a93f-43ac7d596243","resolution":{"observed_at":"2026-08-04T16:40:31.222044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18226","last_updated":"2025-03-11T08:08:05Z","snapshot_observed_at":"2026-08-13T11:32:34.719965Z","submitted_at":"2023-05-26T11:07:25Z","title":"HowkGPT: Investigating the Detection of ChatGPT-generated University Student Homework through Context-Aware Perplexity Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18226","snapshot_observed_at":"2026-08-04T16:40:31.225010Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-10T12:24:50.454370Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.225010Z"},"links":{"cited_paper":"/paper/2305.18226","citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:7e1e85b104f8a5604a14bf8478974b39ca8708570b9bbe150710b678ed5c893f","observation_id":"a2ae48b7-6b5d-4803-9419-1809e0dcd2f0","resolution":{"observed_at":"2026-08-04T16:40:31.225010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21073","last_updated":"2024-07-29T09:07:29Z","snapshot_observed_at":"2026-08-12T23:13:03.329080Z","submitted_at":"2024-07-29T09:07:29Z","title":"Enhancing Adversarial Text Attacks on BERT Models with Projected Gradient Descent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21073","snapshot_observed_at":"2026-08-04T16:40:31.227672Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-10T12:24:50.454370Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.227672Z"},"links":{"cited_paper":"/paper/2407.21073","citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:c6e18076f7c9245fe1b6fcc51e3f47b1a177675dd327d0570f3c5a9306c0e479","observation_id":"86ca1c4e-0812-4f9a-83dd-4a60ca6afa21","resolution":{"observed_at":"2026-08-04T16:40:31.227672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-04T16:40:31.230569Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-10T12:24:50.454370Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.230569Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:1bc8b2f7d33a10631d44a5267f9f22e408ec32286f1f127371875fc319ca6d09","observation_id":"4b27728d-2133-4603-9263-342399895f24","resolution":{"observed_at":"2026-08-04T16:40:31.230569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.233207Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-10T12:24:50.454370Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.233207Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:a4ab5b0af8bf085004b2f34427e98d98e6a67853076f610ae367ab180354a613","observation_id":"e72fdbae-b950-4752-92da-431093f8e751","resolution":{"observed_at":"2026-08-04T16:40:31.233207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.235984Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-10T12:24:50.454370Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.235984Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:82e2c14ce4defbbb1a027f994769678a4917497c17768aa90ef3013ff9658948","observation_id":"7b88280b-d6f3-4674-a4ee-071c97d11a47","resolution":{"observed_at":"2026-08-04T16:40:31.235984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.238745Z","title":"S.; and Wong, D","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-10T12:24:50.454370Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.238745Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:5d5060f552430f196f24e03d59a7ce2cbef2b9e1e903fc4877c2aeb8f0f31d0d","observation_id":"25799df4-b1cf-4a0a-8220-d889315bb4c5","resolution":{"observed_at":"2026-08-04T16:40:31.238745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.241698Z","title":"S.; and Wong, D","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-10T12:24:50.454370Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.241698Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:48e36bf36a97769947f043d283dbad757dea47a6d27edfbded32bbc581c4130f","observation_id":"d9849187-ef1a-42d2-ac4e-7c51ab90eeae","resolution":{"observed_at":"2026-08-04T16:40:31.241698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.244420Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-10T12:24:50.454370Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.244420Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:9c162ddc1ec3714159454120014c072835dd28b8744ff972c898d285031508b3","observation_id":"1fd0ebd5-059c-4277-aa79-70989e890b6a","resolution":{"observed_at":"2026-08-04T16:40:31.244420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.247794Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-10T12:24:50.454370Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.247794Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:1ca23db33be369212fa34ba8f97e5dbc56c3c963d7b7c0dabc0b1a0adf1c0400","observation_id":"f925dcdf-a08b-4a7c-8316-fda551ff1c15","resolution":{"observed_at":"2026-08-04T16:40:31.247794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:40:31.250299Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","snapshot_observed_at":"2026-08-10T12:24:50.454370Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-04T16:40:31.250299Z"},"links":{"citing_paper":"/paper/2509.12672"},"observation_digest":"sha256:98daecad7f96111d0f821fb0599ca8b4d4b95d045e460d9c192371306f0af6f6","observation_id":"cc5dfd60-e7b4-4b2a-9700-f45348ff631c","resolution":{"observed_at":"2026-08-04T16:40:31.250299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.12672","last_updated":"2026-05-23T09:33:32Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-10T12:24:50.454370Z","submitted_at":"2025-09-16T04:51:18Z","title":"Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":45,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2509.12672."}