{"as_of":"2026-08-12T14:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4803e51ec09c823fbfaa89ab5d24674f3427aca16f8b97c7fe9c3f64cd87acc5","coverage":[{"denominator":251,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T23:13:04.217122Z","state":"measured"},{"denominator":106,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":106,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T07:06:20.077337Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-25T07:05:26.724164Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"cited_work":{"arxiv_id":"2508.05775","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.05775","snapshot_observed_at":"2026-07-29T00:24:32.402891Z","title":"Guardians and offenders: A survey on harmful content generation and safety mitigation of llm","venue":null,"work_id":"2759a7a3-ff77-4531-92a0-e72ce18d644c","year":2025},"citing_paper":{"arxiv_id":"2602.20102","last_updated":"2026-05-21T18:01:19Z","snapshot_observed_at":"2026-08-02T14:02:01.747985Z","submitted_at":"2026-02-23T18:19:46Z","title":"BarrierSteer: LLM Safety via Learning Barrier Steering","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-25T07:02:03.058731Z"},"links":{"cited_paper":"/paper/2508.05775","citing_paper":"/paper/2602.20102"},"observation_digest":"sha256:ea4f4378a4f93e88c9120117a98e6997c00db6025c4f66675d5808899d59bfcf","observation_id":"56e7e935-1af9-4a4d-aa2f-86ed48c0b5b6","resolution":{"observed_at":"2026-07-29T00:24:32.402891Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"cited_work":{"arxiv_id":"2508.05775","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.05775","snapshot_observed_at":"2026-07-29T00:24:32.402891Z","title":"Guardians and offenders: A survey on harmful content generation and safety mitigation of llm","venue":null,"work_id":"2759a7a3-ff77-4531-92a0-e72ce18d644c","year":2025},"citing_paper":{"arxiv_id":"2604.11663","last_updated":"2026-04-13T16:11:38Z","snapshot_observed_at":"2026-08-11T01:52:32.553221Z","submitted_at":"2026-04-13T16:11:38Z","title":"Why Do Large Language Models Generate Harmful Content?","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T15:31:13.545599Z"},"links":{"cited_paper":"/paper/2508.05775","citing_paper":"/paper/2604.11663"},"observation_digest":"sha256:f86180e663fa2da18a70d71a9ca5472aeb607797e5aa205fd6099e2cc117354d","observation_id":"9b2ca48d-322a-4c1d-9ec2-44a2779397db","resolution":{"observed_at":"2026-07-29T00:24:32.402891Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"cited_work":{"arxiv_id":"2508.05775","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.05775","snapshot_observed_at":"2026-07-29T00:24:32.402891Z","title":"Guardians and offenders: A survey on harmful content generation and safety mitigation of llm","venue":null,"work_id":"2759a7a3-ff77-4531-92a0-e72ce18d644c","year":2025},"citing_paper":{"arxiv_id":"2605.05630","last_updated":"2026-05-12T16:52:21Z","snapshot_observed_at":"2026-08-11T16:37:02.295676Z","submitted_at":"2026-05-07T03:35:31Z","title":"One Turn Too Late: Response-Aware Defense Against Hidden Malicious Intent in Multi-Turn Dialogue","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-08T11:17:19.079380Z"},"links":{"cited_paper":"/paper/2508.05775","citing_paper":"/paper/2605.05630"},"observation_digest":"sha256:3c687dbec3d9a49a37c64a4d3e2aa4424e2e2d18da036f380f439011a9669fdc","observation_id":"ee3c235e-d736-4b70-b9b0-507b8df37bea","resolution":{"observed_at":"2026-07-29T00:24:32.402891Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"cited_work":{"arxiv_id":"2508.05775","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.05775","snapshot_observed_at":"2026-07-29T00:24:32.402891Z","title":"Guardians and offenders: A survey on harmful content generation and safety mitigation of llm","venue":null,"work_id":"2759a7a3-ff77-4531-92a0-e72ce18d644c","year":2025},"citing_paper":{"arxiv_id":"2605.05630","last_updated":"2026-05-12T16:52:21Z","snapshot_observed_at":"2026-08-11T16:37:02.295676Z","submitted_at":"2026-05-07T03:35:31Z","title":"One Turn Too Late: Response-Aware Defense Against Hidden Malicious Intent in Multi-Turn Dialogue","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-13T07:53:06.928500Z"},"links":{"cited_paper":"/paper/2508.05775","citing_paper":"/paper/2605.05630"},"observation_digest":"sha256:f9f3cbcd4ca11a80d47631ea74a5791dc39d8a9e3b4cb844b3647ad2127713c4","observation_id":"9c3d6022-748a-4c66-b3d8-d7f6c01daa7a","resolution":{"observed_at":"2026-07-29T00:24:32.402891Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"cited_work":{"arxiv_id":"2508.05775","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.05775","snapshot_observed_at":"2026-07-29T00:24:32.402891Z","title":"Guardians and offenders: A survey on harmful content generation and safety mitigation of llm","venue":null,"work_id":"2759a7a3-ff77-4531-92a0-e72ce18d644c","year":2025},"citing_paper":{"arxiv_id":"2605.14859","last_updated":"2026-05-15T03:53:20Z","snapshot_observed_at":"2026-07-06T23:26:13.644646Z","submitted_at":"2026-05-14T14:05:58Z","title":"Do Coding Agents Understand Least-Privilege Authorization?","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-19T16:34:14.379419Z"},"links":{"cited_paper":"/paper/2508.05775","citing_paper":"/paper/2605.14859"},"observation_digest":"sha256:ff5406f7f84e6d43c559a168072801a6beed631fff9e0e9000af0cee88fdd85e","observation_id":"a6083394-f2d9-440b-aa9c-11737631a9ca","resolution":{"observed_at":"2026-07-29T00:24:32.402891Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05775","snapshot_observed_at":"2026-08-02T07:06:20.077337Z","title":"Guardians and offenders: A survey on harmful content generation and safety mitigation of LLM, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13078","last_updated":"2026-07-12T22:34:02Z","snapshot_observed_at":"2026-08-09T02:07:52.896888Z","submitted_at":"2026-07-12T22:34:02Z","title":"Operational Evidence Gaps for LLMs in Fraud Detection and Trust-and-Safety Workflows","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T07:06:20.077337Z"},"links":{"cited_paper":"/paper/2508.05775","citing_paper":"/paper/2607.13078"},"observation_digest":"sha256:eb7d3b14980c5e9abd52425b04ae545541f7e10934808d67cbc0c1b60a29a07e","observation_id":"62ac8f37-4f52-40ad-b1cc-44d7042493d1","resolution":{"observed_at":"2026-08-02T07:06:20.077337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.05775/citation-record","integrity":"/paper/2508.05775/integrity","json":"/paper/2508.05775/citation-record.json","paper":"/paper/2508.05775"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-05T23:12:59.700739Z","title":"arXiv preprint arXiv:2204.05862 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T23:12:59.700739Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:20effafba0d730de3e86532fab4c3d983a795a0efd19a57c6d3abc1a82dca711","observation_id":"261d18ad-fab4-4f43-9dd3-ecb088b7fbac","resolution":{"observed_at":"2026-08-05T23:12:59.700739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02705","last_updated":"2025-02-04T19:47:09Z","snapshot_observed_at":"2026-07-06T16:15:00.517258Z","submitted_at":"2023-09-06T04:37:20Z","title":"Certifying LLM Safety against Adversarial Prompting","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02705","snapshot_observed_at":"2026-08-05T23:12:59.802317Z","title":"arXiv preprint arXiv:2309.02705 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T23:12:59.802317Z"},"links":{"cited_paper":"/paper/2309.02705","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:242f316afab796eb022ab8b27f7c978a15c85513f33c7b628d414419bc24c250","observation_id":"df7a80e7-73ef-4c35-b707-6f4833e9d6b6","resolution":{"observed_at":"2026-08-05T23:12:59.802317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:12:59.919407Z","title":"and Arora, Simran and Mazeika, Manias and Hendrycks, Dan and Lin, Zinan and Cheng, Yu and Koyejo, Sanmi and Song, Dawn and Li, Bo , title =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T23:12:59.919407Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:37e2bd3ab2b1cd2884c2f7fa74ed101d538f1c6467a2f8c9fb0341ba1e5ef5fd","observation_id":"47a90b26-9d41-46ec-b784-b65d7cb3fdac","resolution":{"observed_at":"2026-08-05T23:12:59.919407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11507","last_updated":"2023-06-20T12:53:39Z","snapshot_observed_at":"2026-08-10T23:17:37.809729Z","submitted_at":"2023-06-20T12:53:39Z","title":"TrustGPT: A Benchmark for Trustworthy and Responsible Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11507","snapshot_observed_at":"2026-08-05T23:13:00.005776Z","title":"arXiv preprint arXiv:2306.11507 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:00.005776Z"},"links":{"cited_paper":"/paper/2306.11507","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:6399c22f58c83a423782eba2656aec0a81b1a15e4573ebab5ec9c627743bd13b","observation_id":"8b639068-14e2-43aa-bcb9-7271a1414879","resolution":{"observed_at":"2026-08-05T23:13:00.005776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:00.104978Z","title":"Discourse & Society , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:00.104978Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:dc54f055f78946189117fd05ca019f8fdba4f5b0a417bc5cd37919b9f55f70a5","observation_id":"caaf4c2e-3351-4090-8fc0-c064cb0b8f5f","resolution":{"observed_at":"2026-08-05T23:13:00.104978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:00.181127Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:00.181127Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:1dc6bdb6511caa5c418498411326e1f832bd8be0784664cabe7f9d549c909859","observation_id":"56cbbbe5-c55e-4f2c-a79d-55d70c7ac078","resolution":{"observed_at":"2026-08-05T23:13:00.181127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:00.321368Z","title":"Proceedings of the 26th International Symposium on Research in Attacks, Intrusions and Defenses , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:00.321368Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:d9af4c15959bf57f52aea24731906fc4760cbd61c322f185278bddf9c8981efc","observation_id":"31ebaa58-fc08-479b-8ccd-d8f0970e2863","resolution":{"observed_at":"2026-08-05T23:13:00.321368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:00.411654Z","title":"Findings of the association for computational linguistics: EMNLP 2023 , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:00.411654Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:8f2adc2ee46c0c0c5096d9dd86f8c93cfe273ada32293b7e7e3a2ca69da3a689","observation_id":"3024722d-7cfa-4993-86b6-52c8b1367780","resolution":{"observed_at":"2026-08-05T23:13:00.411654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:00.524651Z","title":"IEEE Transactions on Cognitive and Developmental Systems , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:00.524651Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:e8c7214901e4c96e651689d7b90aef8fb6b62f84cf7fac2a9a9659f8345d03e1","observation_id":"b62dcf92-388f-4ed0-812f-e6cd008e0d32","resolution":{"observed_at":"2026-08-05T23:13:00.524651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:00.699894Z","title":"Proceedings of the 2022 ACM SIGSAC Conference on Computer and Communications Security , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:00.699894Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:c81557e0b8ff166a55dad7e3dad2221a75bdfdf291b9b80c357656022285e451","observation_id":"1852a291-a39b-4b13-9bd1-39bd7f229e87","resolution":{"observed_at":"2026-08-05T23:13:00.699894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:00.793432Z","title":"Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:00.793432Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:ef7c330c2c8fc968be14dd6fdf659532b045273d3ca1ee83f3ab1b5e2214e60f","observation_id":"7bce24a2-e0a2-49ac-ba41-f6ce07a77dcd","resolution":{"observed_at":"2026-08-05T23:13:00.793432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13926","last_updated":"2024-02-21T16:46:36Z","snapshot_observed_at":"2026-08-10T20:45:38.762244Z","submitted_at":"2024-02-21T16:46:36Z","title":"Large Language Models are Vulnerable to Bait-and-Switch Attacks for Generating Harmful Content","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13926","snapshot_observed_at":"2026-08-05T23:13:00.922194Z","title":"arXiv preprint arXiv:2402.13926 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:00.922194Z"},"links":{"cited_paper":"/paper/2402.13926","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:eaf744bec32011cd35ca8b242f86070586f2b247c30ca56fa6ff3705f9c4af07","observation_id":"588c10bd-6657-46d9-8169-db93e98a0fa8","resolution":{"observed_at":"2026-08-05T23:13:00.922194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11459","last_updated":"2024-10-15T10:07:15Z","snapshot_observed_at":"2026-07-06T19:33:43.723135Z","submitted_at":"2024-10-15T10:07:15Z","title":"Jigsaw Puzzles: Splitting Harmful Questions to Jailbreak Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11459","snapshot_observed_at":"2026-08-05T23:13:01.081890Z","title":"arXiv preprint arXiv:2410.11459 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:01.081890Z"},"links":{"cited_paper":"/paper/2410.11459","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:0e45fecf55280cb6d3dbc11eb91ab954c6ed6ce8f3c3abd9092ecdb407b3db88","observation_id":"8cdb97cf-27b1-4e68-9b34-49645946c50e","resolution":{"observed_at":"2026-08-05T23:13:01.081890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:01.164060Z","title":"Security and Communication Networks , volume=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:01.164060Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:78e3a920a9db3605baaa3bf029377d8729d303d5d1eba75998ba0d2c9c8a881e","observation_id":"0f7c2101-7c04-434e-bff4-bf7a40f3b1d4","resolution":{"observed_at":"2026-08-05T23:13:01.164060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:01.264593Z","title":"Proceedings of the First Workshop on Social Influence in Conversations (SICon 2023) , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:01.264593Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:f6a0b4a559853e0f43b0fa83fe61cb8e4fb86d462dd4eff086b5d5648f9f1013","observation_id":"af481b02-ce75-483f-923f-36f1c96e498c","resolution":{"observed_at":"2026-08-05T23:13:01.264593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08487","last_updated":"2023-11-14T19:28:51Z","snapshot_observed_at":"2026-08-04T07:57:38.773202Z","submitted_at":"2023-11-14T19:28:51Z","title":"Alignment is not sufficient to prevent large language models from generating harmful information: A psychoanalytic perspective","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08487","snapshot_observed_at":"2026-08-05T23:13:01.410828Z","title":"arXiv preprint arXiv:2311.08487 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:01.410828Z"},"links":{"cited_paper":"/paper/2311.08487","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:01eeeafed4dce5504c3731f865ecc9c33353ffca6c3dfacd0589336ba760e111","observation_id":"bc88f121-4999-4919-9bfb-05db88f4f74a","resolution":{"observed_at":"2026-08-05T23:13:01.410828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.14003","last_updated":"2023-02-27T17:47:53Z","snapshot_observed_at":"2026-08-10T20:19:34.590333Z","submitted_at":"2023-02-27T17:47:53Z","title":"Systematic Rectification of Language Models via Dead-end Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.14003","snapshot_observed_at":"2026-08-05T23:13:01.483650Z","title":"arXiv preprint arXiv:2302.14003 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:01.483650Z"},"links":{"cited_paper":"/paper/2302.14003","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:389f5865316d45996669384206dbe064a9462ab755c60d0037f72d6e88132ad7","observation_id":"3be65711-c14d-4c93-828e-947d429cc5fc","resolution":{"observed_at":"2026-08-05T23:13:01.483650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04921","last_updated":"2023-11-03T00:17:08Z","snapshot_observed_at":"2026-08-11T10:54:49.633600Z","submitted_at":"2023-11-03T00:17:08Z","title":"Successor Features for Efficient Multisubject Controlled Text Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04921","snapshot_observed_at":"2026-08-05T23:13:01.514336Z","title":"arXiv preprint arXiv:2311.04921 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:01.514336Z"},"links":{"cited_paper":"/paper/2311.04921","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:dd2a4caf9d5b112b81e20433d15a899e6b576eddc2f214180242f27de3eacb4b","observation_id":"f5f12ff1-141f-460e-8f75-c76ff8b69b78","resolution":{"observed_at":"2026-08-05T23:13:01.514336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19299","last_updated":"2024-05-29T17:26:52Z","snapshot_observed_at":"2026-07-06T18:22:10.094519Z","submitted_at":"2024-05-29T17:26:52Z","title":"Expert-Guided Extinction of Toxic Tokens for Debiased Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19299","snapshot_observed_at":"2026-08-05T23:13:01.555889Z","title":"arXiv preprint arXiv:2405.19299 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:01.555889Z"},"links":{"cited_paper":"/paper/2405.19299","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:a8aa3ac22945d37b23345183d98a05fd5e74a9fbe806122b31b8bf8ca7b3c130","observation_id":"699178a1-2ce7-42cb-8f5a-055746c3e91c","resolution":{"observed_at":"2026-08-05T23:13:01.555889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12900","last_updated":"2024-05-21T16:14:55Z","snapshot_observed_at":"2026-08-12T05:09:59.488266Z","submitted_at":"2024-05-21T16:14:55Z","title":"Adversarial DPO: Harnessing Harmful Data for Reducing Toxicity with Minimal Impact on Coherence and Evasiveness in Dialogue Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12900","snapshot_observed_at":"2026-08-05T23:13:01.607883Z","title":"arXiv preprint arXiv:2405.12900 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:01.607883Z"},"links":{"cited_paper":"/paper/2405.12900","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:d4eca9e6951690900eb8017e125e76f1ffd7b430de95dba67e262d8cf259b9d2","observation_id":"cfde5f27-fd0a-4007-bba6-ae62fc3df428","resolution":{"observed_at":"2026-08-05T23:13:01.607883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05143","last_updated":"2024-04-08T01:54:28Z","snapshot_observed_at":"2026-08-07T21:47:40.387844Z","submitted_at":"2024-04-08T01:54:28Z","title":"Plug and Play with Prompts: A Prompt Tuning Approach for Controlling Text Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05143","snapshot_observed_at":"2026-08-05T23:13:01.681830Z","title":"arXiv preprint arXiv:2404.05143 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:01.681830Z"},"links":{"cited_paper":"/paper/2404.05143","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:c7a0d1f4d2ef5c487c709b34d9297acc40e314a903e9ff9463f8e156f322a523","observation_id":"78d438c3-a207-46c7-ae91-31d8267607d5","resolution":{"observed_at":"2026-08-05T23:13:01.681830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:01.769771Z","title":"2024 IEEE Security and Privacy Workshops (SPW) , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:01.769771Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:d53cdbd28b146cf5a431397cf81a4b25293d054ba4f555bcd1c8be74cf298120","observation_id":"1fdd39d6-cfdd-4101-a7fb-caaac4a64647","resolution":{"observed_at":"2026-08-05T23:13:01.769771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:01.803231Z","title":"I’m fully who I am","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:01.803231Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:412f6fca8745c8d18ba8738eb49f51c50799013a70ec579ef43c6663d89552b6","observation_id":"32390486-8e5d-4ff5-916e-cbf37a9521c9","resolution":{"observed_at":"2026-08-05T23:13:01.803231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15336","last_updated":"2023-05-24T16:49:51Z","snapshot_observed_at":"2026-07-06T15:32:39.787935Z","submitted_at":"2023-05-24T16:49:51Z","title":"From Text to MITRE Techniques: Exploring the Malicious Use of Large Language Models for Generating Cyber Attack Payloads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15336","snapshot_observed_at":"2026-08-05T23:13:01.893879Z","title":"arXiv preprint arXiv:2305.15336 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:01.893879Z"},"links":{"cited_paper":"/paper/2305.15336","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:f9f334c1c20ae1b6f8006d1f9e1dbba5884dfaee86175c96dc5a69bb51b72824","observation_id":"fed7984b-8f98-4228-b648-4a15ac91245a","resolution":{"observed_at":"2026-08-05T23:13:01.893879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:01.986502Z","title":"Scientific Reports , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:01.986502Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:3d70706206fb6950742b53a340f1e9dee5ec95958fb5efd76ea0a975fa6af97f","observation_id":"988ccafc-7a5e-4aaa-8ef2-6504b7d2a28e","resolution":{"observed_at":"2026-08-05T23:13:01.986502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:02.013049Z","title":"Otolaryngology--Head and Neck Surgery , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:02.013049Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:977089cb4a04ef21dab9fef618e005f8f5d9419f117b7f7c73d78bbe8dfa51bc","observation_id":"ae41fc50-c3db-4742-887b-f06e3f739fa2","resolution":{"observed_at":"2026-08-05T23:13:02.013049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:02.039730Z","title":"The 2024 ACM Conference on Fairness, Accountability, and Transparency , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:02.039730Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:14fe219965546eba89f25ba9c1e555a9e0a6de2ce2a8c088fa3460eec9b13f0d","observation_id":"b8bb058e-c906-4d8a-880f-626b48f65a86","resolution":{"observed_at":"2026-08-05T23:13:02.039730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:02.115290Z","title":"The 2024 ACM Conference on Fairness, Accountability, and Transparency , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:02.115290Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:1c880231c597286b553b79cb344c704922df8daf55b3ff6660a6d397b861bec5","observation_id":"d56f67aa-6057-4433-8d0b-4a4e33158069","resolution":{"observed_at":"2026-08-05T23:13:02.115290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19497","last_updated":"2024-06-27T19:26:11Z","snapshot_observed_at":"2026-07-06T18:38:09.490968Z","submitted_at":"2024-06-27T19:26:11Z","title":"Inclusivity in Large Language Models: Personality Traits and Gender Bias in Scientific Abstracts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19497","snapshot_observed_at":"2026-08-05T23:13:02.198098Z","title":"arXiv preprint arXiv:2406.19497 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:02.198098Z"},"links":{"cited_paper":"/paper/2406.19497","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:28d1866691d8225ea280154673fe658281f68c64a37c8bd1a8bc103b72dc2d0d","observation_id":"4c0ad005-a921-4062-870c-d34e4c8d7ed4","resolution":{"observed_at":"2026-08-05T23:13:02.198098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01270","last_updated":"2024-09-30T16:39:51Z","snapshot_observed_at":"2026-08-09T01:38:15.671346Z","submitted_at":"2024-07-01T13:21:33Z","title":"The African Woman is Rhythmic and Soulful: An Investigation of Implicit Biases in LLM Open-ended Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01270","snapshot_observed_at":"2026-08-05T23:13:02.239622Z","title":"arXiv preprint arXiv:2407.01270 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:02.239622Z"},"links":{"cited_paper":"/paper/2407.01270","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:7be8590d026f3d4a0081ab16439158400ab2624a3471420d9d2cc8f2e4fd9d0b","observation_id":"fe70d7f0-6775-42a6-bfbb-7b348e29d36b","resolution":{"observed_at":"2026-08-05T23:13:02.239622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:02.263456Z","title":"TATuP-Zeitschrift f","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:02.263456Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:ac3f03f6927a2850a0d18809d5cc084084476daf498c3ccca62fd1b2d4a55b75","observation_id":"3af60680-828a-4fa1-978f-01de151e4a68","resolution":{"observed_at":"2026-08-05T23:13:02.263456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:02.311367Z","title":"Gender Bias in Decision-Making with Large Language Models: A Study of Relationship Conflicts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:02.311367Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:9b482e25a6c2a42f5d1de81c5cfc4f391604f9286ed08217d78b30a3cef86f57","observation_id":"1d570c05-8e04-4d25-a096-1c8596171a84","resolution":{"observed_at":"2026-08-05T23:13:02.311367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:02.418496Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:02.418496Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:997c00062c55fab01c3b05688f7b6dc9084bcf368cdcc083dfc072fdaecad90d","observation_id":"66a13d2b-461c-4acf-bf25-6351a60fde69","resolution":{"observed_at":"2026-08-05T23:13:02.418496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12505","last_updated":"2023-10-19T06:15:05Z","snapshot_observed_at":"2026-08-09T11:31:22.019671Z","submitted_at":"2023-10-19T06:15:05Z","title":"Attack Prompt Generation for Red Teaming and Defending Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12505","snapshot_observed_at":"2026-08-05T23:13:02.478257Z","title":"arXiv preprint arXiv:2310.12505 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:02.478257Z"},"links":{"cited_paper":"/paper/2310.12505","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:54c6441f70b683faca3dcdc83f1f2012d43471dc2d2b63aa1c9a568513417dde","observation_id":"cbef038d-dd7b-4ab2-abae-e276cb072e90","resolution":{"observed_at":"2026-08-05T23:13:02.478257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09132","last_updated":"2024-07-08T12:10:58Z","snapshot_observed_at":"2026-08-10T10:55:29.255216Z","submitted_at":"2024-02-14T12:28:38Z","title":"Exploring the Adversarial Capabilities of Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09132","snapshot_observed_at":"2026-08-05T23:13:02.527686Z","title":"arXiv preprint arXiv:2402.09132 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:02.527686Z"},"links":{"cited_paper":"/paper/2402.09132","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:3956c4f368118b0ffa4b69a39d0dfb266aa37878afe1b7ee6c64dd6264fb033e","observation_id":"b58ed619-db02-496a-ac0b-a68b93782ad9","resolution":{"observed_at":"2026-08-05T23:13:02.527686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06924","last_updated":"2024-06-06T22:58:32Z","snapshot_observed_at":"2026-08-05T22:43:54.622072Z","submitted_at":"2023-12-12T01:39:29Z","title":"Safety Alignment in NLP Tasks: Weakly Aligned Summarization as an In-Context Attack","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06924","snapshot_observed_at":"2026-08-05T23:13:02.596616Z","title":"arXiv preprint arXiv:2312.06924 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:02.596616Z"},"links":{"cited_paper":"/paper/2312.06924","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:5ec972c909517503fec88cdd7d6782a396ac45408e4f213ae586ea6328850ef8","observation_id":"f4f56dd4-36fb-4e56-8077-3db47afe5ee1","resolution":{"observed_at":"2026-08-05T23:13:02.596616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00787","last_updated":"2024-09-01T17:40:04Z","snapshot_observed_at":"2026-08-09T22:54:13.194666Z","submitted_at":"2024-09-01T17:40:04Z","title":"The Dark Side of Human Feedback: Poisoning Large Language Models via User Inputs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00787","snapshot_observed_at":"2026-08-05T23:13:02.685636Z","title":"arXiv preprint arXiv:2409.00787 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:02.685636Z"},"links":{"cited_paper":"/paper/2409.00787","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:240e34ee060ff64a6f6282f7c1f51a21905d73bb3e0016abb2503774a4f4dc3b","observation_id":"485469a0-bdc5-4ccf-80e5-84675f2a08ea","resolution":{"observed_at":"2026-08-05T23:13:02.685636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08776","last_updated":"2024-10-14T15:04:51Z","snapshot_observed_at":"2026-08-11T05:46:50.725575Z","submitted_at":"2024-10-11T12:49:05Z","title":"F2A: An Innovative Approach for Prompt Injection by Utilizing Feign Security Detection Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08776","snapshot_observed_at":"2026-08-05T23:13:02.828938Z","title":"arXiv preprint arXiv:2410.08776 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:02.828938Z"},"links":{"cited_paper":"/paper/2410.08776","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:8ac4b7605c95e9f2191e5ed01b06a3a576afcdafee07b9a254e4a4ec5a540630","observation_id":"042ae570-0dfa-4358-bcfb-f09ecfaf014c","resolution":{"observed_at":"2026-08-05T23:13:02.828938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:02.907233Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:02.907233Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:25d70d78d27e9996da1bb189496ce345c04a1c29f37796309021052bca3c9339","observation_id":"79103127-ed0f-494b-82bf-a8c035d439d7","resolution":{"observed_at":"2026-08-05T23:13:02.907233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:02.998152Z","title":"NeurIPS 2023 Workshop on Instruction Tuning and Instruction Following , year=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:02.998152Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:bfef58ed92144677ab2382d029eea964942c91d9bdc556a835d17df7423c935c","observation_id":"ce3e6df4-cdd3-46e3-8ef4-7ed728a81656","resolution":{"observed_at":"2026-08-05T23:13:02.998152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:03.063808Z","title":"Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:03.063808Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:d0bfbb1a294ca5eeb8e5380da27e6df960ef82d47faf133b86d17e4bdb7b815e","observation_id":"40bdc7da-2a16-4037-9803-63721fd03371","resolution":{"observed_at":"2026-08-05T23:13:03.063808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:03.146442Z","title":"Fifty Shades of Bias","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:03.146442Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:ee29e4a641504e8bfff9a1a4ade1d95a055742f28306343edca2a2c6ddd2f848","observation_id":"173e19ea-556e-41c7-b0b1-fbe63074ad43","resolution":{"observed_at":"2026-08-05T23:13:03.146442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:03.198820Z","title":"K o C o S a: K orean Context-aware Sarcasm Detection Dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:03.198820Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:80a94670856924bb56a5fda34aa342adb54cc5c13e479f1b62467386e33f3df0","observation_id":"78ea9e60-7d1d-44ab-baff-8594fc267619","resolution":{"observed_at":"2026-08-05T23:13:03.198820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12010","last_updated":"2024-04-18T09:02:45Z","snapshot_observed_at":"2026-08-10T14:39:25.342994Z","submitted_at":"2024-04-18T09:02:45Z","title":"ParaFusion: A Large-Scale LLM-Driven English Paraphrase Dataset Infused with High-Quality Lexical and Syntactic Diversity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12010","snapshot_observed_at":"2026-08-05T23:13:03.303646Z","title":"arXiv preprint arXiv:2404.12010 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:03.303646Z"},"links":{"cited_paper":"/paper/2404.12010","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:076cf6b3826644b770ea7db10e8cc79a9e734233d62c1e109c29c9f41f254cba","observation_id":"0203ae01-2eae-47bf-a360-bd268aa7305e","resolution":{"observed_at":"2026-08-05T23:13:03.303646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:03.368332Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:03.368332Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:aff1f8aa16ab8656f56246368593d74853b3b34b5aadc165250565bd14d6642d","observation_id":"2eb00353-2d98-4488-94c3-cc9b9f61f1b9","resolution":{"observed_at":"2026-08-05T23:13:03.368332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:03.407488Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 2: Short Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:03.407488Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:79b289fa255eb5f44bb156812e5bd2670def546f93e1c349d8bc1e9b8acead28","observation_id":"7673df10-b083-4358-b07d-637e107f30ab","resolution":{"observed_at":"2026-08-05T23:13:03.407488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14429","last_updated":"2023-10-22T22:25:14Z","snapshot_observed_at":"2026-08-10T12:37:55.635738Z","submitted_at":"2023-10-22T22:25:14Z","title":"Text generation for dataset augmentation in security classification tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14429","snapshot_observed_at":"2026-08-05T23:13:03.471388Z","title":"arXiv preprint arXiv:2310.14429 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:03.471388Z"},"links":{"cited_paper":"/paper/2310.14429","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:dbf4cede34542a9a9748894946784e7146c6d6e341b05be4e652eaadae5f301a","observation_id":"14afb384-feac-4544-b26d-75ad2f90ccbd","resolution":{"observed_at":"2026-08-05T23:13:03.471388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-08-12T13:34:27.233802Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-05T23:13:03.550174Z","title":"arXiv preprint arXiv:2306.09442 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:03.550174Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:78f7309ec98b768fee4299f182b91182260889fba4bdfb49bd769bc99fb890cb","observation_id":"8fa9f4d3-d632-40d9-a50d-d4ed6826d947","resolution":{"observed_at":"2026-08-05T23:13:03.550174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:03.580538Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:03.580538Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:f6eec57f51d1a8688a6a040986aa9eb931ac6e7e2d9dbee66892f5dfd8446ccd","observation_id":"4b0c8281-d9ad-4be3-88b5-307123e3bc52","resolution":{"observed_at":"2026-08-05T23:13:03.580538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13768","last_updated":"2023-08-26T05:20:58Z","snapshot_observed_at":"2026-07-06T16:10:38.925065Z","submitted_at":"2023-08-26T05:20:58Z","title":"Adversarial Fine-Tuning of Language Models: An Iterative Optimisation Approach for the Generation and Detection of Problematic Content","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13768","snapshot_observed_at":"2026-08-05T23:13:03.657036Z","title":"arXiv preprint arXiv:2308.13768 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:03.657036Z"},"links":{"cited_paper":"/paper/2308.13768","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:5fe9335a386da0f8d38e2fc9558bfbf5771dbd82590e5ac1937498856bf54f75","observation_id":"8705ad8d-9cd4-466b-b034-18c9e58deb4f","resolution":{"observed_at":"2026-08-05T23:13:03.657036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00829","last_updated":"2024-02-28T03:40:46Z","snapshot_observed_at":"2026-08-08T16:21:59.231647Z","submitted_at":"2024-02-28T03:40:46Z","title":"TroubleLLM: Align to Red Team Expert","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00829","snapshot_observed_at":"2026-08-05T23:13:03.721737Z","title":"arXiv preprint arXiv:2403.00829 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:03.721737Z"},"links":{"cited_paper":"/paper/2403.00829","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:3731a8d31fd3b23faf90d95066b99150f7ba3a5e911cc2b8b134cd018439756d","observation_id":"79165f25-f3b1-4ee8-a196-890c4414871e","resolution":{"observed_at":"2026-08-05T23:13:03.721737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18540","last_updated":"2025-02-28T14:49:25Z","snapshot_observed_at":"2026-08-07T03:50:11.725849Z","submitted_at":"2024-05-28T19:16:17Z","title":"Learning diverse attacks on large language models for robust red-teaming and safety tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18540","snapshot_observed_at":"2026-08-05T23:13:03.820155Z","title":"arXiv preprint arXiv:2405.18540 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:03.820155Z"},"links":{"cited_paper":"/paper/2405.18540","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:cf08caf5fd6cad2c346c7c993ed24584b066312899464da3d4aa826715738dd6","observation_id":"e3620943-fba8-4cdf-8c73-9b0b3674bd14","resolution":{"observed_at":"2026-08-05T23:13:03.820155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:03.900039Z","title":"Outcome-Constrained Large Language Models for Countering Hate Speech","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:03.900039Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:d69d6a49b8845f005acc7845098ecc02bf3e8601d6834fbd1fa5c7bf6c28c706","observation_id":"79871108-0d5c-49d3-bc79-dd7c6aee161c","resolution":{"observed_at":"2026-08-05T23:13:03.900039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:03.984396Z","title":"Proceedings of the CHI Conference on Human Factors in Computing Systems , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:03.984396Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:76983cbfd980d5011172559cb26942b4542cf8da463e8fff1d543fd31eb726d6","observation_id":"7f166ca7-d232-427c-9d3c-aa44f147d535","resolution":{"observed_at":"2026-08-05T23:13:03.984396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:04.024459Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.024459Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:1bb5fea7e7f8a8476bcaab938e709acaadbd417d2a1695fb5942d9b7e7163114","observation_id":"8545ce46-1cb4-42ac-8900-8c4ca76e4704","resolution":{"observed_at":"2026-08-05T23:13:04.024459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:04.028618Z","title":"Proceedings of the 2024 Joint International Conference on Computational Linguistics, Language Resources and Evaluation (LREC-COLING 2024) , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.028618Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:dab442ce57982b3474afa3d04cd1fac966c256384dd12cd8fb19d368e6b26244","observation_id":"2e9cd479-162b-4609-8a59-504cfcf47563","resolution":{"observed_at":"2026-08-05T23:13:04.028618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03097","last_updated":"2023-05-30T21:52:33Z","snapshot_observed_at":"2026-07-06T15:38:46.970127Z","submitted_at":"2023-05-30T21:52:33Z","title":"Seeing Seeds Beyond Weeds: Green Teaming Generative AI for Beneficial Uses","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03097","snapshot_observed_at":"2026-08-05T23:13:04.032739Z","title":"arXiv preprint arXiv:2306.03097 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.032739Z"},"links":{"cited_paper":"/paper/2306.03097","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:5e093afc54ea294b50aaa6a1a8d9a879388c51b642c4d6aa09d2bb6fc7f5e38d","observation_id":"9765cd3b-ca29-4b0b-8c55-9a5c99e9e018","resolution":{"observed_at":"2026-08-05T23:13:04.032739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:04.037075Z","title":"Intrinsic Self-correction for Enhanced Morality: An Analysis of Internal Mechanisms and the Superficial Hypothesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.037075Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:454f44c16930bab6cbb2a3fcdf54d4d9ba3863c6494c6ec5547b42330a9080e0","observation_id":"ffb8d0e4-52c2-4072-94a7-aaa4be383cf5","resolution":{"observed_at":"2026-08-05T23:13:04.037075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10668","last_updated":"2024-08-26T05:27:13Z","snapshot_observed_at":"2026-08-10T11:32:05.515365Z","submitted_at":"2024-08-20T09:11:21Z","title":"Probing the Safety Response Boundary of Large Language Models via Unsafe Decoding Path Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10668","snapshot_observed_at":"2026-08-05T23:13:04.041425Z","title":"arXiv preprint arXiv:2408.10668 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.041425Z"},"links":{"cited_paper":"/paper/2408.10668","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:3d65384a5ae97e065773337ed4a3ab4bf6c63cd42dce4fead0dad92737ac6874","observation_id":"a3aa813f-3e0d-4da8-a522-c6652f44ff70","resolution":{"observed_at":"2026-08-05T23:13:04.041425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05587","last_updated":"2024-06-08T22:14:51Z","snapshot_observed_at":"2026-08-12T03:43:47.244750Z","submitted_at":"2024-06-08T22:14:51Z","title":"Creativity Has Left the Chat: The Price of Debiasing Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05587","snapshot_observed_at":"2026-08-05T23:13:04.046627Z","title":"arXiv preprint arXiv:2406.05587 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.046627Z"},"links":{"cited_paper":"/paper/2406.05587","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:ec8555ea5c8205f4001a908aaa45744f872b419f573f57ec001f4b5d0b64ecb0","observation_id":"eb41db75-9280-4d7b-b079-445d4b108a1e","resolution":{"observed_at":"2026-08-05T23:13:04.046627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:04.050958Z","title":"Controlled Text Generation for Large Language Model with Dynamic Attribute Graphs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.050958Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:4af1058c91ad165a2c51a8d323401fdc8a3c0360e1ba380ff2ab1ea1221a4864","observation_id":"4fb36029-f869-4632-84e2-4798f5ba304c","resolution":{"observed_at":"2026-08-05T23:13:04.050958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:04.055130Z","title":"Proceedings of the 2024 Joint International Conference on Computational Linguistics, Language Resources and Evaluation (LREC-COLING 2024) , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.055130Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:45dc6665762e07caaf1a7c2214c48806961ada2681886ad89469f5e783f13f24","observation_id":"7e68a8cf-756a-4b8e-8909-781950102777","resolution":{"observed_at":"2026-08-05T23:13:04.055130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:04.059034Z","title":"Yale JL & Tech","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.059034Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:30cda782fa72864c1f40a57f54b181abe4e3b3d03811c8dc01b5d6914715d9a0","observation_id":"fadb5382-8c1b-4e3f-88e9-d283ed392b10","resolution":{"observed_at":"2026-08-05T23:13:04.059034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:04.062924Z","title":"Engineering, Technology & Applied Science Research , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.062924Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:805cb665fe9d5e61104ae3486b97b056f7281f863c86f15346f16dbaf8ff0e41","observation_id":"7f71c83e-dfd6-4dcf-b82e-b45d171c540b","resolution":{"observed_at":"2026-08-05T23:13:04.062924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:04.066922Z","title":"Machine-Generated Tweets , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.066922Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:e265dd57dac286d156bb315d6781ebd523f9b3785f391736094a41863d205813","observation_id":"49673c17-e9d5-4249-9414-3d001d1ff6f3","resolution":{"observed_at":"2026-08-05T23:13:04.066922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:04.070937Z","title":"Natural Language Processing , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.070937Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:0662655f8d0d3dd306e0647b8389509276a4c85b708d721320aa774168cde714","observation_id":"a8c6e79f-2a1f-468c-8481-f059a24e2c7b","resolution":{"observed_at":"2026-08-05T23:13:04.070937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:04.075456Z","title":"International Conference on Computational Science and Its Applications , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.075456Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:99fdbbea8c649cd8d12461a0d6df9d796fce5cc0d98efba098488b677a5a4d21","observation_id":"fa620c31-7410-4c82-ad9c-610d6e605801","resolution":{"observed_at":"2026-08-05T23:13:04.075456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00203","last_updated":"2023-11-01T00:17:11Z","snapshot_observed_at":"2026-08-10T22:20:08.850067Z","submitted_at":"2023-11-01T00:17:11Z","title":"Modeling subjectivity (by Mimicking Annotator Annotation) in toxic comment identification across diverse communities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.00203","snapshot_observed_at":"2026-08-05T23:13:04.079715Z","title":"arXiv preprint arXiv:2311.00203 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.079715Z"},"links":{"cited_paper":"/paper/2311.00203","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:7e8c029ead9ef5727e70430798295960c3f6c97a6890898faa727bae7f7d9a7b","observation_id":"ec361d9f-ec3f-4332-88fd-83b657ee20e4","resolution":{"observed_at":"2026-08-05T23:13:04.079715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:04.084319Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.084319Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:c69647425354e59437cc405edfd36cdf65728a0f21b5861141c7a0c4c03c58a9","observation_id":"4613330a-9ecb-48f5-bb4f-e743afd3f148","resolution":{"observed_at":"2026-08-05T23:13:04.084319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:04.088949Z","title":"Regulating Hate Speech Created by Generative AI , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.088949Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:125a7e35af528453100f39ace72274b3df43ad53a3bea9e4da0d3b4f3d3e3477","observation_id":"baf565a0-4225-4baa-9631-8a37500fc0ce","resolution":{"observed_at":"2026-08-05T23:13:04.088949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05613","last_updated":"2023-01-31T19:37:52Z","snapshot_observed_at":"2026-08-09T13:24:59.632184Z","submitted_at":"2022-12-11T21:56:44Z","title":"A Study of Slang Representation Methods","version":3},"cited_work":{"arxiv_id":"2212.05613","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.05613","snapshot_observed_at":"2026-08-05T23:13:08.065313Z","title":"A Study of Slang Representation Methods","venue":"cs.CL","work_id":"d8855c4d-3c29-4fb7-9d76-245261e54994","year":2022},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.092860Z"},"links":{"cited_paper":"/paper/2212.05613","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:5ec0039064c03b367b22f292d27480255465b425012ae3b6a4c2df07c1f8fe16","observation_id":"005b5e48-1803-4b5c-a922-4f6a68568577","resolution":{"observed_at":"2026-08-05T23:13:08.069771Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10440","last_updated":"2022-12-20T17:14:45Z","snapshot_observed_at":"2026-08-12T00:49:05.498757Z","submitted_at":"2022-12-20T17:14:45Z","title":"Perplexed by Quality: A Perplexity-based Method for Adult and Harmful Content Detection in Multilingual Heterogeneous Web Data","version":1},"cited_work":{"arxiv_id":"2212.10440","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.10440","snapshot_observed_at":"2026-08-05T23:13:08.042108Z","title":"Perplexed by Quality: A Perplexity-based Method for Adult and Harmful Content Detection in Multilingual Heterogeneous Web Data","venue":"cs.CL","work_id":"addbb92b-93ab-439d-86c0-b2bbe2ffd7aa","year":2022},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.096997Z"},"links":{"cited_paper":"/paper/2212.10440","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:7d1055cbd494ed052af740bc19c04ed7e33666ad981c5f428159beda17b8bad7","observation_id":"6f761ee3-f867-44ab-ad42-3032a44c39ae","resolution":{"observed_at":"2026-08-05T23:13:08.047629Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10154","last_updated":"2023-03-16T08:57:14Z","snapshot_observed_at":"2026-08-09T10:50:22.286872Z","submitted_at":"2022-12-20T10:46:40Z","title":"Human-Guided Fair Classification for Natural Language Processing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10154","snapshot_observed_at":"2026-08-05T23:13:04.101234Z","title":"arXiv preprint arXiv:2212.10154 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.101234Z"},"links":{"cited_paper":"/paper/2212.10154","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:3e5f2bbed3c46c66ec00340194427a56dce1edc8bbb622f44c2e271a7e932e19","observation_id":"52f71db4-b053-4998-a6a1-ac5e0bbd3db4","resolution":{"observed_at":"2026-08-05T23:13:04.101234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2301.12534","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:08.002052Z","title":"arXiv preprint arXiv:2301.12534 , year=","venue":null,"work_id":"95a33b5b-5f0e-4127-8018-8fc637e18ba5","year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.105543Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:15aaf54a45f852724d42b74c3043d2ede97006e4a99eccb978088a332c951ca8","observation_id":"65b692fc-8d19-4aab-9192-b7358227d056","resolution":{"observed_at":"2026-08-05T23:13:08.009527Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:04.109738Z","title":"International Conference on Advances in Social Networks Analysis and Mining , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.109738Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:b14ad1e68559a715b9ab94a7caa80d270f88fc7c771178398ab0c2998502cb54","observation_id":"3042f772-ca5c-4b91-8fcb-c770d6a45a37","resolution":{"observed_at":"2026-08-05T23:13:04.109738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:04.114159Z","title":"Explicit Toxicity Detection Models with Interactive Visualization , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.114159Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:c021a0c215bddd3efb100e934271a5e01117a87c03aa4c8a897aff4358956260","observation_id":"5f7ed78f-2433-4640-90f3-a95f2603ed0a","resolution":{"observed_at":"2026-08-05T23:13:04.114159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02978","last_updated":"2023-06-05T15:50:57Z","snapshot_observed_at":"2026-08-02T10:52:41.437064Z","submitted_at":"2023-06-05T15:50:57Z","title":"Which Argumentative Aspects of Hate Speech in Social Media can be reliably identified?","version":1},"cited_work":{"arxiv_id":"2306.02978","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.02978","snapshot_observed_at":"2026-08-05T23:13:07.899931Z","title":"Which Argumentative Aspects of Hate Speech in Social Media can be reliably identified?","venue":"cs.CL","work_id":"f2e8f0ce-d89e-4421-a354-f1d49b2d7b65","year":2023},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.118824Z"},"links":{"cited_paper":"/paper/2306.02978","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:07528012bd03ea3739c9a0fa541662f47244498aee1deb635023fd7d94680b21","observation_id":"164a9473-9137-4419-a9a1-adad34d60acc","resolution":{"observed_at":"2026-08-05T23:13:07.905145Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:04.123304Z","title":"Proceedings of the Second Workshop on NLP for Positive Impact (NLP4PI) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.123304Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:0eaebd5a6199468b44cb6859a1ecd44689e3d34bdd82026340830288353e5a27","observation_id":"25099d55-a1e2-4d1b-a80b-f0077fbc4f34","resolution":{"observed_at":"2026-08-05T23:13:04.123304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:04.127327Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.127327Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:7f503b9296a73160cae9e7bc979ed6c8c7cff341c925aadda91d853f905a5a23","observation_id":"a458cb7d-4282-49cc-bc73-972d9425e3d6","resolution":{"observed_at":"2026-08-05T23:13:04.127327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.13098","last_updated":"2023-09-22T15:10:36Z","snapshot_observed_at":"2026-08-09T15:47:07.173460Z","submitted_at":"2023-09-22T15:10:36Z","title":"Topological Data Mapping of Online Hate Speech, Misinformation, and General Mental Health: A Large Language Model Based Study","version":1},"cited_work":{"arxiv_id":"2309.13098","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.13098","snapshot_observed_at":"2026-08-05T23:13:07.878303Z","title":"Topological Data Mapping of Online Hate Speech, Misinformation, and General Mental Health: A Large Language Model Based Study","venue":"cs.LG","work_id":"49fdb1ae-16dd-4ac4-882a-f09b94ac34b3","year":2023},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.131563Z"},"links":{"cited_paper":"/paper/2309.13098","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:1aa3fe6a85e37c788fac96462d457e3b4231c329c13f424fa61cc1a1c8b9ab96","observation_id":"803845f0-f56b-479d-9657-43c8d43a3d27","resolution":{"observed_at":"2026-08-05T23:13:07.883128Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10707","last_updated":"2024-06-09T18:22:33Z","snapshot_observed_at":"2026-08-05T18:39:24.298759Z","submitted_at":"2023-10-16T16:18:55Z","title":"Demonstrations Are All You Need: Advancing Offensive Content Paraphrasing using In-Context Learning","version":2},"cited_work":{"arxiv_id":"2310.10707","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.10707","snapshot_observed_at":"2026-08-05T23:13:07.857287Z","title":"Demonstrations Are All You Need: Advancing Offensive Content Paraphrasing using In-Context Learning","venue":"cs.CL","work_id":"945b3b42-ee6e-49d5-a2c9-7c1fadd281a1","year":2023},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.135809Z"},"links":{"cited_paper":"/paper/2310.10707","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:be46f95192417710034d7d8a561ad56995c7643da4ec420868cf95255f9d39ef","observation_id":"53d99bd2-5e9f-4264-a72f-8f076dcc6532","resolution":{"observed_at":"2026-08-05T23:13:07.861922Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:04.139949Z","title":"Beyond plain toxic: building datasets for detection of flammable topics and inappropriate statements","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.139949Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:29e63f836b59ef6445d2f3a3ea449043e455bec623637b195e82d9564066425c","observation_id":"d6661e22-6d2c-4b57-b6d2-934321f5527a","resolution":{"observed_at":"2026-08-05T23:13:04.139949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:04.144250Z","title":"Evaluation of ChatGPT and BERT-based models for Turkish hate speech detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.144250Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:55281f64e8317cb788d8d370c74308b211e6da74f3594403c223f3a0a1e82b6c","observation_id":"d9798d37-cc31-433b-a0b5-a14eb29082c5","resolution":{"observed_at":"2026-08-05T23:13:04.144250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13985","last_updated":"2023-10-21T12:18:29Z","snapshot_observed_at":"2026-08-09T20:08:51.596968Z","submitted_at":"2023-10-21T12:18:29Z","title":"HateRephrase: Zero- and Few-Shot Reduction of Hate Intensity in Online Posts using Large Language Models","version":1},"cited_work":{"arxiv_id":"2310.13985","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.13985","snapshot_observed_at":"2026-08-05T23:13:07.835389Z","title":"HateRephrase: Zero- and Few-Shot Reduction of Hate Intensity in Online Posts using Large Language Models","venue":"cs.CL","work_id":"d56c1cc7-320e-458e-a20d-33230d3e448d","year":2023},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.148362Z"},"links":{"cited_paper":"/paper/2310.13985","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:f2a6333f551af05f62619140ca4dcd684f96d0e56165c787714bf7b5e8c54304","observation_id":"5ec65427-89d8-4191-b8ae-ac3903d98754","resolution":{"observed_at":"2026-08-05T23:13:07.840022Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18580","last_updated":"2024-12-23T05:04:49Z","snapshot_observed_at":"2026-08-09T23:18:23.231319Z","submitted_at":"2023-11-30T14:18:47Z","title":"FFT: Towards Harmlessness Evaluation and Analysis for LLMs with Factuality, Fairness, Toxicity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18580","snapshot_observed_at":"2026-08-05T23:13:04.152649Z","title":"arXiv preprint arXiv:2311.18580 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.152649Z"},"links":{"cited_paper":"/paper/2311.18580","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:75cf95f606b8e17c87ffcb91f802c8e01e3af511c29c9b2f69f16d442e28b3f6","observation_id":"10435c6c-a17d-4409-9d63-6408f817ac91","resolution":{"observed_at":"2026-08-05T23:13:04.152649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:04.157130Z","title":"Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.157130Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:bb5bd67dc1e8f77d99ec5872423f9a3ad0e8e0fc2caf92c2fddb9af55587d8c6","observation_id":"302948ef-6193-4c33-911b-47b1b120795a","resolution":{"observed_at":"2026-08-05T23:13:04.157130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06674","last_updated":"2023-12-07T19:40:50Z","snapshot_observed_at":"2026-07-06T17:00:00.321552Z","submitted_at":"2023-12-07T19:40:50Z","title":"Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06674","snapshot_observed_at":"2026-08-05T23:13:04.161107Z","title":"arXiv preprint arXiv:2312.06674 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.161107Z"},"links":{"cited_paper":"/paper/2312.06674","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:bfa8fcfdb080a74097f6c67ed51c9262fa8f24efd6a8be6bde176854688873dc","observation_id":"a5365e4f-0f2d-47a2-8d76-5b266eafd26e","resolution":{"observed_at":"2026-08-05T23:13:04.161107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:04.165543Z","title":"2024 , isbn =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.165543Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:80af2ea8c77e7b1bd4425df035034427a59f2c9a711fd04bd289c489a569bc07","observation_id":"78766c66-76e8-4a0a-9996-8cb3380fc3b7","resolution":{"observed_at":"2026-08-05T23:13:04.165543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14258","last_updated":"2024-02-22T03:46:02Z","snapshot_observed_at":"2026-07-06T17:33:45.647306Z","submitted_at":"2024-02-22T03:46:02Z","title":"Eagle: Ethical Dataset Given from Real Interactions","version":1},"cited_work":{"arxiv_id":"2402.14258","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.14258","snapshot_observed_at":"2026-08-05T23:13:07.706810Z","title":"Eagle: Ethical Dataset Given from Real Interactions","venue":"cs.CL","work_id":"1645b0cb-ecc7-48c6-9124-266cfc89f814","year":2024},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.169918Z"},"links":{"cited_paper":"/paper/2402.14258","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:59d74d1e633348077af4509b539ccff2f3170e767187a6afd56aed749abec290","observation_id":"dd78b58d-881b-4fd8-9d82-aad9612a5cf3","resolution":{"observed_at":"2026-08-05T23:13:07.712366Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:04.174303Z","title":"Proceedings of the first workshop on language technology for equality, diversity and inclusion , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.174303Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:47a1d010ebb6f2f96102bdcb6718656783e3de281dd889670424030fce00a170","observation_id":"54e798c2-c413-47ea-bb80-6a08a6c8fc0c","resolution":{"observed_at":"2026-08-05T23:13:04.174303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:04.178745Z","title":"Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.178745Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:1a953c89b51d48d0b2ca8aee3ce5f1e46a15bb85fe92d535df9e5378752c2932","observation_id":"54f73beb-ca2e-4f98-b9b6-d76066cfccfe","resolution":{"observed_at":"2026-08-05T23:13:04.178745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:04.183378Z","title":"M isgender M ender: A Community-Informed Approach to Interventions for Misgendering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.183378Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:49161096666c9215ad13c1d1145bc42a71164e4af58ac237eace0e0b0421e95d","observation_id":"34bdbfab-2e6a-4ead-bfb0-5ad5db868f85","resolution":{"observed_at":"2026-08-05T23:13:04.183378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01577","last_updated":"2024-04-26T05:29:35Z","snapshot_observed_at":"2026-08-10T11:43:29.373660Z","submitted_at":"2024-04-26T05:29:35Z","title":"HateTinyLLM : Hate Speech Detection Using Tiny Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01577","snapshot_observed_at":"2026-08-05T23:13:04.187341Z","title":"arXiv preprint arXiv:2405.01577 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.187341Z"},"links":{"cited_paper":"/paper/2405.01577","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:4a1e1e479380a2e1d0beff390ae81323b0b8378c0699991861a8323c062f9b76","observation_id":"41a2da99-3a2f-442a-9f47-98af30d9b87c","resolution":{"observed_at":"2026-08-05T23:13:04.187341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.17841","last_updated":"2024-04-27T09:20:13Z","snapshot_observed_at":"2026-08-06T09:30:47.229505Z","submitted_at":"2024-04-27T09:20:13Z","title":"Toxicity Classification in Ukrainian","version":1},"cited_work":{"arxiv_id":"2404.17841","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.17841","snapshot_observed_at":"2026-08-05T23:13:07.670532Z","title":"Toxicity Classification in Ukrainian","venue":"cs.CL","work_id":"76c4f9eb-e202-4725-a1e2-f1dd1a3fd3c4","year":2024},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.191642Z"},"links":{"cited_paper":"/paper/2404.17841","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:618c2f2e1e330e0c0fbb9ac83692837f667cc00efc71d295456a4b9dc0e6af54","observation_id":"d422327e-7c3c-459e-9c4c-774677d84c23","resolution":{"observed_at":"2026-08-05T23:13:07.675095Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:04.196099Z","title":"Proceedings of the International AAAI Conference on Web and Social Media , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.196099Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:a2900e64fd6de8ed06d498c4417c69498c8f9b6ccb1547073d55587ceef62614","observation_id":"b7910204-72e1-4448-a7f3-d09091fa36b5","resolution":{"observed_at":"2026-08-05T23:13:04.196099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:04.200044Z","title":"Proceedings of the International AAAI Conference on Web and Social Media , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.200044Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:326aa36983e9b6083ba72ee06f8aceafb188aa518e8451f5da5ed69965291df4","observation_id":"2fae51d7-23e7-4aef-aae7-40ffa4c11406","resolution":{"observed_at":"2026-08-05T23:13:04.200044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:04.204022Z","title":"Proceedings of the 18th Conference of the European Chapter of the Association for Computational Linguistics: Student Research Workshop , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.204022Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:614ad4e6ac2ec448efb6156a0a01eb7980c6a2cb2b606cb771b03dfeae3cc1ea","observation_id":"ea2dfb9d-e2ee-4ff1-b6a5-f35c656b1f1a","resolution":{"observed_at":"2026-08-05T23:13:04.204022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15227","last_updated":"2024-07-21T17:27:17Z","snapshot_observed_at":"2026-08-08T08:53:38.291494Z","submitted_at":"2024-07-21T17:27:17Z","title":"A Community-Centric Perspective for Characterizing and Detecting Anti-Asian Violence-Provoking Speech","version":1},"cited_work":{"arxiv_id":"2407.15227","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.15227","snapshot_observed_at":"2026-08-05T23:13:07.648272Z","title":"A Community-Centric Perspective for Characterizing and Detecting Anti-Asian Violence-Provoking Speech","venue":"cs.CL","work_id":"95071270-0bed-4c90-a5ad-a61f28be96ef","year":2024},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.208197Z"},"links":{"cited_paper":"/paper/2407.15227","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:3ee62064e30f7f264defe5ad171bdaf1032cefe7fa40483a11e5d1dbd3ca2a1b","observation_id":"0e70d85c-1aa2-4384-84c5-2ffbfd12e9b8","resolution":{"observed_at":"2026-08-05T23:13:07.653077Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:13:04.213203Z","title":"and Saha, Sriparna and Pasupa, Kitsuchart , title =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.213203Z"},"links":{"citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:0e8bfd3dace01c6d4d70cee5141e03797e3f0826304eed8f9b84c4302e2ea450","observation_id":"fc7888dc-7bf9-4d8b-8bba-3b06a2bb1d91","resolution":{"observed_at":"2026-08-05T23:13:04.213203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10414","last_updated":"2025-02-23T10:12:38Z","snapshot_observed_at":"2026-08-11T07:25:58.049595Z","submitted_at":"2024-10-14T12:04:06Z","title":"On Calibration of LLM-based Guard Models for Reliable Content Moderation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10414","snapshot_observed_at":"2026-08-05T23:13:04.217122Z","title":"arXiv preprint arXiv:2410.10414 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM","version":3},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-05T23:13:04.217122Z"},"links":{"cited_paper":"/paper/2410.10414","citing_paper":"/paper/2508.05775"},"observation_digest":"sha256:c4f7d8ae901c20e6025c45eadabb7c054422ba62fa7bfe31fa0d956b14553533","observation_id":"35c4bcef-1500-4a11-a17b-48205080ce62","resolution":{"observed_at":"2026-08-05T23:13:04.217122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.05775","last_updated":"2026-07-27T20:50:40Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-10T01:02:48.484224Z","submitted_at":"2025-08-07T18:42:16Z","title":"Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":8,"parse_uncertain":0,"unresolved":90,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":251},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 100 of 251 outbound references and 6 inbound Pith citation observations for arXiv:2508.05775."}