{"as_of":"2026-08-18T14:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cb5f47aae41547c059ee95e2f605f4f5d480ca320bc6433adc5168a655eab749","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:57:58.481821Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.16120/citation-record","integrity":"/paper/2504.16120/integrity","json":"/paper/2504.16120/citation-record.json","paper":"/paper/2504.16120"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2010.12472","last_updated":"2021-02-04T10:00:07Z","snapshot_observed_at":"2026-08-17T08:08:05.515387Z","submitted_at":"2020-10-23T15:14:14Z","title":"HateBERT: Retraining BERT for Abusive Language Detection in English","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.12472","snapshot_observed_at":"2026-08-16T11:57:58.349909Z","title":"Hatebert: Retraining bert for abusive language detection in english","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2504.16120","last_updated":"2025-04-19T04:57:05Z","snapshot_observed_at":"2026-08-17T04:41:12.809899Z","submitted_at":"2025-04-19T04:57:05Z","title":"A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T11:57:58.349909Z"},"links":{"cited_paper":"/paper/2010.12472","citing_paper":"/paper/2504.16120"},"observation_digest":"sha256:abcd196c1ca97e7cfec58ae2f631817a3fcbd01f13699e1a5848fe50e541b6f4","observation_id":"a36507a3-bce5-4285-9dd6-c4f21cec32a5","resolution":{"observed_at":"2026-08-16T11:57:58.349909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:57:59.004521Z","title":"Generalizable implicit hate speech detection using contrastive learning","venue":null,"work_id":"07c0b3b3-de62-45a7-8cf5-80d4611c6209","year":2022},"citing_paper":{"arxiv_id":"2504.16120","last_updated":"2025-04-19T04:57:05Z","snapshot_observed_at":"2026-08-17T04:41:12.809899Z","submitted_at":"2025-04-19T04:57:05Z","title":"A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T11:57:58.355237Z"},"links":{"citing_paper":"/paper/2504.16120"},"observation_digest":"sha256:af3654e4508a365418d668f558ab4cec24d503b9f61ad6a5deda1622492e82df","observation_id":"320e32b3-3abb-4d98-bc45-50e738c89da4","resolution":{"observed_at":"2026-08-16T11:57:59.009796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12390","last_updated":"2022-05-24T22:44:43Z","snapshot_observed_at":"2026-08-18T08:48:50.593864Z","submitted_at":"2022-05-24T22:44:43Z","title":"Toxicity Detection with Generative Prompt-based Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.12390","snapshot_observed_at":"2026-08-16T11:57:58.360079Z","title":"Toxicity detection with generative prompt-based inference","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.16120","last_updated":"2025-04-19T04:57:05Z","snapshot_observed_at":"2026-08-17T04:41:12.809899Z","submitted_at":"2025-04-19T04:57:05Z","title":"A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T11:57:58.360079Z"},"links":{"cited_paper":"/paper/2205.12390","citing_paper":"/paper/2504.16120"},"observation_digest":"sha256:a9891d0c4364f9826c62a6ee78cb75ff61992ef84bd7e2f3ee815bd5c29d9923","observation_id":"336e58c1-2cfe-4d1c-bf3d-e07727761498","resolution":{"observed_at":"2026-08-16T11:57:58.360079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03728","last_updated":"2023-04-07T16:47:49Z","snapshot_observed_at":"2026-08-16T15:41:59.339248Z","submitted_at":"2023-04-07T16:47:49Z","title":"Interpretable Unified Language Checking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03728","snapshot_observed_at":"2026-08-16T11:57:58.365238Z","title":"Interpretable unified language checking","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16120","last_updated":"2025-04-19T04:57:05Z","snapshot_observed_at":"2026-08-17T04:41:12.809899Z","submitted_at":"2025-04-19T04:57:05Z","title":"A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T11:57:58.365238Z"},"links":{"cited_paper":"/paper/2304.03728","citing_paper":"/paper/2504.16120"},"observation_digest":"sha256:36cc127e79e66a87c6c21eb316d3150fd6f7c71b7e1c0da148a0329bc44ae6cd","observation_id":"60bfc48d-daeb-4c23-ad37-d75bc4ece791","resolution":{"observed_at":"2026-08-16T11:57:58.365238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:57:58.988938Z","title":"Efficient toxic content detection by bootstrapping and distilling large language models","venue":null,"work_id":"55cedd4e-a125-4409-9c53-6f4a9fd973aa","year":2024},"citing_paper":{"arxiv_id":"2504.16120","last_updated":"2025-04-19T04:57:05Z","snapshot_observed_at":"2026-08-17T04:41:12.809899Z","submitted_at":"2025-04-19T04:57:05Z","title":"A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T11:57:58.370279Z"},"links":{"citing_paper":"/paper/2504.16120"},"observation_digest":"sha256:8942fbc130975d05df99e5cbb9740fc04a26af49f7af96786beec7a761378335","observation_id":"942e92d9-3e44-4cee-9252-678314e1b8dd","resolution":{"observed_at":"2026-08-16T11:57:58.994057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:57:58.973383Z","title":"Autorag-hp: Automatic online hyper-parameter tuning for retrieval-augmented generation, 2024","venue":null,"work_id":"a940ee76-03de-411c-98f9-8785da62ca94","year":2024},"citing_paper":{"arxiv_id":"2504.16120","last_updated":"2025-04-19T04:57:05Z","snapshot_observed_at":"2026-08-17T04:41:12.809899Z","submitted_at":"2025-04-19T04:57:05Z","title":"A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T11:57:58.375333Z"},"links":{"citing_paper":"/paper/2504.16120"},"observation_digest":"sha256:09d325a749c529519b82634b82ea3e2289226ba3796bf9693c956f48cc4d5898","observation_id":"0f16f588-b224-4399-9ac9-37a9e14e03e0","resolution":{"observed_at":"2026-08-16T11:57:58.978221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:57:58.956545Z","title":"Enhancing rag-retrieval to improve llms robustness and resilience to hallucinations","venue":null,"work_id":"b63b80cc-a28e-445b-a92e-29d237efe89d","year":2024},"citing_paper":{"arxiv_id":"2504.16120","last_updated":"2025-04-19T04:57:05Z","snapshot_observed_at":"2026-08-17T04:41:12.809899Z","submitted_at":"2025-04-19T04:57:05Z","title":"A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T11:57:58.380461Z"},"links":{"citing_paper":"/paper/2504.16120"},"observation_digest":"sha256:ddad2caa3888bd4d53179d93439f14ceb9a3ce5d6b27ca6b4af6b536eb6ec355","observation_id":"d7aff224-a7f6-4137-bc57-64d541e29bb4","resolution":{"observed_at":"2026-08-16T11:57:58.962628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00647","last_updated":"2024-01-22T18:53:48Z","snapshot_observed_at":"2026-08-16T22:48:30.472977Z","submitted_at":"2023-10-01T12:02:59Z","title":"Beyond Task Performance: Evaluating and Reducing the Flaws of Large Multimodal Models with In-Context Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00647","snapshot_observed_at":"2026-08-16T11:57:58.384880Z","title":"Beyond task performance: Evaluating and reducing the flaws of large multimodal models with in-context learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16120","last_updated":"2025-04-19T04:57:05Z","snapshot_observed_at":"2026-08-17T04:41:12.809899Z","submitted_at":"2025-04-19T04:57:05Z","title":"A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T11:57:58.384880Z"},"links":{"cited_paper":"/paper/2310.00647","citing_paper":"/paper/2504.16120"},"observation_digest":"sha256:a24225b87c66f5c8486c30360537886f44d49c2ba59d4d5803b04c4399c90474","observation_id":"6e635869-fc1b-4e51-9553-e43277539d36","resolution":{"observed_at":"2026-08-16T11:57:58.384880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:57:58.938504Z","title":"Principle-driven self-alignment of language models from scratch with minimal human supervision","venue":null,"work_id":"77a32c28-8b21-4539-b3e2-3b5a48cde01e","year":2024},"citing_paper":{"arxiv_id":"2504.16120","last_updated":"2025-04-19T04:57:05Z","snapshot_observed_at":"2026-08-17T04:41:12.809899Z","submitted_at":"2025-04-19T04:57:05Z","title":"A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T11:57:58.389371Z"},"links":{"citing_paper":"/paper/2504.16120"},"observation_digest":"sha256:0e54a5a74c0c6e8e99cfcb2c94b84796e97761d81c2d3da7d2f4a16023180e4e","observation_id":"4a57a7fb-b546-4e15-8b5f-fdb0cdd21f80","resolution":{"observed_at":"2026-08-16T11:57:58.943906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11610","last_updated":"2022-10-25T17:45:17Z","snapshot_observed_at":"2026-08-09T02:27:34.152063Z","submitted_at":"2022-10-20T21:53:54Z","title":"Large Language Models Can Self-Improve","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.11610","snapshot_observed_at":"2026-08-16T11:57:58.393817Z","title":"Large language models can self-improve","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.16120","last_updated":"2025-04-19T04:57:05Z","snapshot_observed_at":"2026-08-17T04:41:12.809899Z","submitted_at":"2025-04-19T04:57:05Z","title":"A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T11:57:58.393817Z"},"links":{"cited_paper":"/paper/2210.11610","citing_paper":"/paper/2504.16120"},"observation_digest":"sha256:212ce9154d1fc3559dc7a510c1c52c7de01d04ed488765536ebb4d97c543f490","observation_id":"e9d6f8f8-ada5-48c8-a1c8-67027b085e5d","resolution":{"observed_at":"2026-08-16T11:57:58.393817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:57:58.398683Z","title":"Defending chatgpt against jailbreak attack via self-reminders","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16120","last_updated":"2025-04-19T04:57:05Z","snapshot_observed_at":"2026-08-17T04:41:12.809899Z","submitted_at":"2025-04-19T04:57:05Z","title":"A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T11:57:58.398683Z"},"links":{"citing_paper":"/paper/2504.16120"},"observation_digest":"sha256:600f8b1c9a1bb43ffa2131e1bed3d10441f697cacc37314f944adc56ebc033f8","observation_id":"12df2720-929c-498a-81d4-be70bc9e27c2","resolution":{"observed_at":"2026-08-16T11:57:58.398683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12736","last_updated":"2024-07-03T06:13:31Z","snapshot_observed_at":"2026-08-16T14:33:07.599020Z","submitted_at":"2023-12-20T03:18:50Z","title":"Learning and Forgetting Unsafe Examples in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.12736","snapshot_observed_at":"2026-08-16T11:57:58.403124Z","title":"Learning and forgetting unsafe examples in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16120","last_updated":"2025-04-19T04:57:05Z","snapshot_observed_at":"2026-08-17T04:41:12.809899Z","submitted_at":"2025-04-19T04:57:05Z","title":"A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T11:57:58.403124Z"},"links":{"cited_paper":"/paper/2312.12736","citing_paper":"/paper/2504.16120"},"observation_digest":"sha256:0abf50d714e6c00dff0dc9b224df3a944d0896d5838a47ea0e546b1447161476","observation_id":"328eb7db-aa73-4019-a1bb-2600609ff86d","resolution":{"observed_at":"2026-08-16T11:57:58.403124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11738","last_updated":"2024-02-21T12:59:21Z","snapshot_observed_at":"2026-07-31T18:12:14.483728Z","submitted_at":"2023-05-19T15:19:44Z","title":"CRITIC: Large Language Models Can Self-Correct with Tool-Interactive Critiquing","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11738","snapshot_observed_at":"2026-08-16T11:57:58.408251Z","title":"Critic: Large language models can self-correct with tool-interactive critiquing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16120","last_updated":"2025-04-19T04:57:05Z","snapshot_observed_at":"2026-08-17T04:41:12.809899Z","submitted_at":"2025-04-19T04:57:05Z","title":"A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T11:57:58.408251Z"},"links":{"cited_paper":"/paper/2305.11738","citing_paper":"/paper/2504.16120"},"observation_digest":"sha256:c72d7457589eb36a4b3fd765cf31f5b57456f2298e61e4e04a1bd326b41a8232","observation_id":"d057b93d-707c-4f3e-83be-681ddef8f05f","resolution":{"observed_at":"2026-08-16T11:57:58.408251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18679","last_updated":"2023-11-08T13:23:20Z","snapshot_observed_at":"2026-08-18T13:33:34.697799Z","submitted_at":"2023-10-28T11:22:22Z","title":"N-Critics: Self-Refinement of Large Language Models with Ensemble of Critics","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.18679","snapshot_observed_at":"2026-08-16T11:57:58.413300Z","title":"N-critics: Self-refinement of large language models with ensemble of critics","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16120","last_updated":"2025-04-19T04:57:05Z","snapshot_observed_at":"2026-08-17T04:41:12.809899Z","submitted_at":"2025-04-19T04:57:05Z","title":"A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T11:57:58.413300Z"},"links":{"cited_paper":"/paper/2310.18679","citing_paper":"/paper/2504.16120"},"observation_digest":"sha256:70159ce00dc4b6361ee56431c2a64923f6b8d816154bf79024cf033650293d6a","observation_id":"4efc1b79-49e9-43bd-983c-8110d327362b","resolution":{"observed_at":"2026-08-16T11:57:58.413300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:57:58.418083Z","title":"Self-refine: Iterative refinement with self-feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16120","last_updated":"2025-04-19T04:57:05Z","snapshot_observed_at":"2026-08-17T04:41:12.809899Z","submitted_at":"2025-04-19T04:57:05Z","title":"A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T11:57:58.418083Z"},"links":{"citing_paper":"/paper/2504.16120"},"observation_digest":"sha256:b1b73de07039133ab170719fda7a05ed85c282e4999493d35ce148266d0cf405","observation_id":"d5dafa0f-1739-4a33-8471-f128150f9b1e","resolution":{"observed_at":"2026-08-16T11:57:58.418083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20689","last_updated":"2024-03-29T07:17:39Z","snapshot_observed_at":"2026-08-16T14:47:07.144931Z","submitted_at":"2023-10-31T17:52:22Z","title":"Learning From Mistakes Makes LLM Better Reasoner","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20689","snapshot_observed_at":"2026-08-16T11:57:58.422905Z","title":"Learning from mistakes makes llm better reasoner","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16120","last_updated":"2025-04-19T04:57:05Z","snapshot_observed_at":"2026-08-17T04:41:12.809899Z","submitted_at":"2025-04-19T04:57:05Z","title":"A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T11:57:58.422905Z"},"links":{"cited_paper":"/paper/2310.20689","citing_paper":"/paper/2504.16120"},"observation_digest":"sha256:ef572504ac3484f2096ce3af793b5ca3e762926fe75f333db42e9547020c4cbc","observation_id":"c951aff8-9d27-4c74-b26c-0e1abec7eba9","resolution":{"observed_at":"2026-08-16T11:57:58.422905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.02801","last_updated":"2023-11-06T00:04:12Z","snapshot_observed_at":"2026-08-18T04:38:44.611963Z","submitted_at":"2023-11-06T00:04:12Z","title":"On the Intersection of Self-Correction and Trust in Language Models","version":1},"cited_work":{"arxiv_id":"2311.02801","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.02801","snapshot_observed_at":"2026-08-16T11:57:58.661434Z","title":"On the Intersection of Self-Correction and Trust in Language Models","venue":"cs.LG","work_id":"aa9cd85f-468a-4172-9072-960ea2adf69e","year":2023},"citing_paper":{"arxiv_id":"2504.16120","last_updated":"2025-04-19T04:57:05Z","snapshot_observed_at":"2026-08-17T04:41:12.809899Z","submitted_at":"2025-04-19T04:57:05Z","title":"A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T11:57:58.427653Z"},"links":{"cited_paper":"/paper/2311.02801","citing_paper":"/paper/2504.16120"},"observation_digest":"sha256:a56e161a7fa9d1384de43b0b1039c5ee8d4c689c357fa0ee628cf6d2378e25b0","observation_id":"2e95c6c9-21bd-4feb-aa81-0e9731522847","resolution":{"observed_at":"2026-08-16T11:57:58.668317Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16090","last_updated":"2023-11-27T18:56:37Z","snapshot_observed_at":"2026-08-16T14:39:55.872897Z","submitted_at":"2023-11-27T18:56:37Z","title":"Self-correcting LLM-controlled Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16090","snapshot_observed_at":"2026-08-16T11:57:58.432298Z","title":"Self-correcting llm-controlled diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16120","last_updated":"2025-04-19T04:57:05Z","snapshot_observed_at":"2026-08-17T04:41:12.809899Z","submitted_at":"2025-04-19T04:57:05Z","title":"A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T11:57:58.432298Z"},"links":{"cited_paper":"/paper/2311.16090","citing_paper":"/paper/2504.16120"},"observation_digest":"sha256:a8a3d67e205e526bcd0f960e02034d374730b53b2e71d42bec4eae0c3408c9a1","observation_id":"bdca6dd3-a4ea-485b-8a01-8c25ffec1435","resolution":{"observed_at":"2026-08-16T11:57:58.432298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03188","last_updated":"2023-08-30T03:47:34Z","snapshot_observed_at":"2026-08-16T15:10:27.193437Z","submitted_at":"2023-08-06T18:38:52Z","title":"Automatically Correcting Large Language Models: Surveying the landscape of diverse self-correction strategies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03188","snapshot_observed_at":"2026-08-16T11:57:58.436976Z","title":"Automatically correcting large language models: Surveying the landscape of diverse self-correction strategies","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16120","last_updated":"2025-04-19T04:57:05Z","snapshot_observed_at":"2026-08-17T04:41:12.809899Z","submitted_at":"2025-04-19T04:57:05Z","title":"A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T11:57:58.436976Z"},"links":{"cited_paper":"/paper/2308.03188","citing_paper":"/paper/2504.16120"},"observation_digest":"sha256:00f9ccf60ece37fe76790b57a445eac7e2c855c65cb7df5ef725a6c3dc7b682d","observation_id":"62211133-2455-4a2c-8fb3-50b068d890d2","resolution":{"observed_at":"2026-08-16T11:57:58.436976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04298","last_updated":"2024-09-06T01:14:26Z","snapshot_observed_at":"2026-08-17T22:52:54.773071Z","submitted_at":"2024-04-04T20:27:37Z","title":"SELF-[IN]CORRECT: LLMs Struggle with Discriminating Self-Generated Responses","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04298","snapshot_observed_at":"2026-08-16T11:57:58.441508Z","title":"Self-[in] correct: Llms struggle with refining self-generated responses","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16120","last_updated":"2025-04-19T04:57:05Z","snapshot_observed_at":"2026-08-17T04:41:12.809899Z","submitted_at":"2025-04-19T04:57:05Z","title":"A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T11:57:58.441508Z"},"links":{"cited_paper":"/paper/2404.04298","citing_paper":"/paper/2504.16120"},"observation_digest":"sha256:a587932373157b9db7ef53f63a008fa05ce11c9661dedd740c061476c6604596","observation_id":"9a84671f-7d73-4341-97fa-7a785fc02f8a","resolution":{"observed_at":"2026-08-16T11:57:58.441508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01798","last_updated":"2024-03-14T04:27:52Z","snapshot_observed_at":"2026-08-13T03:11:04.678829Z","submitted_at":"2023-10-03T04:56:12Z","title":"Large Language Models Cannot Self-Correct Reasoning Yet","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01798","snapshot_observed_at":"2026-08-16T11:57:58.445879Z","title":"Large language models cannot self-correct reasoning yet","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16120","last_updated":"2025-04-19T04:57:05Z","snapshot_observed_at":"2026-08-17T04:41:12.809899Z","submitted_at":"2025-04-19T04:57:05Z","title":"A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T11:57:58.445879Z"},"links":{"cited_paper":"/paper/2310.01798","citing_paper":"/paper/2504.16120"},"observation_digest":"sha256:8b758d7ff98bdaa4823f642f2ad0a16e253104fc37cbd5b094b859af87749b0f","observation_id":"92cceca0-5f6a-4e54-9951-7ad63ac85a96","resolution":{"observed_at":"2026-08-16T11:57:58.445879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12563","last_updated":"2024-05-13T11:01:17Z","snapshot_observed_at":"2026-08-16T14:17:09.418577Z","submitted_at":"2024-02-19T21:38:02Z","title":"Confidence Matters: Revisiting Intrinsic Self-Correction Capabilities of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12563","snapshot_observed_at":"2026-08-16T11:57:58.450689Z","title":"Confidence matters: Revisiting intrinsic self-correction capabilities of large language models.arXiv preprint arXiv:2402.12563, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16120","last_updated":"2025-04-19T04:57:05Z","snapshot_observed_at":"2026-08-17T04:41:12.809899Z","submitted_at":"2025-04-19T04:57:05Z","title":"A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T11:57:58.450689Z"},"links":{"cited_paper":"/paper/2402.12563","citing_paper":"/paper/2504.16120"},"observation_digest":"sha256:9050c1d0412fb122c68b9cda30bcb8de3c2a3dd24cc7e78dc54a541fdd5a37ba","observation_id":"50f6f01b-3dcc-4f2e-8df2-e8216a911a56","resolution":{"observed_at":"2026-08-16T11:57:58.450689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07611","last_updated":"2023-10-22T00:37:06Z","snapshot_observed_at":"2026-08-16T14:53:00.911254Z","submitted_at":"2023-10-11T15:56:00Z","title":"Democratizing LLMs: An Exploration of Cost-Performance Trade-offs in Self-Refined Open-Source Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07611","snapshot_observed_at":"2026-08-16T11:57:58.455088Z","title":"Democratizing llms: An exploration of cost-performance trade-offs in self-refined open-source models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16120","last_updated":"2025-04-19T04:57:05Z","snapshot_observed_at":"2026-08-17T04:41:12.809899Z","submitted_at":"2025-04-19T04:57:05Z","title":"A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T11:57:58.455088Z"},"links":{"cited_paper":"/paper/2310.07611","citing_paper":"/paper/2504.16120"},"observation_digest":"sha256:31d1827449df79b7deeb144a0c1225f6cd8980df75bcd243ad7cdd51943055eb","observation_id":"c4a9de15-d9ee-471a-b5a3-04297d85cda3","resolution":{"observed_at":"2026-08-16T11:57:58.455088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:57:58.893019Z","title":"Model editing as a robust and denoised variant of dpo: A case study on toxicity","venue":null,"work_id":"ba3c6cf9-f222-46e3-8935-c3f335a7cecb","year":2024},"citing_paper":{"arxiv_id":"2504.16120","last_updated":"2025-04-19T04:57:05Z","snapshot_observed_at":"2026-08-17T04:41:12.809899Z","submitted_at":"2025-04-19T04:57:05Z","title":"A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T11:57:58.460027Z"},"links":{"citing_paper":"/paper/2504.16120"},"observation_digest":"sha256:6c9686e0f6f7bd1d1feec7c6be649c18993407ac842630e704ce325027830363","observation_id":"0ebb4933-f62b-4d22-8a2f-3e5ab959c992","resolution":{"observed_at":"2026-08-16T11:57:58.898336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:57:58.877110Z","title":"Gpt-4 technical report, 2024","venue":null,"work_id":"5ceb9082-83b7-4f02-b80a-32e93cf4b6b2","year":2024},"citing_paper":{"arxiv_id":"2504.16120","last_updated":"2025-04-19T04:57:05Z","snapshot_observed_at":"2026-08-17T04:41:12.809899Z","submitted_at":"2025-04-19T04:57:05Z","title":"A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T11:57:58.464246Z"},"links":{"citing_paper":"/paper/2504.16120"},"observation_digest":"sha256:ea683350a9bcb557e47115ca3b7e300cd348d3891cfc185fe6bf690491a55009","observation_id":"0024866d-96ea-4474-9adb-00402ab5ab4a","resolution":{"observed_at":"2026-08-16T11:57:58.882566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:57:58.860346Z","title":"Dai, and Orhan Firat et al","venue":null,"work_id":"409a6490-9d8f-4ba8-89ba-c1c28fd0fd13","year":2023},"citing_paper":{"arxiv_id":"2504.16120","last_updated":"2025-04-19T04:57:05Z","snapshot_observed_at":"2026-08-17T04:41:12.809899Z","submitted_at":"2025-04-19T04:57:05Z","title":"A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T11:57:58.468665Z"},"links":{"citing_paper":"/paper/2504.16120"},"observation_digest":"sha256:5c1e7a0472c18584f942b7abaf6604700db83af648608dfec970cbc9e0df134d","observation_id":"413fb6e2-2ebb-419e-a05c-91442c24af35","resolution":{"observed_at":"2026-08-16T11:57:58.865315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T20:30:34.016254Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-16T11:57:58.473001Z","title":"Mistral 7b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16120","last_updated":"2025-04-19T04:57:05Z","snapshot_observed_at":"2026-08-17T04:41:12.809899Z","submitted_at":"2025-04-19T04:57:05Z","title":"A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T11:57:58.473001Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2504.16120"},"observation_digest":"sha256:0a02b2b869f62af0056d3ab8c73a686d3ed7224bf27370e1644f485002acdcfd","observation_id":"f7858d28-88a2-4eba-b66d-39c88436ce30","resolution":{"observed_at":"2026-08-16T11:57:58.473001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-16T11:57:58.477590Z","title":"Gemma: Open models based on gemini research and technology","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16120","last_updated":"2025-04-19T04:57:05Z","snapshot_observed_at":"2026-08-17T04:41:12.809899Z","submitted_at":"2025-04-19T04:57:05Z","title":"A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T11:57:58.477590Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2504.16120"},"observation_digest":"sha256:0b619a81c55fb7af1a378edf914929147ae074584935fb47dd0cb2f35687d6ec","observation_id":"3a28d03b-e9d8-44c7-bc94-f7f4a124058a","resolution":{"observed_at":"2026-08-16T11:57:58.477590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:57:58.842994Z","title":null,"venue":null,"work_id":"9ffd66e3-1289-4730-9fbe-347a00550b95","year":2002},"citing_paper":{"arxiv_id":"2504.16120","last_updated":"2025-04-19T04:57:05Z","snapshot_observed_at":"2026-08-17T04:41:12.809899Z","submitted_at":"2025-04-19T04:57:05Z","title":"A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T11:57:58.481821Z"},"links":{"citing_paper":"/paper/2504.16120"},"observation_digest":"sha256:c31dbdaf9c0edd28362c8d661d71a5ca7b29ecba369b2087a82411ffe421d33c","observation_id":"688c89b4-8cd8-42db-bd51-d31a57780f21","resolution":{"observed_at":"2026-08-16T11:57:58.848246Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.16120","last_updated":"2025-04-19T04:57:05Z","latest_version":1,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-17T04:41:12.809899Z","submitted_at":"2025-04-19T04:57:05Z","title":"A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":1,"verified_fuzzy":8},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 0 inbound Pith citation observations for arXiv:2504.16120."}