Pith. sign in

Paper Citation Record · LEDGER

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content

As of 18 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 0 inbound Pith citation observations for arXiv:2504.16120.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2504.16120 v1

Coverage vector

measured 29 of 29 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-16T11:57:58.481821Z

measured 29 of 29 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-18T06:34:40.430872+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

29 of 29 outbound references displayed

  • verified exact1
  • verified fuzzy8
  • unresolved20
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation a36507a3-bce5-4285-9dd6-c4f21cec32a5 · outbound

This paper cites HateBERT: Retraining BERT for Abusive Language Detection in English.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content HateBERT: Retraining BERT for Abusive Language Detection in English

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.349909Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.349909Z digest=sha256:abcd196c1ca97e7cfec58ae2f631817a3fcbd01f13699e1a5848fe50e541b6f4

Observation 320e32b3-3abb-4d98-bc45-50e738c89da4 · outbound

This paper cites Generalizable implicit hate speech detection using contrastive learning.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Generalizable implicit hate speech detection using contrastive learning

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T11:57:59.009796Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-16T11:57:58.355237Z digest=sha256:af3654e4508a365418d668f558ab4cec24d503b9f61ad6a5deda1622492e82df

Observation 336e58c1-2cfe-4d1c-bf3d-e07727761498 · outbound

This paper cites Toxicity Detection with Generative Prompt-based Inference.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Toxicity Detection with Generative Prompt-based Inference

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.360079Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.360079Z digest=sha256:a9891d0c4364f9826c62a6ee78cb75ff61992ef84bd7e2f3ee815bd5c29d9923

Observation 60bfc48d-daeb-4c23-ad37-d75bc4ece791 · outbound

This paper cites Interpretable Unified Language Checking.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Interpretable Unified Language Checking

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.365238Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.365238Z digest=sha256:36cc127e79e66a87c6c21eb316d3150fd6f7c71b7e1c0da148a0329bc44ae6cd

Observation 942e92d9-3e44-4cee-9252-678314e1b8dd · outbound

This paper cites Efficient toxic content detection by bootstrapping and distilling large language models.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Efficient toxic content detection by bootstrapping and distilling large language models

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T11:57:58.994057Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-16T11:57:58.370279Z digest=sha256:8942fbc130975d05df99e5cbb9740fc04a26af49f7af96786beec7a761378335

Observation 0f16f588-b224-4399-9ac9-37a9e14e03e0 · outbound

This paper cites Autorag-hp: Automatic online hyper-parameter tuning for retrieval-augmented generation, 2024.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Autorag-hp: Automatic online hyper-parameter tuning for retrieval-augmented generation, 2024

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T11:57:58.978221Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-16T11:57:58.375333Z digest=sha256:09d325a749c529519b82634b82ea3e2289226ba3796bf9693c956f48cc4d5898

Observation d7aff224-a7f6-4137-bc57-64d541e29bb4 · outbound

This paper cites Enhancing rag-retrieval to improve llms robustness and resilience to hallucinations.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Enhancing rag-retrieval to improve llms robustness and resilience to hallucinations

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T11:57:58.962628Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-16T11:57:58.380461Z digest=sha256:ddad2caa3888bd4d53179d93439f14ceb9a3ce5d6b27ca6b4af6b536eb6ec355

Observation 6e635869-fc1b-4e51-9553-e43277539d36 · outbound

This paper cites Beyond Task Performance: Evaluating and Reducing the Flaws of Large Multimodal Models with In-Context Learning.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Beyond Task Performance: Evaluating and Reducing the Flaws of Large Multimodal Models with In-Context Learning

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.384880Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.384880Z digest=sha256:a24225b87c66f5c8486c30360537886f44d49c2ba59d4d5803b04c4399c90474

Observation 4a57a7fb-b546-4e15-8b5f-fdb0cdd21f80 · outbound

This paper cites Principle-driven self-alignment of language models from scratch with minimal human supervision.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Principle-driven self-alignment of language models from scratch with minimal human supervision

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T11:57:58.943906Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-16T11:57:58.389371Z digest=sha256:0e54a5a74c0c6e8e99cfcb2c94b84796e97761d81c2d3da7d2f4a16023180e4e

Observation e9d6f8f8-ada5-48c8-a1c8-67027b085e5d · outbound

This paper cites Large Language Models Can Self-Improve.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Large Language Models Can Self-Improve

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.393817Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.393817Z digest=sha256:212ce9154d1fc3559dc7a510c1c52c7de01d04ed488765536ebb4d97c543f490

Observation 12df2720-929c-498a-81d4-be70bc9e27c2 · outbound

This paper cites Defending chatgpt against jailbreak attack via self-reminders.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Defending chatgpt against jailbreak attack via self-reminders

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.398683Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.398683Z digest=sha256:600f8b1c9a1bb43ffa2131e1bed3d10441f697cacc37314f944adc56ebc033f8

Observation 328eb7db-aa73-4019-a1bb-2600609ff86d · outbound

This paper cites Learning and Forgetting Unsafe Examples in Large Language Models.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Learning and Forgetting Unsafe Examples in Large Language Models

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.403124Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.403124Z digest=sha256:0abf50d714e6c00dff0dc9b224df3a944d0896d5838a47ea0e546b1447161476

Observation d057b93d-707c-4f3e-83be-681ddef8f05f · outbound

This paper cites CRITIC: Large Language Models Can Self-Correct with Tool-Interactive Critiquing.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content CRITIC: Large Language Models Can Self-Correct with Tool-Interactive Critiquing

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.408251Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.408251Z digest=sha256:c72d7457589eb36a4b3fd765cf31f5b57456f2298e61e4e04a1bd326b41a8232

Observation 4efc1b79-49e9-43bd-983c-8110d327362b · outbound

This paper cites N-Critics: Self-Refinement of Large Language Models with Ensemble of Critics.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content N-Critics: Self-Refinement of Large Language Models with Ensemble of Critics

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.413300Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.413300Z digest=sha256:f5bb63c657dddf324fb986225db379d4adf7d459d86ee8681101fa944a26181c

Observation d5dafa0f-1739-4a33-8471-f128150f9b1e · outbound

This paper cites Self-refine: Iterative refinement with self-feedback.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Self-refine: Iterative refinement with self-feedback

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.418083Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.418083Z digest=sha256:b1b73de07039133ab170719fda7a05ed85c282e4999493d35ce148266d0cf405

Observation c951aff8-9d27-4c74-b26c-0e1abec7eba9 · outbound

This paper cites Learning From Mistakes Makes LLM Better Reasoner.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Learning From Mistakes Makes LLM Better Reasoner

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.422905Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.422905Z digest=sha256:ef572504ac3484f2096ce3af793b5ca3e762926fe75f333db42e9547020c4cbc

Observation 2e95c6c9-21bd-4feb-aa81-0e9731522847 · outbound

This paper cites On the Intersection of Self-Correction and Trust in Language Models.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content On the Intersection of Self-Correction and Trust in Language Models

Reference 17

Resolution
verified exact
local_arxiv, observed 2026-08-16T11:57:58.668317Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-16T11:57:58.427653Z digest=sha256:a56e161a7fa9d1384de43b0b1039c5ee8d4c689c357fa0ee628cf6d2378e25b0

Observation bdca6dd3-a4ea-485b-8a01-8c25ffec1435 · outbound

This paper cites Self-correcting LLM-controlled Diffusion Models.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Self-correcting LLM-controlled Diffusion Models

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.432298Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.432298Z digest=sha256:a8a3d67e205e526bcd0f960e02034d374730b53b2e71d42bec4eae0c3408c9a1

Observation 62211133-2455-4a2c-8fb3-50b068d890d2 · outbound

This paper cites Automatically Correcting Large Language Models: Surveying the landscape of diverse self-correction strategies.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Automatically Correcting Large Language Models: Surveying the landscape of diverse self-correction strategies

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.436976Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.436976Z digest=sha256:00f9ccf60ece37fe76790b57a445eac7e2c855c65cb7df5ef725a6c3dc7b682d

Observation 9a84671f-7d73-4341-97fa-7a785fc02f8a · outbound

This paper cites SELF-[IN]CORRECT: LLMs Struggle with Discriminating Self-Generated Responses.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content SELF-[IN]CORRECT: LLMs Struggle with Discriminating Self-Generated Responses

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.441508Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.441508Z digest=sha256:a587932373157b9db7ef53f63a008fa05ce11c9661dedd740c061476c6604596

Observation 92cceca0-5f6a-4e54-9951-7ad63ac85a96 · outbound

This paper cites Large Language Models Cannot Self-Correct Reasoning Yet.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Large Language Models Cannot Self-Correct Reasoning Yet

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.445879Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.445879Z digest=sha256:8b758d7ff98bdaa4823f642f2ad0a16e253104fc37cbd5b094b859af87749b0f

Observation 50f6f01b-3dcc-4f2e-8df2-e8216a911a56 · outbound

This paper cites Confidence Matters: Revisiting Intrinsic Self-Correction Capabilities of Large Language Models.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Confidence Matters: Revisiting Intrinsic Self-Correction Capabilities of Large Language Models

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.450689Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.450689Z digest=sha256:9050c1d0412fb122c68b9cda30bcb8de3c2a3dd24cc7e78dc54a541fdd5a37ba

Observation c4a9de15-d9ee-471a-b5a3-04297d85cda3 · outbound

This paper cites Democratizing LLMs: An Exploration of Cost-Performance Trade-offs in Self-Refined Open-Source Models.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Democratizing LLMs: An Exploration of Cost-Performance Trade-offs in Self-Refined Open-Source Models

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.455088Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.455088Z digest=sha256:31d1827449df79b7deeb144a0c1225f6cd8980df75bcd243ad7cdd51943055eb

Observation 0ebb4933-f62b-4d22-8a2f-3e5ab959c992 · outbound

This paper cites Model editing as a robust and denoised variant of dpo: A case study on toxicity.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Model editing as a robust and denoised variant of dpo: A case study on toxicity

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T11:57:58.898336Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-16T11:57:58.460027Z digest=sha256:6c9686e0f6f7bd1d1feec7c6be649c18993407ac842630e704ce325027830363

Observation 0024866d-96ea-4474-9adb-00402ab5ab4a · outbound

This paper cites Gpt-4 technical report, 2024.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Gpt-4 technical report, 2024

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T11:57:58.882566Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-16T11:57:58.464246Z digest=sha256:ea683350a9bcb557e47115ca3b7e300cd348d3891cfc185fe6bf690491a55009

Observation 413fb6e2-2ebb-419e-a05c-91442c24af35 · outbound

This paper cites Dai, and Orhan Firat et al.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Dai, and Orhan Firat et al

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T11:57:58.865315Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-16T11:57:58.468665Z digest=sha256:5c1e7a0472c18584f942b7abaf6604700db83af648608dfec970cbc9e0df134d

Observation f7858d28-88a2-4eba-b66d-39c88436ce30 · outbound

This paper cites Mistral 7B.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Mistral 7B

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.473001Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.473001Z digest=sha256:0a02b2b869f62af0056d3ab8c73a686d3ed7224bf27370e1644f485002acdcfd

Observation 3a28d03b-e9d8-44c7-bc94-f7f4a124058a · outbound

This paper cites Gemma: Open Models Based on Gemini Research and Technology.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Gemma: Open Models Based on Gemini Research and Technology

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.477590Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.477590Z digest=sha256:0b619a81c55fb7af1a378edf914929147ae074584935fb47dd0cb2f35687d6ec

Observation 688c89b4-8cd8-42db-bd51-d31a57780f21 · outbound

This paper cites an unresolved cited work.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Unresolved cited work

Reference 29

Resolution
unresolved
raw_fallback, observed 2026-08-16T11:57:58.848246Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-16T11:57:58.481821Z digest=sha256:c31dbdaf9c0edd28362c8d661d71a5ca7b29ecba369b2087a82411ffe421d33c

Pith citing papers

No inbound Pith citation observations are available.