Pith. sign in

Paper Citation Record · LEDGER

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content

As of 19 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 0 inbound Pith citation observations for arXiv:2504.16120.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2504.16120 v1

Coverage vector

measured 29 of 29 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-16T11:57:58.481821Z

measured 29 of 29 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-19T06:32:44.657259+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

29 of 29 outbound references displayed

  • verified exact1
  • verified fuzzy8
  • unresolved20
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation a36507a3-bce5-4285-9dd6-c4f21cec32a5 · outbound

This paper cites HateBERT: Retraining BERT for Abusive Language Detection in English.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content HateBERT: Retraining BERT for Abusive Language Detection in English

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.349909Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.349909Z digest=sha256:621cee9da50e94c29c827fa49ec5950c718a347e858883b708b6e0124edd8bec

Observation 320e32b3-3abb-4d98-bc45-50e738c89da4 · outbound

This paper cites Generalizable implicit hate speech detection using contrastive learning.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Generalizable implicit hate speech detection using contrastive learning

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T11:57:59.009796Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-16T11:57:58.355237Z digest=sha256:1a4f1639ca7dcdbca0b2447ab45438a646fde8923066ff4a0f0255312d540c92

Observation 336e58c1-2cfe-4d1c-bf3d-e07727761498 · outbound

This paper cites Toxicity Detection with Generative Prompt-based Inference.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Toxicity Detection with Generative Prompt-based Inference

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.360079Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.360079Z digest=sha256:d85d09ecfd940cd50a6e995457a962d5794087bd7a8bf168566e60f0c46a1ea0

Observation 60bfc48d-daeb-4c23-ad37-d75bc4ece791 · outbound

This paper cites Interpretable Unified Language Checking.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Interpretable Unified Language Checking

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.365238Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.365238Z digest=sha256:0ca59eb8b92160350e543020121196c9676c0ea89e56826d379e46045bcb6627

Observation 942e92d9-3e44-4cee-9252-678314e1b8dd · outbound

This paper cites Efficient toxic content detection by bootstrapping and distilling large language models.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Efficient toxic content detection by bootstrapping and distilling large language models

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T11:57:58.994057Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-16T11:57:58.370279Z digest=sha256:8bf54849a769f73adead196cebabcf311cc09a414beda4a5bba16ba4f91c5052

Observation 0f16f588-b224-4399-9ac9-37a9e14e03e0 · outbound

This paper cites Autorag-hp: Automatic online hyper-parameter tuning for retrieval-augmented generation, 2024.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Autorag-hp: Automatic online hyper-parameter tuning for retrieval-augmented generation, 2024

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T11:57:58.978221Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-16T11:57:58.375333Z digest=sha256:0689633442605c70e42bc7213e9a822dc8482e7ca840287bcf3086a44fa1e416

Observation d7aff224-a7f6-4137-bc57-64d541e29bb4 · outbound

This paper cites Enhancing rag-retrieval to improve llms robustness and resilience to hallucinations.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Enhancing rag-retrieval to improve llms robustness and resilience to hallucinations

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T11:57:58.962628Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-16T11:57:58.380461Z digest=sha256:f0feb441db4920c2756686c878b8874efee4200b5e78ecb85a1f10203f92ee66

Observation 6e635869-fc1b-4e51-9553-e43277539d36 · outbound

This paper cites Beyond Task Performance: Evaluating and Reducing the Flaws of Large Multimodal Models with In-Context Learning.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Beyond Task Performance: Evaluating and Reducing the Flaws of Large Multimodal Models with In-Context Learning

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.384880Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.384880Z digest=sha256:b9e04f00d17b928329361cb8728baebcdda3d3c5bcd91aa1d1a2486e8c2dc636

Observation 4a57a7fb-b546-4e15-8b5f-fdb0cdd21f80 · outbound

This paper cites Principle-driven self-alignment of language models from scratch with minimal human supervision.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Principle-driven self-alignment of language models from scratch with minimal human supervision

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T11:57:58.943906Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-16T11:57:58.389371Z digest=sha256:d65e69ff80237b10fc67ad2cfe93abe5a8d0908fa51c3bfc349d8dc3dcc83ddd

Observation e9d6f8f8-ada5-48c8-a1c8-67027b085e5d · outbound

This paper cites Large Language Models Can Self-Improve.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Large Language Models Can Self-Improve

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.393817Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.393817Z digest=sha256:dc7d89233bbf577767a6a240d15b45f63f9814e8acf45d5f1926c28ead193cbb

Observation 12df2720-929c-498a-81d4-be70bc9e27c2 · outbound

This paper cites Defending chatgpt against jailbreak attack via self-reminders.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Defending chatgpt against jailbreak attack via self-reminders

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.398683Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.398683Z digest=sha256:4b68f29a6454e237837e7a5f6a64b720f9cf0c6601ed30c476b20fca6c71c33a

Observation 328eb7db-aa73-4019-a1bb-2600609ff86d · outbound

This paper cites Learning and Forgetting Unsafe Examples in Large Language Models.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Learning and Forgetting Unsafe Examples in Large Language Models

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.403124Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.403124Z digest=sha256:e2e6471109ba22d8639ecd2f6cfe9bd1994228ed811cf5aeb2483dc16c755a9a

Observation d057b93d-707c-4f3e-83be-681ddef8f05f · outbound

This paper cites CRITIC: Large Language Models Can Self-Correct with Tool-Interactive Critiquing.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content CRITIC: Large Language Models Can Self-Correct with Tool-Interactive Critiquing

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.408251Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.408251Z digest=sha256:54e2134ab639a9f82eac453e5c60cf189bad3b5f51fb8f002b1ddc7c80ca7bdc

Observation 4efc1b79-49e9-43bd-983c-8110d327362b · outbound

This paper cites N-Critics: Self-Refinement of Large Language Models with Ensemble of Critics.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content N-Critics: Self-Refinement of Large Language Models with Ensemble of Critics

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.413300Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.413300Z digest=sha256:4d2aca5d468a63a05dbdadaa0f8b86f725433926b0a7ea3771c08553f5ef1bc5

Observation d5dafa0f-1739-4a33-8471-f128150f9b1e · outbound

This paper cites Self-refine: Iterative refinement with self-feedback.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Self-refine: Iterative refinement with self-feedback

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.418083Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.418083Z digest=sha256:0ae6d7562b0019878958009f3ee466dcf490365745d18ff6007d9feb7819b044

Observation c951aff8-9d27-4c74-b26c-0e1abec7eba9 · outbound

This paper cites Learning From Mistakes Makes LLM Better Reasoner.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Learning From Mistakes Makes LLM Better Reasoner

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.422905Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.422905Z digest=sha256:fbfb037631c52cb2a0900cfe89d16e123e762d76deb7e5f1b273c393bf4390fa

Observation 2e95c6c9-21bd-4feb-aa81-0e9731522847 · outbound

This paper cites On the Intersection of Self-Correction and Trust in Language Models.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content On the Intersection of Self-Correction and Trust in Language Models

Reference 17

Resolution
verified exact
local_arxiv, observed 2026-08-16T11:57:58.668317Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-16T11:57:58.427653Z digest=sha256:66014a07fa470ce4136d58320b0f99838953804684580ce4f7832c2c96b9d0b1

Observation bdca6dd3-a4ea-485b-8a01-8c25ffec1435 · outbound

This paper cites Self-correcting LLM-controlled Diffusion Models.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Self-correcting LLM-controlled Diffusion Models

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.432298Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.432298Z digest=sha256:b4d58b51857caba26f8fa07fba3f224dd00919171e1679742cbe752d03acd334

Observation 62211133-2455-4a2c-8fb3-50b068d890d2 · outbound

This paper cites Automatically Correcting Large Language Models: Surveying the landscape of diverse self-correction strategies.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Automatically Correcting Large Language Models: Surveying the landscape of diverse self-correction strategies

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.436976Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.436976Z digest=sha256:24d1cf6a336812ce4b71a521f646b2a68ae97c28c59366af6b5c430e18c712fc

Observation 9a84671f-7d73-4341-97fa-7a785fc02f8a · outbound

This paper cites SELF-[IN]CORRECT: LLMs Struggle with Discriminating Self-Generated Responses.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content SELF-[IN]CORRECT: LLMs Struggle with Discriminating Self-Generated Responses

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.441508Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.441508Z digest=sha256:55babfea150aa702550985db43a284378a43f3f23d5ef8b4c8f04e295f3a7f2b

Observation 92cceca0-5f6a-4e54-9951-7ad63ac85a96 · outbound

This paper cites Large Language Models Cannot Self-Correct Reasoning Yet.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Large Language Models Cannot Self-Correct Reasoning Yet

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.445879Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.445879Z digest=sha256:ee77b4a259c2cea1cda78eb9dc3daa0f7dbad58d8cebe236eeaf383770f8f18a

Observation 50f6f01b-3dcc-4f2e-8df2-e8216a911a56 · outbound

This paper cites Confidence Matters: Revisiting Intrinsic Self-Correction Capabilities of Large Language Models.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Confidence Matters: Revisiting Intrinsic Self-Correction Capabilities of Large Language Models

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.450689Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.450689Z digest=sha256:ba4390270982f228111e6f32821d9755a36ed49dead66b912cc57e38966295eb

Observation c4a9de15-d9ee-471a-b5a3-04297d85cda3 · outbound

This paper cites Democratizing LLMs: An Exploration of Cost-Performance Trade-offs in Self-Refined Open-Source Models.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Democratizing LLMs: An Exploration of Cost-Performance Trade-offs in Self-Refined Open-Source Models

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.455088Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.455088Z digest=sha256:19c69b8c5fb5b576ed394de70147cf3ea31e8c8a273e34d3b739b2b777a75e0a

Observation 0ebb4933-f62b-4d22-8a2f-3e5ab959c992 · outbound

This paper cites Model editing as a robust and denoised variant of dpo: A case study on toxicity.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Model editing as a robust and denoised variant of dpo: A case study on toxicity

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T11:57:58.898336Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-16T11:57:58.460027Z digest=sha256:ee877a38dc18617c1e7e12a9295ccfda6c9dd71f923748b993879f4d86d6deb3

Observation 0024866d-96ea-4474-9adb-00402ab5ab4a · outbound

This paper cites Gpt-4 technical report, 2024.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Gpt-4 technical report, 2024

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T11:57:58.882566Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-16T11:57:58.464246Z digest=sha256:cc38a9e8b76d509adc0fcc2844ea5e5348185e0e4abb4b6c496bed551823d3d5

Observation 413fb6e2-2ebb-419e-a05c-91442c24af35 · outbound

This paper cites Dai, and Orhan Firat et al.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Dai, and Orhan Firat et al

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T11:57:58.865315Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-16T11:57:58.468665Z digest=sha256:e3e49d0942044ab109d82b131e423e330150ca7fd9abaab0d0081d1b68b3d4b9

Observation f7858d28-88a2-4eba-b66d-39c88436ce30 · outbound

This paper cites Mistral 7B.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Mistral 7B

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.473001Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.473001Z digest=sha256:8778c70c115c29f9f9a4bf7846f4001de03c987cbe635740f1fadb68c71b666c

Observation 3a28d03b-e9d8-44c7-bc94-f7f4a124058a · outbound

This paper cites Gemma: Open Models Based on Gemini Research and Technology.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Gemma: Open Models Based on Gemini Research and Technology

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.477590Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.477590Z digest=sha256:590e7df061b494188eb77a2bece42dc6424f1bd722dd209aed070dc229b98f0c

Observation 688c89b4-8cd8-42db-bd51-d31a57780f21 · outbound

This paper cites an unresolved cited work.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Unresolved cited work

Reference 29

Resolution
unresolved
raw_fallback, observed 2026-08-16T11:57:58.848246Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-16T11:57:58.481821Z digest=sha256:6e6cf30ad2d0601897792468c5a747559eb653c3384f9a57379996f10a2c12b4

Pith citing papers

No inbound Pith citation observations are available.