{"as_of":"2026-08-13T18:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:471ec8eb56751dd905b9e50c2c8074f1c4620f3700520b072e6359dc489ea333","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T05:58:47.845786Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-22T01:19:00.268857Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-22T01:20:51.944045Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.16974","last_updated":"2024-12-22T11:16:53Z","snapshot_observed_at":"2026-08-13T10:39:29.525473Z","submitted_at":"2024-12-22T11:16:53Z","title":"Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs","version":1},"cited_work":{"arxiv_id":"2412.16974","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16974","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cannot or should not? Automatic analysis of refusal composition in IFT/RLHF datasets and refusal behavior of black-box LLMs","venue":null,"work_id":"815e3862-0c9a-480c-9e0b-73abe7c89dd5","year":2024},"citing_paper":{"arxiv_id":"2604.06233","last_updated":"2026-04-03T13:53:23Z","snapshot_observed_at":"2026-08-10T23:40:17.010548Z","submitted_at":"2026-04-03T13:53:23Z","title":"Blind Refusal: Language Models Refuse to Help Users Evade Unjust, Absurd, and Illegitimate Rules","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-13T19:24:54.381722Z"},"links":{"cited_paper":"/paper/2412.16974","citing_paper":"/paper/2604.06233"},"observation_digest":"sha256:c5f293aeacb5bc9909376c061a1c277ed22e54525d92501538f7ecd242d9b87b","observation_id":"6794e616-2bcd-4901-b052-33f277cc3f4d","resolution":{"observed_at":"2026-05-13T19:28:09.935903Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16974","last_updated":"2024-12-22T11:16:53Z","snapshot_observed_at":"2026-08-13T10:39:29.525473Z","submitted_at":"2024-12-22T11:16:53Z","title":"Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs","version":1},"cited_work":{"arxiv_id":"2412.16974","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16974","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cannot or should not? Automatic analysis of refusal composition in IFT/RLHF datasets and refusal behavior of black-box LLMs","venue":null,"work_id":"815e3862-0c9a-480c-9e0b-73abe7c89dd5","year":2024},"citing_paper":{"arxiv_id":"2605.21545","last_updated":"2026-05-20T09:53:31Z","snapshot_observed_at":"2026-08-13T02:25:36.321787Z","submitted_at":"2026-05-20T09:53:31Z","title":"RefusalBench: Why Refusal Rate Misranks Frontier LLMs on Biological Research Prompts","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-22T01:19:00.268857Z"},"links":{"cited_paper":"/paper/2412.16974","citing_paper":"/paper/2605.21545"},"observation_digest":"sha256:a794122134385a9f43278d08c2c9e97da941a8f278bb9af8e3d1d2c0eb3b9af4","observation_id":"fded0e28-e891-4b7a-8aff-bed07bfe1418","resolution":{"observed_at":"2026-05-22T01:20:51.947425Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.16974/citation-record","integrity":"/paper/2412.16974/integrity","json":"/paper/2412.16974/citation-record.json","paper":"/paper/2412.16974"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.04635","last_updated":"2023-09-08T23:12:03Z","snapshot_observed_at":"2026-08-13T10:17:35.961273Z","submitted_at":"2023-09-08T23:12:03Z","title":"Can NLP Models 'Identify', 'Distinguish', and 'Justify' Questions that Don't have a Definitive Answer?","version":1},"cited_work":{"arxiv_id":"2309.04635","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.04635","snapshot_observed_at":"2026-08-11T05:58:48.458438Z","title":"Can NLP Models 'Identify', 'Distinguish', and 'Justify' Questions that Don't have a Definitive Answer?","venue":"cs.CL","work_id":"61fe4126-24a3-46ce-883f-a0bb9b72f022","year":2023},"citing_paper":{"arxiv_id":"2412.16974","last_updated":"2024-12-22T11:16:53Z","snapshot_observed_at":"2026-08-13T10:39:29.525473Z","submitted_at":"2024-12-22T11:16:53Z","title":"Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T05:58:46.685993Z"},"links":{"cited_paper":"/paper/2309.04635","citing_paper":"/paper/2412.16974"},"observation_digest":"sha256:ad1ba72006e209c5eafe95e7289781ffb33d08a6bbee03dc9aca091ad23c1007","observation_id":"415bb368-ae73-4b0c-9f91-12d8b4ee574d","resolution":{"observed_at":"2026-08-11T05:58:48.517626Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00861","last_updated":"2021-12-09T21:40:22Z","snapshot_observed_at":"2026-08-10T12:03:10.373653Z","submitted_at":"2021-12-01T22:24:34Z","title":"A General Language Assistant as a Laboratory for Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.00861","snapshot_observed_at":"2026-08-11T05:58:46.718112Z","title":"A general language assistant as a laboratory for alignment, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.16974","last_updated":"2024-12-22T11:16:53Z","snapshot_observed_at":"2026-08-13T10:39:29.525473Z","submitted_at":"2024-12-22T11:16:53Z","title":"Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T05:58:46.718112Z"},"links":{"cited_paper":"/paper/2112.00861","citing_paper":"/paper/2412.16974"},"observation_digest":"sha256:31376c6fbd36d660184847e85730f64462b19408196fef21d18e2151fafc18a3","observation_id":"2f723bcc-5e0b-4061-bb80-8e5ad65cae2c","resolution":{"observed_at":"2026-08-11T05:58:46.718112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-11T05:58:46.724041Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback, 2022 a","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16974","last_updated":"2024-12-22T11:16:53Z","snapshot_observed_at":"2026-08-13T10:39:29.525473Z","submitted_at":"2024-12-22T11:16:53Z","title":"Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T05:58:46.724041Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2412.16974"},"observation_digest":"sha256:08339a9dd26304684b1b33a94f3d9c1bd88554350ff6074026f83888c64fad06","observation_id":"7c321cdb-3502-4726-8c7d-e9a1d2d139a8","resolution":{"observed_at":"2026-08-11T05:58:46.724041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-11T05:58:46.728472Z","title":"Bowman, Zac Hatfield-Dodds, Ben Mann, Dario Amodei, Nicholas Joseph, Sam McCandlish, Tom Brown, and Jared Kaplan","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16974","last_updated":"2024-12-22T11:16:53Z","snapshot_observed_at":"2026-08-13T10:39:29.525473Z","submitted_at":"2024-12-22T11:16:53Z","title":"Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T05:58:46.728472Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2412.16974"},"observation_digest":"sha256:1b5b6cf3736c7b19dfdf3eec2762f922af837bd05fb68ea18d185b05b869d3ad","observation_id":"a5ebfa30-5335-4250-9fb9-e7f65f673208","resolution":{"observed_at":"2026-08-11T05:58:46.728472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:58:46.732208Z","title":"A unified taxonomy of harmful content","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.16974","last_updated":"2024-12-22T11:16:53Z","snapshot_observed_at":"2026-08-13T10:39:29.525473Z","submitted_at":"2024-12-22T11:16:53Z","title":"Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T05:58:46.732208Z"},"links":{"citing_paper":"/paper/2412.16974"},"observation_digest":"sha256:3313ebb4ee99ea56649f3cfdbe0f9a2fe23d18e57263286aa73a4e388704b8dd","observation_id":"b5c01f6a-6782-41b4-b126-d7dafd5ede13","resolution":{"observed_at":"2026-08-11T05:58:46.732208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:58:48.551580Z","title":"Information hazards: A typology of potential harms from knowledge","venue":null,"work_id":"26b98af4-083e-4b7e-88b5-09913191eacf","year":2011},"citing_paper":{"arxiv_id":"2412.16974","last_updated":"2024-12-22T11:16:53Z","snapshot_observed_at":"2026-08-13T10:39:29.525473Z","submitted_at":"2024-12-22T11:16:53Z","title":"Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T05:58:46.735933Z"},"links":{"citing_paper":"/paper/2412.16974"},"observation_digest":"sha256:119a0352d1254658ae6b264710b169c630770ebf72e947bd6db78bd2b8c1f177","observation_id":"1ee5359f-6805-4140-8d39-29666863ae9e","resolution":{"observed_at":"2026-08-11T05:58:48.609003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:58:48.538128Z","title":"Deep Reinforcement Learning from Human Preferences","venue":null,"work_id":"456428dc-1a1c-44a1-88ed-fedbfc595188","year":2017},"citing_paper":{"arxiv_id":"2412.16974","last_updated":"2024-12-22T11:16:53Z","snapshot_observed_at":"2026-08-13T10:39:29.525473Z","submitted_at":"2024-12-22T11:16:53Z","title":"Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T05:58:46.740489Z"},"links":{"citing_paper":"/paper/2412.16974"},"observation_digest":"sha256:09f40bb39fa34a4effa1a8468338b9675ce3216f580b3d816ca1d6ff15b9bc13","observation_id":"e3deb010-0cba-44ec-b3db-e02d6e300885","resolution":{"observed_at":"2026-08-11T05:58:48.543432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05668","last_updated":"2025-05-26T12:56:04Z","snapshot_observed_at":"2026-08-13T04:23:24.435143Z","submitted_at":"2024-02-08T13:42:50Z","title":"JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05668","snapshot_observed_at":"2026-08-11T05:58:46.743754Z","title":"Comprehensive assessment of jailbreak attacks against llms, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16974","last_updated":"2024-12-22T11:16:53Z","snapshot_observed_at":"2026-08-13T10:39:29.525473Z","submitted_at":"2024-12-22T11:16:53Z","title":"Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T05:58:46.743754Z"},"links":{"cited_paper":"/paper/2402.05668","citing_paper":"/paper/2412.16974"},"observation_digest":"sha256:389c0be704a85505b5d1c49c0b08a964f6f9c6876e649bc3b08268776245caff","observation_id":"c16f6304-151f-48cc-a1eb-357e90be164f","resolution":{"observed_at":"2026-08-11T05:58:46.743754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15062","last_updated":"2024-10-02T02:09:37Z","snapshot_observed_at":"2026-08-13T04:12:25.369481Z","submitted_at":"2024-02-23T02:24:36Z","title":"Don't Just Say \"I don't know\"! Self-aligning Large Language Models for Responding to Unknown Questions with Explanations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15062","snapshot_observed_at":"2026-08-11T05:58:46.747261Z","title":"i don't know","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16974","last_updated":"2024-12-22T11:16:53Z","snapshot_observed_at":"2026-08-13T10:39:29.525473Z","submitted_at":"2024-12-22T11:16:53Z","title":"Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T05:58:46.747261Z"},"links":{"cited_paper":"/paper/2402.15062","citing_paper":"/paper/2412.16974"},"observation_digest":"sha256:4e1c3bc7a1d2c74e34077d57f4ec9d9016489e8aadda34c06bcb966f68ab403b","observation_id":"3e096ccb-11f5-49cb-8127-375e8a945b15","resolution":{"observed_at":"2026-08-11T05:58:46.747261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-11T05:58:46.751649Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16974","last_updated":"2024-12-22T11:16:53Z","snapshot_observed_at":"2026-08-13T10:39:29.525473Z","submitted_at":"2024-12-22T11:16:53Z","title":"Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T05:58:46.751649Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2412.16974"},"observation_digest":"sha256:5eac1b7bdd4fe3f6eadff1e80da00d0c7f484abc8261230903d9df89dc3b054a","observation_id":"6316c1e8-b068-4329-a185-52ee16a778f0","resolution":{"observed_at":"2026-08-11T05:58:46.751649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.11462","last_updated":"2020-09-25T20:22:26Z","snapshot_observed_at":"2026-08-09T05:10:26.091710Z","submitted_at":"2020-09-24T03:17:19Z","title":"RealToxicityPrompts: Evaluating Neural Toxic Degeneration in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.11462","snapshot_observed_at":"2026-08-11T05:58:46.832039Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.16974","last_updated":"2024-12-22T11:16:53Z","snapshot_observed_at":"2026-08-13T10:39:29.525473Z","submitted_at":"2024-12-22T11:16:53Z","title":"Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T05:58:46.832039Z"},"links":{"cited_paper":"/paper/2009.11462","citing_paper":"/paper/2412.16974"},"observation_digest":"sha256:e5f4bbb6e7cd0ffbba11780b284e0be6a0d858bfb52b00a842b0f77129553526","observation_id":"f93b0e72-4068-4084-80af-7614f987af3b","resolution":{"observed_at":"2026-08-11T05:58:46.832039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14375","last_updated":"2022-09-28T19:04:43Z","snapshot_observed_at":"2026-08-11T23:28:54.309888Z","submitted_at":"2022-09-28T19:04:43Z","title":"Improving alignment of dialogue agents via targeted human judgements","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14375","snapshot_observed_at":"2026-08-11T05:58:46.954944Z","title":"Improving alignment of dialogue agents via targeted human judgements, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16974","last_updated":"2024-12-22T11:16:53Z","snapshot_observed_at":"2026-08-13T10:39:29.525473Z","submitted_at":"2024-12-22T11:16:53Z","title":"Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T05:58:46.954944Z"},"links":{"cited_paper":"/paper/2209.14375","citing_paper":"/paper/2412.16974"},"observation_digest":"sha256:72b18282a8f63321e0f3638279d2b75db38a4adcd80c9ef456014eb5fa0b40e0","observation_id":"8a0e703a-f44b-47ef-a833-7a9fc7a41a1a","resolution":{"observed_at":"2026-08-11T05:58:46.954944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.09509","last_updated":"2022-07-14T13:04:29Z","snapshot_observed_at":"2026-08-13T16:20:27.644638Z","submitted_at":"2022-03-17T17:57:56Z","title":"ToxiGen: A Large-Scale Machine-Generated Dataset for Adversarial and Implicit Hate Speech Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.09509","snapshot_observed_at":"2026-08-11T05:58:47.006453Z","title":"Toxigen: A large-scale machine-generated dataset for adversarial and implicit hate speech detection, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16974","last_updated":"2024-12-22T11:16:53Z","snapshot_observed_at":"2026-08-13T10:39:29.525473Z","submitted_at":"2024-12-22T11:16:53Z","title":"Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T05:58:47.006453Z"},"links":{"cited_paper":"/paper/2203.09509","citing_paper":"/paper/2412.16974"},"observation_digest":"sha256:ae4c0053429b912cd0afcf60caa43c4f462f6b14a9bfc4b7f01d2fe23ce98d8d","observation_id":"47694ab7-8434-432f-a732-d32674600a5f","resolution":{"observed_at":"2026-08-11T05:58:47.006453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.00751","last_updated":"2019-06-13T17:48:30Z","snapshot_observed_at":"2026-07-06T07:30:44.870185Z","submitted_at":"2019-02-02T16:29:47Z","title":"Parameter-Efficient Transfer Learning for NLP","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.00751","snapshot_observed_at":"2026-08-11T05:58:47.010113Z","title":"Parameter-efficient transfer learning for NLP","venue":null,"work_id":null,"year":1902},"citing_paper":{"arxiv_id":"2412.16974","last_updated":"2024-12-22T11:16:53Z","snapshot_observed_at":"2026-08-13T10:39:29.525473Z","submitted_at":"2024-12-22T11:16:53Z","title":"Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T05:58:47.010113Z"},"links":{"cited_paper":"/paper/1902.00751","citing_paper":"/paper/2412.16974"},"observation_digest":"sha256:425af2465097e5cff5b66b077c1735ada7afaa78a3e59793daae567af300f9e3","observation_id":"3f792bc3-b2ad-405c-a89c-83342f6715b8","resolution":{"observed_at":"2026-08-11T05:58:47.010113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06987","last_updated":"2023-10-10T20:15:54Z","snapshot_observed_at":"2026-07-06T16:30:46.321160Z","submitted_at":"2023-10-10T20:15:54Z","title":"Catastrophic Jailbreak of Open-source LLMs via Exploiting Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06987","snapshot_observed_at":"2026-08-11T05:58:47.014005Z","title":"Catastrophic jailbreak of open-source llms via exploiting generation, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16974","last_updated":"2024-12-22T11:16:53Z","snapshot_observed_at":"2026-08-13T10:39:29.525473Z","submitted_at":"2024-12-22T11:16:53Z","title":"Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T05:58:47.014005Z"},"links":{"cited_paper":"/paper/2310.06987","citing_paper":"/paper/2412.16974"},"observation_digest":"sha256:06013d96107ae7ca90db4e4d1e0ccecc8701ebf9e97a363239fb62a488b62195","observation_id":"120b379e-a521-4797-b5ce-c113137b7350","resolution":{"observed_at":"2026-08-11T05:58:47.014005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:58:47.018964Z","title":"Beavertails: Towards improved safety alignment of llm via a human-preference dataset, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16974","last_updated":"2024-12-22T11:16:53Z","snapshot_observed_at":"2026-08-13T10:39:29.525473Z","submitted_at":"2024-12-22T11:16:53Z","title":"Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T05:58:47.018964Z"},"links":{"citing_paper":"/paper/2412.16974"},"observation_digest":"sha256:ee9facc45a5452274e8c0e0654b2a0593ec60c7c5dd19768b2bcff9558341817","observation_id":"de8c7a63-d30e-4450-9c7f-3d5e70867b99","resolution":{"observed_at":"2026-08-11T05:58:47.018964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:58:47.022320Z","title":"How can we know when language models know? on the calibration of language models for question answering","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.16974","last_updated":"2024-12-22T11:16:53Z","snapshot_observed_at":"2026-08-13T10:39:29.525473Z","submitted_at":"2024-12-22T11:16:53Z","title":"Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T05:58:47.022320Z"},"links":{"citing_paper":"/paper/2412.16974"},"observation_digest":"sha256:2190d6b460b84086efedb6de5756a4a02cb2c44c3a11e537000b5b8569e7aa40","observation_id":"d9b5ba2a-e286-4c71-8a01-45ade5ecd83f","resolution":{"observed_at":"2026-08-11T05:58:47.022320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17428","last_updated":"2025-02-25T00:35:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-27T17:59:45Z","title":"NV-Embed: Improved Techniques for Training LLMs as Generalist Embedding Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17428","snapshot_observed_at":"2026-08-11T05:58:47.026583Z","title":"Nv-embed: Improved techniques for training llms as generalist embedding models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16974","last_updated":"2024-12-22T11:16:53Z","snapshot_observed_at":"2026-08-13T10:39:29.525473Z","submitted_at":"2024-12-22T11:16:53Z","title":"Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T05:58:47.026583Z"},"links":{"cited_paper":"/paper/2405.17428","citing_paper":"/paper/2412.16974"},"observation_digest":"sha256:6b13214ac3798720463cc5a8d7e4e6cb6bda12fa6c03a8e318f465a600604896","observation_id":"90ad7620-3d9c-4bb5-b0fe-781b2272cba7","resolution":{"observed_at":"2026-08-11T05:58:47.026583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05044","last_updated":"2024-06-07T12:05:46Z","snapshot_observed_at":"2026-08-13T04:24:04.479852Z","submitted_at":"2024-02-07T17:33:54Z","title":"SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05044","snapshot_observed_at":"2026-08-11T05:58:47.068771Z","title":"Salad-bench: A hierarchical and comprehensive safety benchmark for large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16974","last_updated":"2024-12-22T11:16:53Z","snapshot_observed_at":"2026-08-13T10:39:29.525473Z","submitted_at":"2024-12-22T11:16:53Z","title":"Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T05:58:47.068771Z"},"links":{"cited_paper":"/paper/2402.05044","citing_paper":"/paper/2412.16974"},"observation_digest":"sha256:7035f7fdccb32c6337b82fcddb9b4ac4b75a1811a1cdb32097710913320d2fc5","observation_id":"b679eb1e-a6af-4246-8abd-373faf51d28b","resolution":{"observed_at":"2026-08-11T05:58:47.068771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17389","last_updated":"2023-10-26T13:35:41Z","snapshot_observed_at":"2026-08-13T05:39:52.864124Z","submitted_at":"2023-10-26T13:35:41Z","title":"ToxicChat: Unveiling Hidden Challenges of Toxicity Detection in Real-World User-AI Conversation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17389","snapshot_observed_at":"2026-08-11T05:58:47.152264Z","title":"Toxicchat: Unveiling hidden challenges of toxicity detection in real-world user-ai conversation, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16974","last_updated":"2024-12-22T11:16:53Z","snapshot_observed_at":"2026-08-13T10:39:29.525473Z","submitted_at":"2024-12-22T11:16:53Z","title":"Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T05:58:47.152264Z"},"links":{"cited_paper":"/paper/2310.17389","citing_paper":"/paper/2412.16974"},"observation_digest":"sha256:208b67016fef7346d7bdebb83e5c31e9316381c625ce0fef48a5aded295e1c3d","observation_id":"198ee191-dbd8-4346-be03-fbbedc16531f","resolution":{"observed_at":"2026-08-11T05:58:47.152264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09731","last_updated":"2024-02-16T17:30:41Z","snapshot_observed_at":"2026-08-13T05:24:02.056118Z","submitted_at":"2023-11-16T10:02:40Z","title":"Examining LLMs' Uncertainty Expression Towards Questions Outside Parametric Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09731","snapshot_observed_at":"2026-08-11T05:58:47.276350Z","title":"Examining llms' uncertainty expression towards questions outside parametric knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16974","last_updated":"2024-12-22T11:16:53Z","snapshot_observed_at":"2026-08-13T10:39:29.525473Z","submitted_at":"2024-12-22T11:16:53Z","title":"Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T05:58:47.276350Z"},"links":{"cited_paper":"/paper/2311.09731","citing_paper":"/paper/2412.16974"},"observation_digest":"sha256:dbc0574940a928728e7e48fc92080930674fcc421dd70630f9acc4a67637cb75","observation_id":"5edf7f31-a96c-4529-9744-e4cba6d49f36","resolution":{"observed_at":"2026-08-11T05:58:47.276350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16221","last_updated":"2024-09-24T14:25:58Z","snapshot_observed_at":"2026-08-12T23:16:43.630105Z","submitted_at":"2024-07-23T06:56:54Z","title":"Do LLMs Know When to NOT Answer? Investigating Abstention Abilities of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.16221","snapshot_observed_at":"2026-08-11T05:58:47.355053Z","title":"Do llms know when to not answer? investigating abstention abilities of large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16974","last_updated":"2024-12-22T11:16:53Z","snapshot_observed_at":"2026-08-13T10:39:29.525473Z","submitted_at":"2024-12-22T11:16:53Z","title":"Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T05:58:47.355053Z"},"links":{"cited_paper":"/paper/2407.16221","citing_paper":"/paper/2412.16974"},"observation_digest":"sha256:36b62b2ff21f3ca1ada6091438e3e1ef8d498956a981ab8bc615609634309486","observation_id":"3039cc7f-61f1-486a-8b95-ec772df7e680","resolution":{"observed_at":"2026-08-11T05:58:47.355053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04249","last_updated":"2024-02-27T04:43:08Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:08Z","title":"HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04249","snapshot_observed_at":"2026-08-11T05:58:47.359674Z","title":"Harmbench: A standardized evaluation framework for automated red teaming and robust refusal, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16974","last_updated":"2024-12-22T11:16:53Z","snapshot_observed_at":"2026-08-13T10:39:29.525473Z","submitted_at":"2024-12-22T11:16:53Z","title":"Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T05:58:47.359674Z"},"links":{"cited_paper":"/paper/2402.04249","citing_paper":"/paper/2412.16974"},"observation_digest":"sha256:6f0830fba10ff6a24388e97c792862962235c42b8237b5435fb0ced8abdbf6a1","observation_id":"dad2f2bb-285e-4ae2-aff3-5d44079fb857","resolution":{"observed_at":"2026-08-11T05:58:47.359674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.03426","last_updated":"2020-09-18T01:56:41Z","snapshot_observed_at":"2026-08-02T15:32:07.466568Z","submitted_at":"2018-02-09T19:39:33Z","title":"UMAP: Uniform Manifold Approximation and Projection for Dimension Reduction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.03426","snapshot_observed_at":"2026-08-11T05:58:47.363796Z","title":"Umap: Uniform manifold approximation and projection for dimension reduction, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.16974","last_updated":"2024-12-22T11:16:53Z","snapshot_observed_at":"2026-08-13T10:39:29.525473Z","submitted_at":"2024-12-22T11:16:53Z","title":"Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T05:58:47.363796Z"},"links":{"cited_paper":"/paper/1802.03426","citing_paper":"/paper/2412.16974"},"observation_digest":"sha256:37dfd8645866faec4dfbf25b62611529794c73a42409b97b4c0279bf0bc5e500","observation_id":"1ca157f1-0b12-41dd-b9fd-f0be2384c948","resolution":{"observed_at":"2026-08-11T05:58:47.363796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01111","last_updated":"2024-11-02T02:22:21Z","snapshot_observed_at":"2026-08-12T22:09:21.291029Z","submitted_at":"2024-11-02T02:22:21Z","title":"Rule Based Rewards for Language Model Safety","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01111","snapshot_observed_at":"2026-08-11T05:58:47.367853Z","title":"Rule based rewards for language model safety, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16974","last_updated":"2024-12-22T11:16:53Z","snapshot_observed_at":"2026-08-13T10:39:29.525473Z","submitted_at":"2024-12-22T11:16:53Z","title":"Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T05:58:47.367853Z"},"links":{"cited_paper":"/paper/2411.01111","citing_paper":"/paper/2412.16974"},"observation_digest":"sha256:7fb74f055ac3a87064172a3f88626ae09e6204b5a94906caaae2a7424a6075c2","observation_id":"4b4a198e-3d01-452e-a5cb-12c5f2dcbb0a","resolution":{"observed_at":"2026-08-11T05:58:47.367853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01786","last_updated":"2023-05-29T16:40:37Z","snapshot_observed_at":"2026-08-13T13:50:08.373165Z","submitted_at":"2022-11-03T13:19:32Z","title":"Crosslingual Generalization through Multitask Finetuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01786","snapshot_observed_at":"2026-08-11T05:58:47.372522Z","title":"Crosslingual generalization through multitask finetuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16974","last_updated":"2024-12-22T11:16:53Z","snapshot_observed_at":"2026-08-13T10:39:29.525473Z","submitted_at":"2024-12-22T11:16:53Z","title":"Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T05:58:47.372522Z"},"links":{"cited_paper":"/paper/2211.01786","citing_paper":"/paper/2412.16974"},"observation_digest":"sha256:8c22df803cb148b68d50874f552cba0cf0895f248a86320dcfbad5e4eb220ee9","observation_id":"dd4da059-4b99-4f46-a0a8-f60298839123","resolution":{"observed_at":"2026-08-11T05:58:47.372522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06435","last_updated":"2024-10-17T01:10:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-12T20:01:52Z","title":"A Comprehensive Overview of Large Language Models","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06435","snapshot_observed_at":"2026-08-11T05:58:47.375962Z","title":"A comprehensive overview of large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16974","last_updated":"2024-12-22T11:16:53Z","snapshot_observed_at":"2026-08-13T10:39:29.525473Z","submitted_at":"2024-12-22T11:16:53Z","title":"Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T05:58:47.375962Z"},"links":{"cited_paper":"/paper/2307.06435","citing_paper":"/paper/2412.16974"},"observation_digest":"sha256:5e602c4c67fa2a0d69f3e6c1207fdfa7b393c193aee25fe1db73c831a3629758","observation_id":"f5efb365-cde2-4cca-b350-82b67dce859e","resolution":{"observed_at":"2026-08-11T05:58:47.375962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:58:48.526711Z","title":"Model spec, 5 2024","venue":null,"work_id":"5ba5ba40-4b62-4b91-896d-33d2e07cf469","year":2024},"citing_paper":{"arxiv_id":"2412.16974","last_updated":"2024-12-22T11:16:53Z","snapshot_observed_at":"2026-08-13T10:39:29.525473Z","submitted_at":"2024-12-22T11:16:53Z","title":"Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T05:58:47.379944Z"},"links":{"citing_paper":"/paper/2412.16974"},"observation_digest":"sha256:68e349fc94d5e8275d129f43309fb03b0145e84eebe3b0d03f6c3e3aa58c6f7e","observation_id":"5e7b98eb-8ea3-4eaf-ac09-7ef48f516b0a","resolution":{"observed_at":"2026-08-11T05:58:48.530851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-11T05:58:47.383234Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16974","last_updated":"2024-12-22T11:16:53Z","snapshot_observed_at":"2026-08-13T10:39:29.525473Z","submitted_at":"2024-12-22T11:16:53Z","title":"Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T05:58:47.383234Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2412.16974"},"observation_digest":"sha256:10b2a3c8d4d9da99a9e2801a7ffc8dc2fd25abe10b0faad4bcba4f4d26b3bc37","observation_id":"37522a85-fc18-4ede-a374-fccb088c0ca9","resolution":{"observed_at":"2026-08-11T05:58:47.383234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-11T05:58:47.450308Z","title":"Manning, and Chelsea Finn","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16974","last_updated":"2024-12-22T11:16:53Z","snapshot_observed_at":"2026-08-13T10:39:29.525473Z","submitted_at":"2024-12-22T11:16:53Z","title":"Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T05:58:47.450308Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2412.16974"},"observation_digest":"sha256:6ba8f26f041500583072303c1420b810ac6721ce935cec4fa567cbb0b81757e9","observation_id":"ef368ef7-9cb0-404a-b61b-ee94084db68e","resolution":{"observed_at":"2026-08-11T05:58:47.450308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03423","last_updated":"2023-06-14T05:13:34Z","snapshot_observed_at":"2026-08-13T11:23:43.873599Z","submitted_at":"2023-06-06T05:50:58Z","title":"I'm Afraid I Can't Do That: Predicting Prompt Refusal in Black-Box Generative Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03423","snapshot_observed_at":"2026-08-11T05:58:47.577628Z","title":"I'm afraid i can't do that: Predicting prompt refusal in black-box generative language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16974","last_updated":"2024-12-22T11:16:53Z","snapshot_observed_at":"2026-08-13T10:39:29.525473Z","submitted_at":"2024-12-22T11:16:53Z","title":"Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T05:58:47.577628Z"},"links":{"cited_paper":"/paper/2306.03423","citing_paper":"/paper/2412.16974"},"observation_digest":"sha256:c276d66786445982c3e854e673a418756b99e3bf0efe6699706e89b07f6b4337","observation_id":"f07b7287-65fd-4476-a87e-eb2c9188354e","resolution":{"observed_at":"2026-08-11T05:58:47.577628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01263","last_updated":"2024-04-01T11:50:35Z","snapshot_observed_at":"2026-08-03T00:58:55.865010Z","submitted_at":"2023-08-02T16:30:40Z","title":"XSTest: A Test Suite for Identifying Exaggerated Safety Behaviours in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01263","snapshot_observed_at":"2026-08-11T05:58:47.656818Z","title":"Xstest: A test suite for identifying exaggerated safety behaviours in large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16974","last_updated":"2024-12-22T11:16:53Z","snapshot_observed_at":"2026-08-13T10:39:29.525473Z","submitted_at":"2024-12-22T11:16:53Z","title":"Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T05:58:47.656818Z"},"links":{"cited_paper":"/paper/2308.01263","citing_paper":"/paper/2412.16974"},"observation_digest":"sha256:c1fe583f940d63ba6fa5e2f88d9b379312bfd450d834d55e3706704e1bfac8fd","observation_id":"13a117a8-50ce-4c0a-a611-4c302f667643","resolution":{"observed_at":"2026-08-11T05:58:47.656818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-11T05:58:47.660911Z","title":"Proximal policy optimization algorithms, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.16974","last_updated":"2024-12-22T11:16:53Z","snapshot_observed_at":"2026-08-13T10:39:29.525473Z","submitted_at":"2024-12-22T11:16:53Z","title":"Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T05:58:47.660911Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2412.16974"},"observation_digest":"sha256:12cd28a9ba7d19266908bd97aefd8ac5d8ab2a71e83acd01832336e1ed8abc82","observation_id":"f80c1d25-cd01-4831-90aa-7295f79daefb","resolution":{"observed_at":"2026-08-11T05:58:47.660911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03825","last_updated":"2024-05-15T12:06:31Z","snapshot_observed_at":"2026-07-06T16:03:34.432602Z","submitted_at":"2023-08-07T16:55:20Z","title":"\"Do Anything Now\": Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03825","snapshot_observed_at":"2026-08-11T05:58:47.664382Z","title":"do anything now","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16974","last_updated":"2024-12-22T11:16:53Z","snapshot_observed_at":"2026-08-13T10:39:29.525473Z","submitted_at":"2024-12-22T11:16:53Z","title":"Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T05:58:47.664382Z"},"links":{"cited_paper":"/paper/2308.03825","citing_paper":"/paper/2412.16974"},"observation_digest":"sha256:799d4b088de700991081a0daa549a2ef39d8b5c541bec802e0d4844305b3d75e","observation_id":"9983772f-a372-4a91-94bb-3b5a5aac05f5","resolution":{"observed_at":"2026-08-11T05:58:47.664382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.01325","last_updated":"2022-02-15T19:09:36Z","snapshot_observed_at":"2026-08-12T00:02:16.697336Z","submitted_at":"2020-09-02T19:54:41Z","title":"Learning to summarize from human feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.01325","snapshot_observed_at":"2026-08-11T05:58:47.668432Z","title":"Ziegler, Ryan Lowe, Chelsea Voss, Alec Radford, Dario Amodei, and Paul Christiano","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16974","last_updated":"2024-12-22T11:16:53Z","snapshot_observed_at":"2026-08-13T10:39:29.525473Z","submitted_at":"2024-12-22T11:16:53Z","title":"Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T05:58:47.668432Z"},"links":{"cited_paper":"/paper/2009.01325","citing_paper":"/paper/2412.16974"},"observation_digest":"sha256:e49102c5e5788ebf280463ca288092f8183aa5beee0aafdb377eef224691f3a0","observation_id":"7739f1a3-c589-4f31-b004-e115abb647a1","resolution":{"observed_at":"2026-08-11T05:58:47.668432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00905","last_updated":"2024-06-20T14:15:23Z","snapshot_observed_at":"2026-08-13T05:59:39.506007Z","submitted_at":"2023-10-02T05:23:34Z","title":"All Languages Matter: On the Multilingual Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00905","snapshot_observed_at":"2026-08-11T05:58:47.672211Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16974","last_updated":"2024-12-22T11:16:53Z","snapshot_observed_at":"2026-08-13T10:39:29.525473Z","submitted_at":"2024-12-22T11:16:53Z","title":"Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T05:58:47.672211Z"},"links":{"cited_paper":"/paper/2310.00905","citing_paper":"/paper/2412.16974"},"observation_digest":"sha256:1229a6228891f71781a2c76a04df1ed02b192dfd7819f9b9af601ec60dba67c9","observation_id":"95649f1d-3643-4c02-b9b5-e2adfc789d1b","resolution":{"observed_at":"2026-08-11T05:58:47.672211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.07705","last_updated":"2022-10-24T07:00:15Z","snapshot_observed_at":"2026-08-13T16:00:55.684745Z","submitted_at":"2022-04-16T03:12:30Z","title":"Super-NaturalInstructions: Generalization via Declarative Instructions on 1600+ NLP Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.07705","snapshot_observed_at":"2026-08-11T05:58:47.676389Z","title":"Smith, Hannaneh Hajishirzi, and Daniel Khashabi","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16974","last_updated":"2024-12-22T11:16:53Z","snapshot_observed_at":"2026-08-13T10:39:29.525473Z","submitted_at":"2024-12-22T11:16:53Z","title":"Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T05:58:47.676389Z"},"links":{"cited_paper":"/paper/2204.07705","citing_paper":"/paper/2412.16974"},"observation_digest":"sha256:6de8d7b2f268e1dbed3bec2b8f721dc428e349280351d8cd30360568a7de547c","observation_id":"371fa624-1bd7-492b-8625-d337a844954c","resolution":{"observed_at":"2026-08-11T05:58:47.676389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:58:47.680455Z","title":"Smith, Daniel Khashabi, and Hannaneh Hajishirzi","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16974","last_updated":"2024-12-22T11:16:53Z","snapshot_observed_at":"2026-08-13T10:39:29.525473Z","submitted_at":"2024-12-22T11:16:53Z","title":"Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T05:58:47.680455Z"},"links":{"citing_paper":"/paper/2412.16974"},"observation_digest":"sha256:41089c97e5092808c84d0636997bf905f52b9f82c06c145ac9ecfd9b8fe6adbc","observation_id":"7137eb1c-fdac-46b1-8510-1a675799074a","resolution":{"observed_at":"2026-08-11T05:58:47.680455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13387","last_updated":"2023-09-04T01:47:30Z","snapshot_observed_at":"2026-08-13T10:27:40.164741Z","submitted_at":"2023-08-25T14:02:12Z","title":"Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13387","snapshot_observed_at":"2026-08-11T05:58:47.683998Z","title":"Do-not-answer: A dataset for evaluating safeguards in llms, 2023 b","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16974","last_updated":"2024-12-22T11:16:53Z","snapshot_observed_at":"2026-08-13T10:39:29.525473Z","submitted_at":"2024-12-22T11:16:53Z","title":"Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T05:58:47.683998Z"},"links":{"cited_paper":"/paper/2308.13387","citing_paper":"/paper/2412.16974"},"observation_digest":"sha256:ad2013028cac90e5ba99bf9e41e2ef975b1384e1c8aa6068dadefebeed543005","observation_id":"f7596a72-84aa-4feb-bb5e-73f9ff413f89","resolution":{"observed_at":"2026-08-11T05:58:47.683998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01652","last_updated":"2022-02-08T20:26:45Z","snapshot_observed_at":"2026-08-13T15:30:05.624512Z","submitted_at":"2021-09-03T17:55:52Z","title":"Finetuned Language Models Are Zero-Shot Learners","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.01652","snapshot_observed_at":"2026-08-11T05:58:47.687891Z","title":"Zhao, Kelvin Guu, Adams Wei Yu, Brian Lester, Nan Du, Andrew M","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16974","last_updated":"2024-12-22T11:16:53Z","snapshot_observed_at":"2026-08-13T10:39:29.525473Z","submitted_at":"2024-12-22T11:16:53Z","title":"Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T05:58:47.687891Z"},"links":{"cited_paper":"/paper/2109.01652","citing_paper":"/paper/2412.16974"},"observation_digest":"sha256:c2c600c41835c239801163e21cc2c92517232bac0f5522204486df56c77a6112","observation_id":"b1393e13-104e-4193-aa07-f2339d4e7367","resolution":{"observed_at":"2026-08-11T05:58:47.687891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-08-13T07:04:41.220509Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-11T05:58:47.691627Z","title":"Chain-of-thought prompting elicits reasoning in large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16974","last_updated":"2024-12-22T11:16:53Z","snapshot_observed_at":"2026-08-13T10:39:29.525473Z","submitted_at":"2024-12-22T11:16:53Z","title":"Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T05:58:47.691627Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2412.16974"},"observation_digest":"sha256:a5292409b6ff16cf1d1fa2f0f79cdfbf242ec2b3d5ac4b611360f2c1f200150b","observation_id":"d7386ce8-ace2-423e-a824-a96e41172a14","resolution":{"observed_at":"2026-08-11T05:58:47.691627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14598","last_updated":"2025-03-01T21:45:36Z","snapshot_observed_at":"2026-08-12T23:38:07.892461Z","submitted_at":"2024-06-20T17:56:07Z","title":"SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14598","snapshot_observed_at":"2026-08-11T05:58:47.761384Z","title":"Sorry-bench: Systematically evaluating large language model safety refusal behaviors, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16974","last_updated":"2024-12-22T11:16:53Z","snapshot_observed_at":"2026-08-13T10:39:29.525473Z","submitted_at":"2024-12-22T11:16:53Z","title":"Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T05:58:47.761384Z"},"links":{"cited_paper":"/paper/2406.14598","citing_paper":"/paper/2412.16974"},"observation_digest":"sha256:ce4e0ffb0efe5c331e72345de9434cfc7aa2c03efccf8813636263a085429888","observation_id":"bcb95f06-9061-4423-80a8-35073be2d2ba","resolution":{"observed_at":"2026-08-11T05:58:47.761384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13063","last_updated":"2024-03-17T04:38:48Z","snapshot_observed_at":"2026-07-06T15:45:39.649725Z","submitted_at":"2023-06-22T17:31:44Z","title":"Can LLMs Express Their Uncertainty? An Empirical Evaluation of Confidence Elicitation in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13063","snapshot_observed_at":"2026-08-11T05:58:47.829233Z","title":"Can llms express their uncertainty? an empirical evaluation of confidence elicitation in llms, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16974","last_updated":"2024-12-22T11:16:53Z","snapshot_observed_at":"2026-08-13T10:39:29.525473Z","submitted_at":"2024-12-22T11:16:53Z","title":"Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T05:58:47.829233Z"},"links":{"cited_paper":"/paper/2306.13063","citing_paper":"/paper/2412.16974"},"observation_digest":"sha256:de711fe7a9256a1250581e0db487b50bb48650afaddca6c8095fde220a9bb1f2","observation_id":"dd6638d8-c1ca-4a13-8aae-b667bffed841","resolution":{"observed_at":"2026-08-11T05:58:47.829233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09677","last_updated":"2024-06-07T02:46:36Z","snapshot_observed_at":"2026-08-13T11:43:32.776813Z","submitted_at":"2023-11-16T08:45:44Z","title":"R-Tuning: Instructing Large Language Models to Say `I Don't Know'","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09677","snapshot_observed_at":"2026-08-11T05:58:47.833858Z","title":"Fung, Qing Lian, Xingyao Wang, Yangyi Chen, Heng Ji, and Tong Zhang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16974","last_updated":"2024-12-22T11:16:53Z","snapshot_observed_at":"2026-08-13T10:39:29.525473Z","submitted_at":"2024-12-22T11:16:53Z","title":"Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T05:58:47.833858Z"},"links":{"cited_paper":"/paper/2311.09677","citing_paper":"/paper/2412.16974"},"observation_digest":"sha256:3e6923859733fc237803c252579e3d21c074df43a591955412ebe97980c16710","observation_id":"b4963402-9065-42cb-9ab0-be3d7193a072","resolution":{"observed_at":"2026-08-11T05:58:47.833858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:58:47.837929Z","title":"Instruction tuning for large language models: A survey, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16974","last_updated":"2024-12-22T11:16:53Z","snapshot_observed_at":"2026-08-13T10:39:29.525473Z","submitted_at":"2024-12-22T11:16:53Z","title":"Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T05:58:47.837929Z"},"links":{"citing_paper":"/paper/2412.16974"},"observation_digest":"sha256:c7b793a94917726ef28e5d1c541dc94bd5bdc2dcf2de8dedbb2681866aa599fe","observation_id":"2d8b7914-3235-4b3d-bec7-58bcebcbf364","resolution":{"observed_at":"2026-08-11T05:58:47.837929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-11T04:34:07.318549Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-11T05:58:47.842057Z","title":"Ziegler, Nisan Stiennon, Jeffrey Wu, Tom B","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.16974","last_updated":"2024-12-22T11:16:53Z","snapshot_observed_at":"2026-08-13T10:39:29.525473Z","submitted_at":"2024-12-22T11:16:53Z","title":"Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T05:58:47.842057Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2412.16974"},"observation_digest":"sha256:90f23904160e7229c6e64fddb82ed189483c157b1cae480b7fdf0faac32d72ca","observation_id":"f1611234-8817-437c-9df2-a37b07e1a696","resolution":{"observed_at":"2026-08-11T05:58:47.842057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-08-12T09:06:50.363435Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-11T05:58:47.845786Z","title":"Zico Kolter, and Matt Fredrikson","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16974","last_updated":"2024-12-22T11:16:53Z","snapshot_observed_at":"2026-08-13T10:39:29.525473Z","submitted_at":"2024-12-22T11:16:53Z","title":"Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T05:58:47.845786Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2412.16974"},"observation_digest":"sha256:a4620e9b1a2db0f9d1864c88fef0bbf899629060f5cf963b657c5281b724b257","observation_id":"49128758-1ec1-4825-9819-c663a818e4b1","resolution":{"observed_at":"2026-08-11T05:58:47.845786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.16974","last_updated":"2024-12-22T11:16:53Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-13T10:39:29.525473Z","submitted_at":"2024-12-22T11:16:53Z","title":"Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":1,"verified_fuzzy":3},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 2 inbound Pith citation observations for arXiv:2412.16974."}