{"as_of":"2026-08-18T11:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7281a43872a889d12b764a8c76f97414a2a33f7f140e2ea136a0d682087bc0f9","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:55:20.444420Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.04302/citation-record","integrity":"/paper/2506.04302/integrity","json":"/paper/2506.04302/citation-record.json","paper":"/paper/2506.04302"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.765656Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"34451ac7-2f2d-4835-9f99-d2da1877fb5b","year":2022},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:19.959731Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:fd753250cb35c40b95cac986c45850a9ca79ce9645719b9259782bcb55ff4e90","observation_id":"f175e702-865c-41fb-9b1a-e41681f97f73","resolution":{"observed_at":"2026-08-07T10:55:21.772227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.13916","last_updated":"2022-06-16T21:12:42Z","snapshot_observed_at":"2026-07-06T11:52:19.105210Z","submitted_at":"2021-09-28T17:59:36Z","title":"Unsolved Problems in ML Safety","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.13916","snapshot_observed_at":"2026-08-07T10:55:19.968574Z","title":"Unsolved problems in ml safety","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:19.968574Z"},"links":{"cited_paper":"/paper/2109.13916","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:6b05cab6f44cfebee4d40603e53de3947ebd7bf7d9878ccd5d7ba8ebfe1803bb","observation_id":"dc690450-026d-45d9-979c-2b506f6cd357","resolution":{"observed_at":"2026-08-07T10:55:19.968574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07858","last_updated":"2022-11-22T19:12:57Z","snapshot_observed_at":"2026-08-17T08:35:42.452149Z","submitted_at":"2022-08-23T23:37:14Z","title":"Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.07858","snapshot_observed_at":"2026-08-07T10:55:19.978526Z","title":"Red teaming language models to reduce harms: Methods, scaling behav- iors, and lessons learned","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:19.978526Z"},"links":{"cited_paper":"/paper/2209.07858","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:6d3616bd6c6ae5ee4a2a7a4ba9280d986af33b2b9bdf5eb94de1375029e0c1ca","observation_id":"17cc6a00-b7c4-4ae6-8e15-cffb15d9a430","resolution":{"observed_at":"2026-08-07T10:55:19.978526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02151","last_updated":"2025-04-17T18:55:45Z","snapshot_observed_at":"2026-08-16T14:04:12.947538Z","submitted_at":"2024-04-02T17:58:27Z","title":"Jailbreaking Leading Safety-Aligned LLMs with Simple Adaptive Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02151","snapshot_observed_at":"2026-08-07T10:55:19.989451Z","title":"Jailbreaking leading safety-aligned llms with simple adaptive attacks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:19.989451Z"},"links":{"cited_paper":"/paper/2404.02151","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:22de720a9d48ec21a7d979c97b38d1a4f679b15fcfad7ea9054fba92a8ae0e62","observation_id":"7a20bf65-7fe3-483d-939c-4c47a640d3ac","resolution":{"observed_at":"2026-08-07T10:55:19.989451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04451","last_updated":"2024-03-20T21:34:56Z","snapshot_observed_at":"2026-08-16T14:36:14.029419Z","submitted_at":"2023-10-03T19:44:37Z","title":"AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04451","snapshot_observed_at":"2026-08-07T10:55:20.000342Z","title":"Autodan: Generating stealthy jailbreak prompts on aligned large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.000342Z"},"links":{"cited_paper":"/paper/2310.04451","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:206d8f6c2b6cdc39ddad1b1e4505fefe332f0afbed6f290ae013d26e6ebe0b49","observation_id":"381be7f1-ef81-4ae9-b907-d175e55a1aa0","resolution":{"observed_at":"2026-08-07T10:55:20.000342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17444","last_updated":"2023-05-27T11:00:15Z","snapshot_observed_at":"2026-08-16T15:29:04.089527Z","submitted_at":"2023-05-27T11:00:15Z","title":"Query-Efficient Black-Box Red Teaming via Bayesian Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17444","snapshot_observed_at":"2026-08-07T10:55:20.011756Z","title":"Query-efficient black-box red teaming via bayesian optimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.011756Z"},"links":{"cited_paper":"/paper/2305.17444","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:2add4f82298e88e0e64c58e2b02cc873ce11f43376a7103f53c86b9788ab3e7b","observation_id":"0c503a99-6875-4ae6-9011-00c5c4b72415","resolution":{"observed_at":"2026-08-07T10:55:20.011756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03409","last_updated":"2024-04-15T07:50:32Z","snapshot_observed_at":"2026-08-15T09:21:11.223719Z","submitted_at":"2023-09-07T00:07:15Z","title":"Large Language Models as Optimizers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.03409","snapshot_observed_at":"2026-08-07T10:55:20.027907Z","title":"Large language models as optimizers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.027907Z"},"links":{"cited_paper":"/paper/2309.03409","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:82e23cf415db4f42d0f09a7c9d791f48dcaf6b3705aebbb8b8f2862a6e965385","observation_id":"853fdc58-f2a8-47a3-aa54-12b83aee6b31","resolution":{"observed_at":"2026-08-07T10:55:20.027907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03286","last_updated":"2022-02-07T15:22:17Z","snapshot_observed_at":"2026-08-15T19:46:54.909325Z","submitted_at":"2022-02-07T15:22:17Z","title":"Red Teaming Language Models with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.03286","snapshot_observed_at":"2026-08-07T10:55:20.037233Z","title":"Red teaming language models with language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.037233Z"},"links":{"cited_paper":"/paper/2202.03286","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:1d92000396ce5f070ef00d254b0429bdddd248f50ace0b48b1ffbd643ed17b0b","observation_id":"cac5389b-1754-4149-881a-773667e75f80","resolution":{"observed_at":"2026-08-07T10:55:20.037233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.746681Z","title":"Discovering language model behaviors with model-written evaluations","venue":null,"work_id":"3b9b004d-458c-4ff6-88c4-09c04928583a","year":2023},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.043431Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:a02fb87211f1b5cda4206a097fd02edc3356883ce31a214f13f6f534668684ad","observation_id":"382dc7af-da47-42fe-b859-be941488cdc2","resolution":{"observed_at":"2026-08-07T10:55:21.752229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12505","last_updated":"2023-10-19T06:15:05Z","snapshot_observed_at":"2026-08-16T14:50:49.978547Z","submitted_at":"2023-10-19T06:15:05Z","title":"Attack Prompt Generation for Red Teaming and Defending Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12505","snapshot_observed_at":"2026-08-07T10:55:20.050296Z","title":"Attack prompt generation for red teaming and defending large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.050296Z"},"links":{"cited_paper":"/paper/2310.12505","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:36a61533800f345e91aa2af48b6465036e2a315e1d92882efcb6d4d3333b0f3f","observation_id":"b06c2a86-7fd2-4537-92e4-511cf268330d","resolution":{"observed_at":"2026-08-07T10:55:20.050296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-08-16T15:23:33.288601Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-07T10:55:20.057855Z","title":"Explore, establish, exploit: Red teaming language models from scratch","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.057855Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:33826e4ec5eeed98e27aa041ee613608a3b38ece4f95cb94e6e7cd105d883f5c","observation_id":"ae34b8d3-fbac-43ec-a207-7dba2ef5b36d","resolution":{"observed_at":"2026-08-07T10:55:20.057855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19464","last_updated":"2024-02-29T18:55:03Z","snapshot_observed_at":"2026-08-16T14:14:00.472343Z","submitted_at":"2024-02-29T18:55:03Z","title":"Curiosity-driven Red-teaming for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19464","snapshot_observed_at":"2026-08-07T10:55:20.071156Z","title":"Curiosity-driven red-teaming for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.071156Z"},"links":{"cited_paper":"/paper/2402.19464","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:3bfecbc223a30bdeab3ef5f8ff5a6717e06fc6b00debde4fe2f11c59eae71fc2","observation_id":"3e93d054-5718-4965-a335-c1904c8f7421","resolution":{"observed_at":"2026-08-07T10:55:20.071156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.726699Z","title":"DiveR-CT: Diversity-enhanced Red Teaming Large Language Model Assistants with Relaxing Constraints","venue":null,"work_id":"f65c08f3-5522-4e9a-84ff-ffd7ffe6a307","year":2025},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.078058Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:90f4979e0baeb7dcacb553c41572d0e5c3a9b3f2d9cabc949ac35281ac8aefe9","observation_id":"87957fe8-5de1-449b-9104-f13c3a4e5268","resolution":{"observed_at":"2026-08-07T10:55:21.732369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02997","last_updated":"2025-01-06T13:14:34Z","snapshot_observed_at":"2026-08-12T15:12:35.234829Z","submitted_at":"2025-01-06T13:14:34Z","title":"CALM: Curiosity-Driven Auditing for Large Language Models","version":1},"cited_work":{"arxiv_id":"2501.02997","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.02997","snapshot_observed_at":"2026-08-07T10:55:20.939944Z","title":"CALM: Curiosity-Driven Auditing for Large Language Models","venue":"cs.AI","work_id":"b37f535e-c6d4-4c28-a207-9cfe398ffc8f","year":2025},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.085750Z"},"links":{"cited_paper":"/paper/2501.02997","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:0afb6c7da7cf122768c60ef8a31917b476a7971e82526167f89a5eedb98f524c","observation_id":"38a38d83-3fff-443d-a6f5-8bef94cf5d1d","resolution":{"observed_at":"2026-08-07T10:55:20.946358Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.711399Z","title":"CIM: Constrained Intrinsic Motivation for Reinforcement Learning","venue":null,"work_id":"45028b3d-224d-46d4-b23a-9efa2bc09a9d","year":null},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.096049Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:a5fbf49c5e1493d51d88ef8e2fc99482f4d7a576633d9181bfda4dd8f9390284","observation_id":"9b2881ed-b30b-4c61-9fb6-045bdf8030f9","resolution":{"observed_at":"2026-08-07T10:55:21.716179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T10:55:20.103060Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.103060Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:72c2967a76f2597d6cffb825454943f3d05f1b37f9e75c853f32d9d86480c7ca","observation_id":"a9f03fec-4556-4d63-a544-00dd68645c7e","resolution":{"observed_at":"2026-08-07T10:55:20.103060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08419","last_updated":"2024-07-18T18:24:57Z","snapshot_observed_at":"2026-08-16T13:08:51.920120Z","submitted_at":"2023-10-12T15:38:28Z","title":"Jailbreaking Black Box Large Language Models in Twenty Queries","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08419","snapshot_observed_at":"2026-08-07T10:55:20.110906Z","title":"Jailbreaking black box large language models in twenty queries","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.110906Z"},"links":{"cited_paper":"/paper/2310.08419","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:370b96bd631e5000e4853a189fba50fc4442c9d85baeb7e4204b46101f762d6a","observation_id":"d7c316e8-2e99-4ee5-8f7d-4ed2de119e3a","resolution":{"observed_at":"2026-08-07T10:55:20.110906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.694474Z","title":"Tree of attacks: Jailbreaking black-box llms automatically","venue":null,"work_id":"b696cf9b-debf-4079-a093-eab3944f8749","year":2024},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.118783Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:329a673c3e661cc28a27c698a15c826ccc24ef14fd354341dfcedb6cbdaba7d2","observation_id":"33da88f3-d4b9-4424-ba63-b3cec21e6766","resolution":{"observed_at":"2026-08-07T10:55:21.699718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.678132Z","title":"How johnny can persuade llms to jailbreak them: Rethinking persuasion to challenge ai safety by humanizing llms","venue":null,"work_id":"19782825-9441-43a6-9067-bb88dc95101e","year":2024},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.124594Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:955603c406b1aae9b4a1f5f4bfccee04de10a4b452fa554961c3f73e771402ba","observation_id":"9a313817-9950-4f83-a6e9-e015f0e9b66c","resolution":{"observed_at":"2026-08-07T10:55:21.683610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10253","last_updated":"2024-06-27T16:01:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-19T02:19:48Z","title":"GPTFUZZER: Red Teaming Large Language Models with Auto-Generated Jailbreak Prompts","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10253","snapshot_observed_at":"2026-08-07T10:55:20.132349Z","title":"Gptfuzzer: Red teaming large language models with auto-generated jailbreak prompts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.132349Z"},"links":{"cited_paper":"/paper/2309.10253","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:de5915b129b83dd8e5051de1503cd88a565ff3f7504a01f469c069e8000ede70","observation_id":"ad3fbefa-428f-42c0-8b06-d0a1cd315538","resolution":{"observed_at":"2026-08-07T10:55:20.132349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.662052Z","title":"https://github.com/ huggingface/trl","venue":null,"work_id":"0b280d8a-aaed-434e-9a56-63f5a813c221","year":2020},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.138450Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:7033ca502857230a2833caf8446318b2d37fc523dac5a02da7f04f2c6ff9252f","observation_id":"8ea00912-2743-44fc-9d6c-47e46ac6d4a0","resolution":{"observed_at":"2026-08-07T10:55:21.667522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.644606Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":"d05fb79f-79a3-4364-9039-86d44c246e32","year":2023},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.147018Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:a88edfcd6016e5b3614f17d2990109614718adefac5a60c6967d4c6930ef9d7c","observation_id":"381dc6ef-ac5c-49ae-b65b-9b98b331c786","resolution":{"observed_at":"2026-08-07T10:55:21.650520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11143","last_updated":"2025-10-09T12:22:46Z","snapshot_observed_at":"2026-08-18T04:26:49.778619Z","submitted_at":"2024-05-20T01:04:40Z","title":"OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11143","snapshot_observed_at":"2026-08-07T10:55:20.161901Z","title":"OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Frame- work","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.161901Z"},"links":{"cited_paper":"/paper/2405.11143","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:4ad217bf6b053b0e6f54f006cc36a79776f70e0745c03386e64e2a4af508a09e","observation_id":"908c75a0-f94a-4865-a9f4-8d9bbe7e8e9f","resolution":{"observed_at":"2026-08-07T10:55:20.161901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T10:55:20.167213Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.167213Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:f85950845e8c6dad29d449cd059fb08613b201cf9aecf66fe5e4dda2a49f5375","observation_id":"08285b22-1570-4643-add2-818f40fc8436","resolution":{"observed_at":"2026-08-07T10:55:20.167213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.01241","last_updated":"2023-03-01T01:31:17Z","snapshot_observed_at":"2026-08-16T16:27:11.778373Z","submitted_at":"2022-10-03T21:38:29Z","title":"Is Reinforcement Learning (Not) for Natural Language Processing: Benchmarks, Baselines, and Building Blocks for Natural Language Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.01241","snapshot_observed_at":"2026-08-07T10:55:20.175303Z","title":"Is reinforcement learning (not) for natural language processing: Benchmarks, baselines, and building blocks for natural language policy optimization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.175303Z"},"links":{"cited_paper":"/paper/2210.01241","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:91e24104355dcf1a84a435da6348bd380894cc702af05cc20d875a9639e4a11a","observation_id":"4ed6cbbe-99a6-41cd-ae6a-9d427b1592b3","resolution":{"observed_at":"2026-08-07T10:55:20.175303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T10:55:20.188583Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.188583Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:59f46b23ee4aeee1a5cb696836bdd800aa8ee6fbab38c77fa9da5f0945ae31cd","observation_id":"87e49c1d-7f06-4080-852f-d4786f7fc0d8","resolution":{"observed_at":"2026-08-07T10:55:20.188583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T10:55:20.197684Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.197684Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:60529593c7dccb3523d508d1243d9b57fc7f96ca83e85aaaf679d26cc04bd50d","observation_id":"8aeef9cb-e71d-4f57-998c-6696040a3799","resolution":{"observed_at":"2026-08-07T10:55:20.197684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-08-14T07:14:28.634639Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-07T10:55:20.205546Z","title":"What matters in on-policy reinforcement learning? a large-scale empirical study","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.205546Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:305f48c8525602921280f1d250e817c7a96068128d77b602ff68b2029b7e66a2","observation_id":"b4b230da-84bc-4768-b4c3-268d49f2c8c0","resolution":{"observed_at":"2026-08-07T10:55:20.205546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.15191","last_updated":"2021-10-28T15:07:01Z","snapshot_observed_at":"2026-08-16T17:45:43.534665Z","submitted_at":"2021-10-28T15:07:01Z","title":"URLB: Unsupervised Reinforcement Learning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.15191","snapshot_observed_at":"2026-08-07T10:55:20.212381Z","title":"Urlb: Unsupervised reinforcement learning benchmark","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.212381Z"},"links":{"cited_paper":"/paper/2110.15191","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:cab843c407ba1db3827d6ee69fa3c9ed9a006ed0d1a618e8a40aa98a4a46f4fd","observation_id":"0ab1fa87-310f-4571-ad83-a3e2d187c08c","resolution":{"observed_at":"2026-08-07T10:55:20.212381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.12894","last_updated":"2018-10-30T17:44:42Z","snapshot_observed_at":"2026-08-14T18:06:54.993797Z","submitted_at":"2018-10-30T17:44:42Z","title":"Exploration by Random Network Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.12894","snapshot_observed_at":"2026-08-07T10:55:20.217369Z","title":"Exploration by random network distillation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.217369Z"},"links":{"cited_paper":"/paper/1810.12894","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:29088974f07565de6b71c03a5c51e4307a46722b4bbf41aa50ccceb835b10211","observation_id":"40351ced-22cb-4d3f-a5c6-0c5bc8cea678","resolution":{"observed_at":"2026-08-07T10:55:20.217369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.04355","last_updated":"2018-08-13T17:58:01Z","snapshot_observed_at":"2026-08-14T18:41:41.282322Z","submitted_at":"2018-08-13T17:58:01Z","title":"Large-Scale Study of Curiosity-Driven Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.04355","snapshot_observed_at":"2026-08-07T10:55:20.225697Z","title":"Large-scale study of curiosity-driven learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.225697Z"},"links":{"cited_paper":"/paper/1808.04355","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:cd6fb397115194759740337ad90294753821dd38bd66884d527abf4559390a6d","observation_id":"a180c0b8-31ba-47a6-8997-c72253260825","resolution":{"observed_at":"2026-08-07T10:55:20.225697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.626821Z","title":"Made: Exploration via maximizing deviation from explored regions","venue":null,"work_id":"b8a89a27-ce55-4c3f-9d21-b0e77cfac798","year":2021},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.231970Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:aeb4041b593339ca36dff9582717846e9c6f027d50db4e8285013ab7e57d378f","observation_id":"2a95946f-6344-4dda-9356-a73851590d2b","resolution":{"observed_at":"2026-08-07T10:55:21.632220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.609095Z","title":"Aps: Active pretraining with successor features","venue":null,"work_id":"c25ce070-9f38-4c58-975f-9240ac160164","year":2021},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.242868Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:7f49ecbb21cd608b37433354be1b21c71354a44a62112f060bbfd196db5cb5b0","observation_id":"87a2b6a5-e034-47bd-b063-0a4a9d478ccf","resolution":{"observed_at":"2026-08-07T10:55:21.615141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.591822Z","title":"Provably efficient maximum entropy exploration","venue":null,"work_id":"edab8638-0632-411f-ad43-5d0c4eb748d4","year":2019},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.248052Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:7a54d9ad24c47c4535bf9a1cbd9aa7faaa5ddbaf87e828ddc288040d8c8063f2","observation_id":"9902af5a-2f2c-4bf3-9db7-8616ceb4b872","resolution":{"observed_at":"2026-08-07T10:55:21.597103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.574795Z","title":"Task-agnostic exploration via policy gradient of a non-parametric state entropy estimate","venue":null,"work_id":"66b451a5-04a1-4ab9-9646-435ee73e93c3","year":null},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.254621Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:70996b7d38a51c1b1bd1cd2814cac447eba6ad78685738eadc060a90719627d3","observation_id":"46edf65b-7e79-4371-8a30-383151690748","resolution":{"observed_at":"2026-08-07T10:55:21.579769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.558442Z","title":"Behavior from the void: Unsupervised active pre-training","venue":null,"work_id":"f13e7759-c331-4894-8188-ee5b28260dd3","year":2021},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.260652Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:e07bb1c6eb02f3198218f05de72d1e533dd41899897b4736b31927e62c477d72","observation_id":"63dc068b-a992-475e-836b-fa81c7bae7ed","resolution":{"observed_at":"2026-08-07T10:55:21.563908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08887","last_updated":"2024-03-10T04:30:17Z","snapshot_observed_at":"2026-08-16T14:52:27.542277Z","submitted_at":"2023-10-13T06:43:11Z","title":"METRA: Scalable Unsupervised RL with Metric-Aware Abstraction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08887","snapshot_observed_at":"2026-08-07T10:55:20.265825Z","title":"Metra: Scalable unsupervised rl with metric- aware abstraction","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.265825Z"},"links":{"cited_paper":"/paper/2310.08887","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:f76d422ccf4f134ce7d142d0fcce631157347420c390f1301b8d2ba2dbd48b9e","observation_id":"9623f91d-a38e-4822-b268-deb1e410a141","resolution":{"observed_at":"2026-08-07T10:55:20.265825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.07507","last_updated":"2016-11-22T20:44:39Z","snapshot_observed_at":"2026-08-15T10:30:11.741506Z","submitted_at":"2016-11-22T20:44:39Z","title":"Variational Intrinsic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.07507","snapshot_observed_at":"2026-08-07T10:55:20.272855Z","title":"Variational intrinsic control","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.272855Z"},"links":{"cited_paper":"/paper/1611.07507","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:572521e7dc4df36a40cf7914fe1350ce626dbf1cbfa4153c3184dbcc660083f4","observation_id":"5debbec7-ef51-442b-821b-4bede4fed053","resolution":{"observed_at":"2026-08-07T10:55:20.272855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.01657","last_updated":"2020-02-14T23:20:43Z","snapshot_observed_at":"2026-08-14T16:09:19.494819Z","submitted_at":"2019-07-02T21:32:19Z","title":"Dynamics-Aware Unsupervised Discovery of Skills","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.01657","snapshot_observed_at":"2026-08-07T10:55:20.279140Z","title":"Dynamics-aware unsupervised discovery of skills","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.279140Z"},"links":{"cited_paper":"/paper/1907.01657","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:bb75786aea4a0f25af01b5fa64f8dc45caeb3904fc43c6c09b0e72ddeaabd948","observation_id":"e03d3241-ec77-42e9-b744-9191bd314146","resolution":{"observed_at":"2026-08-07T10:55:20.279140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00161","last_updated":"2022-03-30T01:09:18Z","snapshot_observed_at":"2026-08-16T17:24:31.534030Z","submitted_at":"2022-02-01T00:36:29Z","title":"CIC: Contrastive Intrinsic Control for Unsupervised Skill Discovery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.00161","snapshot_observed_at":"2026-08-07T10:55:20.286572Z","title":"Cic: Contrastive intrinsic control for unsupervised skill discovery","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.286572Z"},"links":{"cited_paper":"/paper/2202.00161","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:336001d775b124f48b0066e36613ecc52da2c5e7a97abc27ab68419e6b56f6b8","observation_id":"3b9a831c-c371-4a1a-8e9f-7b704e083dd4","resolution":{"observed_at":"2026-08-07T10:55:20.286572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.540207Z","title":"Lipschitz-constrained unsupervised skill discovery","venue":null,"work_id":"238c5feb-381f-494c-b62d-c2a1a2e5b993","year":2022},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.294060Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:5d00a72a178017216d9c7accccfb0cfdb770c590c159afdc80806ea247ff3d6c","observation_id":"7edfc9e9-e9a3-4498-861d-cc2b94dbd0e2","resolution":{"observed_at":"2026-08-07T10:55:21.546382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.525020Z","title":"Contrastive learning as goal-conditioned reinforcement learning","venue":null,"work_id":"51c48b6c-de8e-4ff0-a160-f4d4741a59ab","year":2022},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.300397Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:1f7d81d0fdba8e0472b40b49de1f6deef53ee7f82ce3c1f36e8e1c80efaab737","observation_id":"400927c6-059a-448b-99bc-51f51c43c6dc","resolution":{"observed_at":"2026-08-07T10:55:21.529985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.507821Z","title":"Behavior contrastive learning for unsupervised skill discovery","venue":null,"work_id":"baf08150-b896-4536-878a-de37b66b0435","year":2023},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.307494Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:ad250f873c6e4372dd2b005c4056c7de1197221b8771b0198437e79826f0e09e","observation_id":"663a31b7-a700-41ba-ad81-9d45e84ce291","resolution":{"observed_at":"2026-08-07T10:55:21.514043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.09247","last_updated":"2024-07-12T13:20:52Z","snapshot_observed_at":"2026-08-16T13:34:45.967735Z","submitted_at":"2024-07-12T13:20:52Z","title":"Constrained Intrinsic Motivation for Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2407.09247","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.09247","snapshot_observed_at":"2026-08-07T10:55:20.526743Z","title":"Constrained Intrinsic Motivation for Reinforcement Learning","venue":"cs.AI","work_id":"06920247-f631-4da6-9142-92f063e074b3","year":2024},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.314427Z"},"links":{"cited_paper":"/paper/2407.09247","citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:2be327000b88baa70496a0fa65b71d139c97cb3e789c416f20bc1d71bbc6f4d8","observation_id":"58364df4-b6e3-41b3-b97f-1b27c1a821fb","resolution":{"observed_at":"2026-08-07T10:55:20.543202Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.488446Z","title":"Texygen: A benchmarking platform for text generation models","venue":null,"work_id":"2c99f3bf-32b9-416a-9ee8-37043ecfd4f1","year":2018},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.322001Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:12979e878b09bd91341d553cd1a2f2f2d36135ce4ea514c22d5c95678e940194","observation_id":"6827f958-515b-4993-9e21-ce34312fc62d","resolution":{"observed_at":"2026-08-07T10:55:21.495004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.462290Z","title":"Guidelines: • The answer NA means that the abstract and introduction do not include the claims made in the paper","venue":null,"work_id":"f4cf0e8a-5720-496b-965f-476bf99939c7","year":null},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.328339Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:82be77fa25a33941bbf8e6de45f2fc5c166cd3a153061eac80d40a490fec365b","observation_id":"54a87242-300d-4a7e-ac4e-925cfcd01723","resolution":{"observed_at":"2026-08-07T10:55:21.471942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.438541Z","title":"Limitations","venue":null,"work_id":"549f879e-1736-4975-8c3f-f92c3e7ffeef","year":null},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.333557Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:32216feea3c75c59b860598b242907c9e11f79a60d3fe73e9651ce956fdb3732","observation_id":"3b7f25ba-2680-4287-a94a-9c13dfc3475a","resolution":{"observed_at":"2026-08-07T10:55:21.445445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.416383Z","title":"Thus, we do not provide original theoretical results of the each baseline method","venue":null,"work_id":"2e958b7f-8972-4b49-a3e1-69c85755965d","year":null},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.338073Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:1266b5f357bfb84ef9e2b08a1d7447cbbcc289071c397da1d1bb41429c8d1fee","observation_id":"43689bd1-c7ff-4d64-983c-b29be3ea708a","resolution":{"observed_at":"2026-08-07T10:55:21.421981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.393930Z","title":"Our experiment results can be easily reproduced with a simple environment setup, the default config files, and the prepared shell scripts","venue":null,"work_id":"a10532e0-f6fa-419e-970d-4ad91bf6b791","year":null},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.344055Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:01556023e72b9957eef99252a4971e64e448dc8d69fffe59612192f888e73460","observation_id":"2e769d34-be7d-4293-9717-f63132a532ba","resolution":{"observed_at":"2026-08-07T10:55:21.401126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.368653Z","title":"Guidelines: • The answer NA means that paper does not include experiments requiring code","venue":null,"work_id":"3f3f18c6-032e-41ec-99ab-b18d1e45c9ad","year":null},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.350750Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:4e7b23cafaee3eaf23783e808dfe9b430d6357b33558b89f72b01755770b3c86","observation_id":"729bd66c-a64a-44e7-8592-905e34f9ad0e","resolution":{"observed_at":"2026-08-07T10:55:21.375072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.345899Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"5856b46a-3068-4262-8d14-c35cba86db53","year":null},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.359237Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:951d01c319f70ab4e4f01e6049ff000f621844a7512cbe3bb112ca50c6955eb3","observation_id":"541639fb-fc2c-4f21-b843-2c2018df7c94","resolution":{"observed_at":"2026-08-07T10:55:21.353669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.324720Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"bbfbfec7-46bf-4f02-ab85-81cef792d424","year":null},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.364627Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:ac173b1b3bc79148f65a66be600bc9c84b9c1115fab1db5048ee76728477ba97","observation_id":"b11c78d3-4c70-461a-bdad-6b0d36c732ab","resolution":{"observed_at":"2026-08-07T10:55:21.331413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.303015Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"4c5d385e-de67-457a-8fef-cde0d8f32e7d","year":null},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.385226Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:9093fc1426ac1b44a711d5722156ab2bc019424ad86d7deb954193ac9c6c7e2a","observation_id":"ac8777d8-1fcb-4c87-9979-fd85f64a6bfc","resolution":{"observed_at":"2026-08-07T10:55:21.308529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.282795Z","title":"Guidelines: • The answer NA means that the authors have not reviewed the NeurIPS Code of Ethics","venue":null,"work_id":"2242eddf-ea2d-4050-9c80-87b65a6cabcb","year":null},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.392099Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:4e3b16bdfa2c8bf4c580dc9b675ea91886e5a1be0a133d348e7bbf77f0ee510d","observation_id":"5f88aa89-5bf3-4ead-bab4-b454b1aa1367","resolution":{"observed_at":"2026-08-07T10:55:21.289513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.263722Z","title":"Guidelines: • The answer NA means that there is no societal impact of the work performed","venue":null,"work_id":"f0c3352c-702e-4fcd-95cb-6cdc2175aacb","year":null},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.398177Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:c4aaa0f7ed534794075ec36443681bb9a635c437015778cc5c77de4cae1799a1","observation_id":"bc5483a2-b170-4143-a810-6eb120b8953f","resolution":{"observed_at":"2026-08-07T10:55:21.269397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.246116Z","title":"Guidelines: • The answer NA means that the paper poses no such risks","venue":null,"work_id":"5c954b72-2300-4ab0-b16a-b80662f69574","year":null},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.402830Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:3d7c790f56514e18d8f6c7a3880c6eaa8cd4622c48b125c884f2c3cfd8dc681c","observation_id":"87174eda-9204-4f40-ad21-68fde8abdc1c","resolution":{"observed_at":"2026-08-07T10:55:21.251148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.229184Z","title":"Guidelines: • The answer NA means that the paper does not use existing assets","venue":null,"work_id":"1485fd9e-6e9d-45d8-9333-54941daf347b","year":null},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.407677Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:9fb56d0846425752db22e00fbe9e527b22bbcb7cc4b0ab5682bfcea75a05492d","observation_id":"bdc3f549-f526-4d11-8653-dc3203cafff8","resolution":{"observed_at":"2026-08-07T10:55:21.234174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.212700Z","title":"Please refer to https: //github.com/x-zheng16/RedRFT.git for the document","venue":null,"work_id":"ce63d898-391d-449a-9ce2-f7d0912c84dd","year":null},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.414775Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:c6790b9f6a9b9b87ddf87ab201401a1407c584bb8787dcf7c579816b78e13b67","observation_id":"3a24e7df-fd5c-44df-ba83-91600cc58698","resolution":{"observed_at":"2026-08-07T10:55:21.217962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.193324Z","title":"Guidelines: • The answer NA means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":"1687a985-bdc6-4de7-9dd0-beea4bd4ebec","year":null},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.419930Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:0e8dad24f194042076b58ec2dc716c1a1f90f90f7ebeec45a1f9230898f2c16a","observation_id":"d7fb2682-a2e7-4ba4-af7f-21bf833ea638","resolution":{"observed_at":"2026-08-07T10:55:21.200211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.174024Z","title":"Guidelines: 25 • The answer NA means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":"696416b7-ac3d-4fa4-9b84-dda45d5e6e3b","year":null},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.425912Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:6d04752e31ef70f23fdfc842073619ba2c31950ab1f1095e4612f7eafeff4502","observation_id":"431ab6db-b213-4dd0-aa74-f9bc67e192cd","resolution":{"observed_at":"2026-08-07T10:55:21.180137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:21.156819Z","title":null,"venue":null,"work_id":"16150d22-c6c3-4046-b86c-451768e9a3c7","year":2025},"citing_paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.444420Z"},"links":{"citing_paper":"/paper/2506.04302"},"observation_digest":"sha256:210eb86e0e937a8d24319da32b34bfc39667e63b1ff8ba03374812278dd31b66","observation_id":"8f459fa7-9125-4e1c-9e78-53da5a87cf8b","resolution":{"observed_at":"2026-08-07T10:55:21.162162Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.04302","last_updated":"2025-06-04T14:50:24Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T23:24:06.747461Z","submitted_at":"2025-06-04T14:50:24Z","title":"RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":2,"verified_fuzzy":32},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 0 inbound Pith citation observations for arXiv:2506.04302."}