{"as_of":"2026-08-12T06:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3e8a6c6ac0148e609f1b03781716f6c2d3915e6b139d668ba2721edd4df13d45","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T20:54:05.242057Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.06911/citation-record","integrity":"/paper/2501.06911/integrity","json":"/paper/2501.06911/citation-record.json","paper":"/paper/2501.06911"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-10T20:54:05.034917Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2501.06911","last_updated":"2025-01-12T19:48:21Z","snapshot_observed_at":"2026-08-12T03:12:11.032744Z","submitted_at":"2025-01-12T19:48:21Z","title":"Risk-Averse Finetuning of Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T20:54:05.034917Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2501.06911"},"observation_digest":"sha256:0f512648138a065f10ec8ebc3d94c332e9a352a9ba07e29de0801f42adbda00c","observation_id":"3cfd475d-d010-4627-b1c5-cf309afa68a1","resolution":{"observed_at":"2026-08-10T20:54:05.034917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05335","last_updated":"2023-04-11T16:53:54Z","snapshot_observed_at":"2026-08-08T22:33:30.357597Z","submitted_at":"2023-04-11T16:53:54Z","title":"Toxicity in ChatGPT: Analyzing Persona-assigned Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05335","snapshot_observed_at":"2026-08-10T20:54:05.066525Z","title":"Toxicity in chatgpt: Analyzing persona-assigned language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.06911","last_updated":"2025-01-12T19:48:21Z","snapshot_observed_at":"2026-08-12T03:12:11.032744Z","submitted_at":"2025-01-12T19:48:21Z","title":"Risk-Averse Finetuning of Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T20:54:05.066525Z"},"links":{"cited_paper":"/paper/2304.05335","citing_paper":"/paper/2501.06911"},"observation_digest":"sha256:4d796d8a1b8f0778e26770876988fca5d160e671656c6aec7a9c93027b5e367f","observation_id":"c731d022-e0b5-4ab2-af41-1e260a7b6081","resolution":{"observed_at":"2026-08-10T20:54:05.066525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-10T20:54:05.073392Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.06911","last_updated":"2025-01-12T19:48:21Z","snapshot_observed_at":"2026-08-12T03:12:11.032744Z","submitted_at":"2025-01-12T19:48:21Z","title":"Risk-Averse Finetuning of Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T20:54:05.073392Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2501.06911"},"observation_digest":"sha256:732d5e05b1af3e726670daaf72111b2672fb372bb985deaa92167aff88d396b2","observation_id":"9a00f026-83bf-4318-82e2-df7b8510debd","resolution":{"observed_at":"2026-08-10T20:54:05.073392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07858","last_updated":"2022-11-22T19:12:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-23T23:37:14Z","title":"Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.07858","snapshot_observed_at":"2026-08-10T20:54:05.079600Z","title":"Red teaming language models to reduce harms: Methods, scaling behaviors, and lessons learned","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.06911","last_updated":"2025-01-12T19:48:21Z","snapshot_observed_at":"2026-08-12T03:12:11.032744Z","submitted_at":"2025-01-12T19:48:21Z","title":"Risk-Averse Finetuning of Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T20:54:05.079600Z"},"links":{"cited_paper":"/paper/2209.07858","citing_paper":"/paper/2501.06911"},"observation_digest":"sha256:8ff8e49edce866dda67c6258743725cb14a1eeb163f2dcec794896a0ae104d4b","observation_id":"ee09e131-6f1e-4b0b-93e2-907218c1c4d8","resolution":{"observed_at":"2026-08-10T20:54:05.079600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:05.858201Z","title":"WHEN I AM UNBLOCKED I SWEAR I WILL GO F**K YOUR M C","venue":null,"work_id":"f049512a-a751-4d72-a766-cd8c0854d7ed","year":2000},"citing_paper":{"arxiv_id":"2501.06911","last_updated":"2025-01-12T19:48:21Z","snapshot_observed_at":"2026-08-12T03:12:11.032744Z","submitted_at":"2025-01-12T19:48:21Z","title":"Risk-Averse Finetuning of Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T20:54:05.226052Z"},"links":{"citing_paper":"/paper/2501.06911"},"observation_digest":"sha256:1e33706174bdcd13f9a8fc14304df70b8ebb788f3733b4baa2cb79f3ac80d7f5","observation_id":"bcd73537-6261-4a51-8ceb-ce1b2d892da4","resolution":{"observed_at":"2026-08-10T20:54:05.863420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.03023","last_updated":"2021-06-03T05:26:11Z","snapshot_observed_at":"2026-08-07T05:15:43.777800Z","submitted_at":"2021-05-07T01:19:38Z","title":"DExperts: Decoding-Time Controlled Text Generation with Experts and Anti-Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.03023","snapshot_observed_at":"2026-08-10T20:54:05.123385Z","title":"Dexperts: Decoding-time controlled text generation with experts and anti-experts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.06911","last_updated":"2025-01-12T19:48:21Z","snapshot_observed_at":"2026-08-12T03:12:11.032744Z","submitted_at":"2025-01-12T19:48:21Z","title":"Risk-Averse Finetuning of Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T20:54:05.123385Z"},"links":{"cited_paper":"/paper/2105.03023","citing_paper":"/paper/2501.06911"},"observation_digest":"sha256:ffe8ec88889ceaa5e57c4d949a5c428a02fb07fce6519f70d7c1339a3b01176f","observation_id":"45be7a25-cdac-471f-b276-17624c861a8d","resolution":{"observed_at":"2026-08-10T20:54:05.123385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1610.01283","last_updated":"2017-03-03T19:58:56Z","snapshot_observed_at":"2026-07-06T05:13:22.674148Z","submitted_at":"2016-10-05T06:51:58Z","title":"EPOpt: Learning Robust Neural Network Policies Using Model Ensembles","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.01283","snapshot_observed_at":"2026-08-10T20:54:05.137785Z","title":"Epopt: Learning robust neural network policies using model ensembles","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.06911","last_updated":"2025-01-12T19:48:21Z","snapshot_observed_at":"2026-08-12T03:12:11.032744Z","submitted_at":"2025-01-12T19:48:21Z","title":"Risk-Averse Finetuning of Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T20:54:05.137785Z"},"links":{"cited_paper":"/paper/1610.01283","citing_paper":"/paper/2501.06911"},"observation_digest":"sha256:f5fb08aae9b0f4c0de5d63c422cff3d0d7fcc765282b87e8f83bf7cf9eb07775","observation_id":"5fdee585-fe79-4fe5-9c7c-71cf1f75512e","resolution":{"observed_at":"2026-08-10T20:54:05.137785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.01326","last_updated":"2019-10-23T18:55:16Z","snapshot_observed_at":"2026-08-12T02:00:49.013542Z","submitted_at":"2019-09-03T17:50:44Z","title":"The Woman Worked as a Babysitter: On Biases in Language Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.01326","snapshot_observed_at":"2026-08-10T20:54:05.158237Z","title":"The woman worked as a babysitter: On biases in language generation","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2501.06911","last_updated":"2025-01-12T19:48:21Z","snapshot_observed_at":"2026-08-12T03:12:11.032744Z","submitted_at":"2025-01-12T19:48:21Z","title":"Risk-Averse Finetuning of Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T20:54:05.158237Z"},"links":{"cited_paper":"/paper/1909.01326","citing_paper":"/paper/2501.06911"},"observation_digest":"sha256:6c691c0930e7d053b09697a9bcee43080c70e83fb7474b1001af400f12e4b3bd","observation_id":"381e7469-1002-47d5-870c-8417caabbeba","resolution":{"observed_at":"2026-08-10T20:54:05.158237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-10T20:54:05.172123Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.06911","last_updated":"2025-01-12T19:48:21Z","snapshot_observed_at":"2026-08-12T03:12:11.032744Z","submitted_at":"2025-01-12T19:48:21Z","title":"Risk-Averse Finetuning of Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T20:54:05.172123Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2501.06911"},"observation_digest":"sha256:ee7b4738fda04ed6657e81dcc1a3f78e62cd5ce84531ac111c53e315d0e6e522","observation_id":"9f092efe-31a3-4711-b7da-334899d6cfbe","resolution":{"observed_at":"2026-08-10T20:54:05.172123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.07125","last_updated":"2021-01-03T19:58:55Z","snapshot_observed_at":"2026-07-06T08:15:25.894149Z","submitted_at":"2019-08-20T01:51:40Z","title":"Universal Adversarial Triggers for Attacking and Analyzing NLP","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.07125","snapshot_observed_at":"2026-08-10T20:54:05.177311Z","title":"Universal adversarial triggers for attacking and analyzing nlp","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2501.06911","last_updated":"2025-01-12T19:48:21Z","snapshot_observed_at":"2026-08-12T03:12:11.032744Z","submitted_at":"2025-01-12T19:48:21Z","title":"Risk-Averse Finetuning of Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T20:54:05.177311Z"},"links":{"cited_paper":"/paper/1908.07125","citing_paper":"/paper/2501.06911"},"observation_digest":"sha256:34fc160c8206200137f6f9b6e7852898c6dea1d72b470f1ade5afbb861d1f0b5","observation_id":"9ecb8305-c134-450f-a5f8-5a22cb0f3d93","resolution":{"observed_at":"2026-08-10T20:54:05.177311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04359","last_updated":"2021-12-08T16:09:48Z","snapshot_observed_at":"2026-08-09T15:17:43.394064Z","submitted_at":"2021-12-08T16:09:48Z","title":"Ethical and social risks of harm from Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04359","snapshot_observed_at":"2026-08-10T20:54:05.185085Z","title":"Ethical and social risks of harm from language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.06911","last_updated":"2025-01-12T19:48:21Z","snapshot_observed_at":"2026-08-12T03:12:11.032744Z","submitted_at":"2025-01-12T19:48:21Z","title":"Risk-Averse Finetuning of Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T20:54:05.185085Z"},"links":{"cited_paper":"/paper/2112.04359","citing_paper":"/paper/2501.06911"},"observation_digest":"sha256:550ea3fa997ee1eb5c02f63e866f721366838a63b3c40c063400d24b60b8b156","observation_id":"274f79a1-7817-4abc-971e-aded10f64a4d","resolution":{"observed_at":"2026-08-10T20:54:05.185085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-11T04:34:07.318549Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-10T20:54:05.191903Z","title":"Fine-tuning language models from human preferences","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2501.06911","last_updated":"2025-01-12T19:48:21Z","snapshot_observed_at":"2026-08-12T03:12:11.032744Z","submitted_at":"2025-01-12T19:48:21Z","title":"Risk-Averse Finetuning of Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T20:54:05.191903Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2501.06911"},"observation_digest":"sha256:7c9a93ccb0eff279b836824fe0f6f0be810506cc40608d9afc69209e2f0285b5","observation_id":"04b72b7d-80c9-4cd4-bb81-ddc0e655768b","resolution":{"observed_at":"2026-08-10T20:54:05.191903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:05.948440Z","title":"In our work, we primarily focussed on generative tasks, and not the Question-Answer (Q&A) format","venue":null,"work_id":"bc36388a-10c0-4bbe-bfa1-ce2ee0f6e646","year":2019},"citing_paper":{"arxiv_id":"2501.06911","last_updated":"2025-01-12T19:48:21Z","snapshot_observed_at":"2026-08-12T03:12:11.032744Z","submitted_at":"2025-01-12T19:48:21Z","title":"Risk-Averse Finetuning of Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T20:54:05.197403Z"},"links":{"citing_paper":"/paper/2501.06911"},"observation_digest":"sha256:1257fee2706b165b4bebf5f7b9812838f023153ac36414ff496b2e6b9ad13105","observation_id":"1e3b5f31-4961-4eea-be33-3b00704744f7","resolution":{"observed_at":"2026-08-10T20:54:05.953921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:05.930195Z","title":"Furthermore, even aligned versions of LLMs are not immune to exploitation","venue":null,"work_id":"78c35b74-203f-4f17-827e-441348d66b3b","year":2020},"citing_paper":{"arxiv_id":"2501.06911","last_updated":"2025-01-12T19:48:21Z","snapshot_observed_at":"2026-08-12T03:12:11.032744Z","submitted_at":"2025-01-12T19:48:21Z","title":"Risk-Averse Finetuning of Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T20:54:05.202933Z"},"links":{"citing_paper":"/paper/2501.06911"},"observation_digest":"sha256:3d32a6694a4da52d117278fde4792587d4afbb17bb567022adbd272801381142","observation_id":"5df3b17b-9423-4bcb-b6db-115326511e04","resolution":{"observed_at":"2026-08-10T20:54:05.936478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:05.912640Z","title":null,"venue":null,"work_id":"124c71f0-9d8d-4ff6-b5f9-9082d0dbd988","year":2019},"citing_paper":{"arxiv_id":"2501.06911","last_updated":"2025-01-12T19:48:21Z","snapshot_observed_at":"2026-08-12T03:12:11.032744Z","submitted_at":"2025-01-12T19:48:21Z","title":"Risk-Averse Finetuning of Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T20:54:05.209361Z"},"links":{"citing_paper":"/paper/2501.06911"},"observation_digest":"sha256:4e63c9361b6590f9a6a2193494a359c9f8dec41d590a842e8fe90db25bc74390","observation_id":"74a7bf16-41b5-47ee-98a0-f4b04e0894e9","resolution":{"observed_at":"2026-08-10T20:54:05.918108Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:05.893338Z","title":"Furthermore, even aligned versions of LLMs are not immune to exploitation","venue":null,"work_id":"dc0b5a0b-7610-4460-a5f6-306bb7388463","year":2020},"citing_paper":{"arxiv_id":"2501.06911","last_updated":"2025-01-12T19:48:21Z","snapshot_observed_at":"2026-08-12T03:12:11.032744Z","submitted_at":"2025-01-12T19:48:21Z","title":"Risk-Averse Finetuning of Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T20:54:05.215689Z"},"links":{"citing_paper":"/paper/2501.06911"},"observation_digest":"sha256:fcfdb80531e6315b9072019fadaa78b9c41cfbc35bb63d358cff3cdd29262315","observation_id":"66a36157-066c-451a-9918-dd0d8af762c8","resolution":{"observed_at":"2026-08-10T20:54:05.900197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:05.875482Z","title":"Risk Averseness in RL","venue":null,"work_id":"7cfeb523-b13e-4463-a942-cdbdfe35f5c9","year":2001},"citing_paper":{"arxiv_id":"2501.06911","last_updated":"2025-01-12T19:48:21Z","snapshot_observed_at":"2026-08-12T03:12:11.032744Z","submitted_at":"2025-01-12T19:48:21Z","title":"Risk-Averse Finetuning of Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T20:54:05.220836Z"},"links":{"citing_paper":"/paper/2501.06911"},"observation_digest":"sha256:bf8644249d143a8741994a55013a4c2e7a0864fb1a21cb226a0061cda65b8bef","observation_id":"1c3e45d6-d485-47d1-be7a-2b5b69d76344","resolution":{"observed_at":"2026-08-10T20:54:05.880538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:05.841338Z","title":"The dataset utilized in this task is introduced by Gehman et al","venue":null,"work_id":"d771a40c-026c-4be2-bcdf-87d7ce8ceeac","year":2020},"citing_paper":{"arxiv_id":"2501.06911","last_updated":"2025-01-12T19:48:21Z","snapshot_observed_at":"2026-08-12T03:12:11.032744Z","submitted_at":"2025-01-12T19:48:21Z","title":"Risk-Averse Finetuning of Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T20:54:05.231782Z"},"links":{"citing_paper":"/paper/2501.06911"},"observation_digest":"sha256:fc1f26a294e0332f1f2cb20c479d5301314231b19281055447070c3f0b0ccffa","observation_id":"94cd4264-4635-402e-bb16-775317b7b7be","resolution":{"observed_at":"2026-08-10T20:54:05.846658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:05.800568Z","title":"We choose to work with regularized reward for two reasons: I","venue":null,"work_id":"859b770f-405a-4adb-9b24-27cb3bc30205","year":2022},"citing_paper":{"arxiv_id":"2501.06911","last_updated":"2025-01-12T19:48:21Z","snapshot_observed_at":"2026-08-12T03:12:11.032744Z","submitted_at":"2025-01-12T19:48:21Z","title":"Risk-Averse Finetuning of Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T20:54:05.242057Z"},"links":{"citing_paper":"/paper/2501.06911"},"observation_digest":"sha256:cb1875698d1a10f3cd37ecd870946754c14f7c6edfde95fb6b860c137e1f6ef0","observation_id":"8a81c51f-ad58-4a6c-bccd-ce0535e95d7e","resolution":{"observed_at":"2026-08-10T20:54:05.806374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:05.822269Z","title":"[PAD]\", rstrip=False, lstrip=False, single_word=False, normalized=False, special=True), 100: AddedToken(","venue":null,"work_id":"285b0e2b-16b3-436a-ab07-6abf2e31e381","year":2022},"citing_paper":{"arxiv_id":"2501.06911","last_updated":"2025-01-12T19:48:21Z","snapshot_observed_at":"2026-08-12T03:12:11.032744Z","submitted_at":"2025-01-12T19:48:21Z","title":"Risk-Averse Finetuning of Large Language Models","version":1},"reference_index":768,"source":"pdf_text","source_observed_at":"2026-08-10T20:54:05.236818Z"},"links":{"citing_paper":"/paper/2501.06911"},"observation_digest":"sha256:b0d516670faf09ece9fa1ef02c65c212bd52f77c564707c9b64465240ed6bfb8","observation_id":"10bec7ae-4ad5-4f6c-ae8e-0e0cc07abb20","resolution":{"observed_at":"2026-08-10T20:54:05.828970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:54:05.041769Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2501.06911","last_updated":"2025-01-12T19:48:21Z","snapshot_observed_at":"2026-08-12T03:12:11.032744Z","submitted_at":"2025-01-12T19:48:21Z","title":"Risk-Averse Finetuning of Large Language Models","version":1},"reference_index":1952,"source":"pdf_text","source_observed_at":"2026-08-10T20:54:05.041769Z"},"links":{"citing_paper":"/paper/2501.06911"},"observation_digest":"sha256:78a4df1412760cf0dcc407edba7f6ab2db82019322a6ed6ffd06a9957afbc5f9","observation_id":"4f6894a9-0bec-4174-b2b5-448f8278d076","resolution":{"observed_at":"2026-08-10T20:54:05.041769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-10T20:54:05.152427Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.06911","last_updated":"2025-01-12T19:48:21Z","snapshot_observed_at":"2026-08-12T03:12:11.032744Z","submitted_at":"2025-01-12T19:48:21Z","title":"Risk-Averse Finetuning of Large Language Models","version":1},"reference_index":2001,"source":"pdf_text","source_observed_at":"2026-08-10T20:54:05.152427Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2501.06911"},"observation_digest":"sha256:13a8ad59252e71c668be5ee2bbd4e2fba25bf8ef0ce870599de3ae70db685b71","observation_id":"799074a3-0bed-4808-93aa-00648c9f1c55","resolution":{"observed_at":"2026-08-10T20:54:05.152427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09332","last_updated":"2022-06-01T19:08:11Z","snapshot_observed_at":"2026-08-07T17:14:39.278754Z","submitted_at":"2021-12-17T05:43:43Z","title":"WebGPT: Browser-assisted question-answering with human feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.09332","snapshot_observed_at":"2026-08-10T20:54:05.131854Z","title":"Webgpt: Browser-assisted question-answering with human feedback","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.06911","last_updated":"2025-01-12T19:48:21Z","snapshot_observed_at":"2026-08-12T03:12:11.032744Z","submitted_at":"2025-01-12T19:48:21Z","title":"Risk-Averse Finetuning of Large Language Models","version":1},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-10T20:54:05.131854Z"},"links":{"cited_paper":"/paper/2112.09332","citing_paper":"/paper/2501.06911"},"observation_digest":"sha256:e89ab0b67db0d43694aa2a24168ad4e593235d3a1654d93be713f28342348681","observation_id":"c8c71568-bd16-4288-abaf-efb32a7a799a","resolution":{"observed_at":"2026-08-10T20:54:05.131854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00267","last_updated":"2024-09-03T14:01:54Z","snapshot_observed_at":"2026-07-06T16:13:07.384791Z","submitted_at":"2023-09-01T05:53:33Z","title":"RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00267","snapshot_observed_at":"2026-08-10T20:54:05.117708Z","title":"Rlaif: Scaling reinforcement learning from human feedback with ai feedback","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.06911","last_updated":"2025-01-12T19:48:21Z","snapshot_observed_at":"2026-08-12T03:12:11.032744Z","submitted_at":"2025-01-12T19:48:21Z","title":"Risk-Averse Finetuning of Large Language Models","version":1},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-10T20:54:05.117708Z"},"links":{"cited_paper":"/paper/2309.00267","citing_paper":"/paper/2501.06911"},"observation_digest":"sha256:cf34cec70ccd8bbeb223110eb6f7d0c358915df0c2142b790b57dc46fb764ae1","observation_id":"2e66f78b-29f4-4884-9793-12598b607891","resolution":{"observed_at":"2026-08-10T20:54:05.117708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.03618","last_updated":"2019-11-09T06:24:43Z","snapshot_observed_at":"2026-08-09T06:53:55.854025Z","submitted_at":"2019-11-09T06:24:43Z","title":"Worst Cases Policy Gradients","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.03618","snapshot_observed_at":"2026-08-10T20:54:05.164564Z","title":"Worst cases policy gradients.arXiv preprint arXiv:1911.03618,","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2501.06911","last_updated":"2025-01-12T19:48:21Z","snapshot_observed_at":"2026-08-12T03:12:11.032744Z","submitted_at":"2025-01-12T19:48:21Z","title":"Risk-Averse Finetuning of Large Language Models","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-10T20:54:05.164564Z"},"links":{"cited_paper":"/paper/1911.03618","citing_paper":"/paper/2501.06911"},"observation_digest":"sha256:c2e6996646a0d7feed2017bd4de610004e6b29c64a9dd55ebc6fdb96754cea27","observation_id":"aa4b1f60-ffc2-4b51-b397-a44e9bbb9d2d","resolution":{"observed_at":"2026-08-10T20:54:05.164564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.01241","last_updated":"2023-03-01T01:31:17Z","snapshot_observed_at":"2026-08-10T23:03:58.956344Z","submitted_at":"2022-10-03T21:38:29Z","title":"Is Reinforcement Learning (Not) for Natural Language Processing: Benchmarks, Baselines, and Building Blocks for Natural Language Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.01241","snapshot_observed_at":"2026-08-10T20:54:05.145902Z","title":"Is reinforcement learning (not) for natural language processing?: Benchmarks, baselines, and building blocks for natural language policy optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.06911","last_updated":"2025-01-12T19:48:21Z","snapshot_observed_at":"2026-08-12T03:12:11.032744Z","submitted_at":"2025-01-12T19:48:21Z","title":"Risk-Averse Finetuning of Large Language Models","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-10T20:54:05.145902Z"},"links":{"cited_paper":"/paper/2210.01241","citing_paper":"/paper/2501.06911"},"observation_digest":"sha256:ab1e8351e475232b0faaf33dd06421ec67b601fa2b78a3b97612431e9ae80bea","observation_id":"d8abc197-a505-4958-bbce-d00cd6bf48bd","resolution":{"observed_at":"2026-08-10T20:54:05.145902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.06367","last_updated":"2020-10-22T14:14:09Z","snapshot_observed_at":"2026-08-07T21:01:20.443312Z","submitted_at":"2020-09-14T17:45:36Z","title":"GeDi: Generative Discriminator Guided Sequence Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.06367","snapshot_observed_at":"2026-08-10T20:54:05.111068Z","title":"Gedi: Generative discriminator guided sequence generation","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2501.06911","last_updated":"2025-01-12T19:48:21Z","snapshot_observed_at":"2026-08-12T03:12:11.032744Z","submitted_at":"2025-01-12T19:48:21Z","title":"Risk-Averse Finetuning of Large Language Models","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-10T20:54:05.111068Z"},"links":{"cited_paper":"/paper/2009.06367","citing_paper":"/paper/2501.06911"},"observation_digest":"sha256:62624f46c6efa9a8c5ec78b8b650a2e13af4fbd272635eb76b1bab22a9a5df16","observation_id":"afa4f4c4-9db1-4bf7-a623-f4a8a538f8ad","resolution":{"observed_at":"2026-08-10T20:54:05.111068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12773","last_updated":"2023-10-19T14:22:03Z","snapshot_observed_at":"2026-08-02T16:56:38.535065Z","submitted_at":"2023-10-19T14:22:03Z","title":"Safe RLHF: Safe Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12773","snapshot_observed_at":"2026-08-10T20:54:05.059653Z","title":"Safe rlhf: Safe reinforcement learning from human feedback","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.06911","last_updated":"2025-01-12T19:48:21Z","snapshot_observed_at":"2026-08-12T03:12:11.032744Z","submitted_at":"2025-01-12T19:48:21Z","title":"Risk-Averse Finetuning of Large Language Models","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-10T20:54:05.059653Z"},"links":{"cited_paper":"/paper/2310.12773","citing_paper":"/paper/2501.06911"},"observation_digest":"sha256:af53d4a8a94177b978e144736e75472669dbdc880602901fec907628b200bbf2","observation_id":"de18ffcd-46cf-4c53-8b3a-d60c18d3f827","resolution":{"observed_at":"2026-08-10T20:54:05.059653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.06146","last_updated":"2018-05-23T09:23:47Z","snapshot_observed_at":"2026-08-06T18:01:48.915710Z","submitted_at":"2018-01-18T17:54:52Z","title":"Universal Language Model Fine-tuning for Text Classification","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.06146","snapshot_observed_at":"2026-08-10T20:54:05.093014Z","title":"Universal language model fine-tuning for text classification","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.06911","last_updated":"2025-01-12T19:48:21Z","snapshot_observed_at":"2026-08-12T03:12:11.032744Z","submitted_at":"2025-01-12T19:48:21Z","title":"Risk-Averse Finetuning of Large Language Models","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-10T20:54:05.093014Z"},"links":{"cited_paper":"/paper/1801.06146","citing_paper":"/paper/2501.06911"},"observation_digest":"sha256:8b7188343088c90f679e278a4f2cb299c2c5bc7db6cb545c866018485cc582ed","observation_id":"5b19e35a-fec8-443e-acd2-7b43bfcb77db","resolution":{"observed_at":"2026-08-10T20:54:05.093014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.12712","last_updated":"2023-04-13T20:41:31Z","snapshot_observed_at":"2026-08-03T04:49:15.195814Z","submitted_at":"2023-03-22T16:51:28Z","title":"Sparks of Artificial General Intelligence: Early experiments with GPT-4","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.12712","snapshot_observed_at":"2026-08-10T20:54:05.047886Z","title":"Sparks of artificial general intelligence: Early experiments with gpt-4","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.06911","last_updated":"2025-01-12T19:48:21Z","snapshot_observed_at":"2026-08-12T03:12:11.032744Z","submitted_at":"2025-01-12T19:48:21Z","title":"Risk-Averse Finetuning of Large Language Models","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-10T20:54:05.047886Z"},"links":{"cited_paper":"/paper/2303.12712","citing_paper":"/paper/2501.06911"},"observation_digest":"sha256:b3e2e59b9ddb1f0d9a7e2310a52bf24c6696dfc81bd547ca2dfc49730d8168b4","observation_id":"b67231ad-3244-4c56-be41-254761be35a1","resolution":{"observed_at":"2026-08-10T20:54:05.047886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-10T20:54:05.105089Z","title":"Audrey Huang, Liu Leqi, Zachary C Lipton, and Kamyar Azizzadenesheli","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.06911","last_updated":"2025-01-12T19:48:21Z","snapshot_observed_at":"2026-08-12T03:12:11.032744Z","submitted_at":"2025-01-12T19:48:21Z","title":"Risk-Averse Finetuning of Large Language Models","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-10T20:54:05.105089Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2501.06911"},"observation_digest":"sha256:dff3fa3aba6a7b2b0322e1522756437f58a6b2c458177ac31db43cf5fdb05aa2","observation_id":"3607c869-9333-4d05-a8d4-8411918d39c6","resolution":{"observed_at":"2026-08-10T20:54:05.105089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.11462","last_updated":"2020-09-25T20:22:26Z","snapshot_observed_at":"2026-08-09T05:10:26.091710Z","submitted_at":"2020-09-24T03:17:19Z","title":"RealToxicityPrompts: Evaluating Neural Toxic Degeneration in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.11462","snapshot_observed_at":"2026-08-10T20:54:05.086247Z","title":"Real- toxicityprompts: Evaluating neural toxic degeneration in language models","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2501.06911","last_updated":"2025-01-12T19:48:21Z","snapshot_observed_at":"2026-08-12T03:12:11.032744Z","submitted_at":"2025-01-12T19:48:21Z","title":"Risk-Averse Finetuning of Large Language Models","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-10T20:54:05.086247Z"},"links":{"cited_paper":"/paper/2009.11462","citing_paper":"/paper/2501.06911"},"observation_digest":"sha256:56d48dc9f286481912081402b7932db501e5555d91ec0a1c0c2544019612161a","observation_id":"a0b296f1-c8bb-4395-9709-51788a0ce629","resolution":{"observed_at":"2026-08-10T20:54:05.086247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.14003","last_updated":"2023-02-27T17:47:53Z","snapshot_observed_at":"2026-08-10T20:19:34.590333Z","submitted_at":"2023-02-27T17:47:53Z","title":"Systematic Rectification of Language Models via Dead-end Analysis","version":1},"cited_work":{"arxiv_id":"2302.14003","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.14003","snapshot_observed_at":"2026-08-10T20:54:05.743418Z","title":"Systematic Rectification of Language Models via Dead-end Analysis","venue":"cs.CL","work_id":"4384b066-edab-4764-8dff-df56fc5a8edc","year":2023},"citing_paper":{"arxiv_id":"2501.06911","last_updated":"2025-01-12T19:48:21Z","snapshot_observed_at":"2026-08-12T03:12:11.032744Z","submitted_at":"2025-01-12T19:48:21Z","title":"Risk-Averse Finetuning of Large Language Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-10T20:54:05.053570Z"},"links":{"cited_paper":"/paper/2302.14003","citing_paper":"/paper/2501.06911"},"observation_digest":"sha256:4fceedfeabf9fc3f46a5a9562187ae5a2072904288f611efc2856944ac4c065a","observation_id":"b2d11885-206f-4c57-956a-741d2a3ce73f","resolution":{"observed_at":"2026-08-10T20:54:05.751272Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.06911","last_updated":"2025-01-12T19:48:21Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-12T03:12:11.032744Z","submitted_at":"2025-01-12T19:48:21Z","title":"Risk-Averse Finetuning of Large Language Models"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":1,"verified_fuzzy":8},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 0 inbound Pith citation observations for arXiv:2501.06911."}