{"as_of":"2026-08-24T02:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1c3ad50a14ee6cff06afaf4d230034ae760a32297299dffc69fdf94c6ee8a2b0","coverage":[{"denominator":73,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":73,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T22:06:39.050277Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.04643/citation-record","integrity":"/paper/2502.04643/integrity","json":"/paper/2502.04643/citation-record.json","paper":"/paper/2502.04643"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:38.786466Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.786466Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:23a7f56b1ee03da0457fb780f50a688f4a6795a963a6d2384fb338ef87900672","observation_id":"b06ff1ef-cc73-47e3-bf4c-128628083815","resolution":{"observed_at":"2026-08-08T22:06:38.786466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:07:24.876117Z","title":"Choquette-Choo, Matthew Jagielski, Irena Gao, Pang Wei W Koh, Daphne Ippolito, Florian Tramer, and Ludwig Schmidt","venue":null,"work_id":"592401ac-6b4d-4e30-be68-2e9ad914bd34","year":2023},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.790888Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:c00a6d054f9f1237f533100d8235f79534a107e55d5b3768cc155da338eeed52","observation_id":"9d78a881-b929-4b82-b8f6-6469f15a48ef","resolution":{"observed_at":"2026-08-08T22:07:24.879718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.11175","last_updated":"2018-04-12T17:03:44Z","snapshot_observed_at":"2026-08-20T11:11:25.778001Z","submitted_at":"2018-03-29T17:43:03Z","title":"Universal Sentence Encoder","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.11175","snapshot_observed_at":"2026-08-08T22:06:38.795141Z","title":"Universal sentence encoder","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.795141Z"},"links":{"cited_paper":"/paper/1803.11175","citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:c5b6bb59e47b0481cf95e29d5f3d8d092713fcffbf6b6969d0c8cf120b2205e6","observation_id":"13509d42-e3dc-46ba-a3a4-e80328a353ef","resolution":{"observed_at":"2026-08-08T22:06:38.795141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:38.799248Z","title":"Pappas, and Eric Wong","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.799248Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:4a6639ab689fa393698d71b265c1ff161b810cdb05356ff542af11d2e15985d6","observation_id":"6f5518d8-9e12-4b3c-ab47-27144f0e0c99","resolution":{"observed_at":"2026-08-08T22:06:38.799248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12180","last_updated":"2024-09-18T17:52:53Z","snapshot_observed_at":"2026-08-18T08:29:45.900348Z","submitted_at":"2024-09-18T17:52:53Z","title":"Finetuning Language Models to Emit Linguistic Expressions of Uncertainty","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12180","snapshot_observed_at":"2026-08-08T22:06:38.802830Z","title":"Finetuning language models to emit linguistic expressions of uncertainty, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.802830Z"},"links":{"cited_paper":"/paper/2409.12180","citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:85065d0ec3cb58fbb286068a5e21fcb61e420100314d19e47335561a3ccdaab2","observation_id":"698754f5-71db-40fe-9147-92c75dbee5aa","resolution":{"observed_at":"2026-08-08T22:06:38.802830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:38.806757Z","title":"BERT : Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.806757Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:b5eae19714e9793efb2362740691301bf21fa5ba6873f52ba17ac1031e78bc5c","observation_id":"f747824e-f6cf-402f-841d-310002afad40","resolution":{"observed_at":"2026-08-08T22:06:38.806757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:07:24.857729Z","title":"Towards robustness against natural language word substitutions","venue":null,"work_id":"b186cc11-baff-43c7-aad2-424e96b4fc20","year":2021},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.810657Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:a0dbfa974ceab897cb4cc59d8038a15f66eee05cb49bd8ebb3234623457fe7be","observation_id":"0105b3d3-142b-445d-940d-862a4c6102c8","resolution":{"observed_at":"2026-08-08T22:07:24.861734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.13541","last_updated":"2021-07-28T17:55:08Z","snapshot_observed_at":"2026-08-22T06:27:48.658935Z","submitted_at":"2021-07-28T17:55:08Z","title":"Towards Robustness Against Natural Language Word Substitutions","version":1},"cited_work":{"arxiv_id":"2107.13541","doi":null,"metadata_source":"pith","pith_arxiv_id":"2107.13541","snapshot_observed_at":"2026-08-08T22:07:24.570867Z","title":"Towards Robustness Against Natural Language Word Substitutions","venue":"cs.CL","work_id":"f122cd91-7e9b-4c8c-8ed1-4fc8c1198d6a","year":2021},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.814057Z"},"links":{"cited_paper":"/paper/2107.13541","citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:f6457a6d8d1c88eca445d12c32fa29e64f82f6532c1634d9b0f7ee97cb9274ea","observation_id":"ff964c0e-4dec-4fd9-8d9e-96eef66c61f7","resolution":{"observed_at":"2026-08-08T22:07:24.575044Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:38.817712Z","title":"H ot F lip: White-box adversarial examples for text classification","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.817712Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:8340e40e2ddc73d18e1d499e3c6d3ccb5d68332fee8503b413c472445e443385","observation_id":"557450ae-0a2c-4b93-b625-7500fe980c65","resolution":{"observed_at":"2026-08-08T22:06:38.817712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:07:24.847249Z","title":"o zde G \\","venue":null,"work_id":"aa0a24a8-699d-4fdf-9898-1e7103f98f67","year":2019},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.821288Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:548dc5e3d4b9bf16ec5ecf6ca52f0f5ab94ba59bc8ec16e8339ca68b8725e581","observation_id":"1878716a-2ee4-41ab-85b1-e5a46d1f514b","resolution":{"observed_at":"2026-08-08T22:07:24.850770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:38.824941Z","title":"Special symbol attacks on nlp systems","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.824941Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:4e4809947c9871b799d520dd15635fe7c8af9305bb471a41049ada2626afcc86","observation_id":"faaf7918-2760-45d2-875d-41120c98f2c1","resolution":{"observed_at":"2026-08-08T22:06:38.824941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.findings-eacl.1","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Using punctuation as an adversarial attack on deep learning-based NLP systems: An empirical study","venue":null,"work_id":"88be5f3a-19a6-41b3-93b8-c539db485c30","year":2023},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.828361Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:7d1fbc43af49678aeb388fa0109040f47d35ff947f43d6293c37b1e8dc65f82b","observation_id":"79102f9c-7e52-4b15-b45c-47f1a5845976","resolution":{"observed_at":"2026-08-08T22:06:39.243622Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.naacl-long.443","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"S em R o D e: Macro adversarial training to learn representations that are robust to word-level attacks","venue":null,"work_id":"4ce952bf-75d6-4a58-8c61-c7a0371f25bd","year":2024},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.831769Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:f9cea32bb71ed5ef14aa7ed463495a8db22f58a06e1ba382d4011a2a84276c01","observation_id":"554d9ae5-9e89-4a8d-8989-a237fb7c291d","resolution":{"observed_at":"2026-08-08T22:07:24.840072Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:38.835312Z","title":"Reasoning robustness of LLM s to adversarial typographical errors","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.835312Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:45ad2ad68d1c367da5c19e2051f09d7ba7a7632b46605ff841d4d4413924fd22","observation_id":"651766c1-64e2-4ee2-a943-b1632ffd0f2a","resolution":{"observed_at":"2026-08-08T22:06:38.835312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/p19-1610","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Improving the robustness of question answering systems to question paraphrasing","venue":null,"work_id":"48caa52b-78c2-406c-947a-a19718e8e8f7","year":2019},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.838746Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:f057da12d4d03b6fedb066c436aa3ed5c8ad685e40c8ac9a8b1651c1494ecdb6","observation_id":"318cd17a-cb4b-4cbd-8a52-24675324cfeb","resolution":{"observed_at":"2026-08-08T22:06:39.225930Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:38.841995Z","title":"Did Aristotle Use a Laptop? A Question Answering Benchmark with Implicit Reasoning Strategies","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.841995Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:d849baedcd0200510f1240175addd77ef397c49323a5d6a6be762da32f10545e","observation_id":"1a62c797-d0f2-4036-abc4-36d2fa0c4b57","resolution":{"observed_at":"2026-08-08T22:06:38.841995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:07:24.826291Z","title":"Buelow, Rupert Langer, Bastian Dislich, Peter Boor, Volkmar Schulz, and Jakob Nikolas Kather","venue":null,"work_id":"4d72ed42-0aef-4514-9fba-3227833c7774","year":2022},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.845472Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:abf07db584ad07181fb92fc4905c05b7cf8ab9d7561650db44544f1cd497d1e7","observation_id":"f6a6f372-b76c-4e68-816c-a5f989fc19be","resolution":{"observed_at":"2026-08-08T22:07:24.829538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6572","last_updated":"2015-03-20T20:19:16Z","snapshot_observed_at":"2026-08-19T07:17:20.004918Z","submitted_at":"2014-12-20T01:17:12Z","title":"Explaining and Harnessing Adversarial Examples","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6572","snapshot_observed_at":"2026-08-08T22:06:38.848950Z","title":"Goodfellow, Jonathon Shlens, and Christian Szegedy","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.848950Z"},"links":{"cited_paper":"/paper/1412.6572","citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:c499490059a9fd08347c0e108ee6c33f664f2a5fd0383b7d13cae96b4bfee928","observation_id":"4bc83bd7-03db-49b4-bc60-21748889d076","resolution":{"observed_at":"2026-08-08T22:06:38.848950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:07:24.817462Z","title":"Weinberger","venue":null,"work_id":"c02420df-1561-4ba1-ac9f-89a6aea5e854","year":2017},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.853079Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:6b981309f4db0ce65afcc38cc126d3ce66da0f0ea8b9e89b7a293961b81bae8a","observation_id":"67c9e2f2-fe89-4d1e-aafe-f34da834eaab","resolution":{"observed_at":"2026-08-08T22:07:24.820356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:07:24.808025Z","title":"Weinberger","venue":null,"work_id":"0830130c-df71-4741-8529-86827f1b14e9","year":2017},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.856702Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:4562d4f9e1a15b08e3aaee0bbb9a7296660c4231c3a62335790bbaf4639eb4d6","observation_id":"23e68a1c-ffa6-40a4-bc1c-a6b263fae991","resolution":{"observed_at":"2026-08-08T22:07:24.811122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06987","last_updated":"2023-10-10T20:15:54Z","snapshot_observed_at":"2026-08-15T18:47:46.763989Z","submitted_at":"2023-10-10T20:15:54Z","title":"Catastrophic Jailbreak of Open-source LLMs via Exploiting Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06987","snapshot_observed_at":"2026-08-08T22:06:38.860489Z","title":"Catastrophic jailbreak of open-source llms via exploiting generation, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.860489Z"},"links":{"cited_paper":"/paper/2310.06987","citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:09c32cbbd09bcffe930c7fae3e2504c83e7beac6052894b971229cee4aad217a","observation_id":"186e16d7-425a-4409-b80b-e489ede6ae96","resolution":{"observed_at":"2026-08-08T22:06:38.860489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:38.864286Z","title":"Adversarial example generation with syntactically controlled paraphrase networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.864286Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:01298f245bcc2f26469bfafb8fdf5113854c3d748ff660b6995ebaa4b1e2e4da","observation_id":"74b954e2-70f9-4fe4-8811-2180b2b28597","resolution":{"observed_at":"2026-08-08T22:06:38.864286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13425","last_updated":"2025-02-20T02:24:55Z","snapshot_observed_at":"2026-08-16T22:48:42.542156Z","submitted_at":"2024-04-20T17:19:54Z","title":"Enhancing Adversarial Robustness of Vision-Language Models through Low-Rank Adaptation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13425","snapshot_observed_at":"2026-08-08T22:06:38.867893Z","title":"Advlora: Adversarial low-rank adaptation of vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.867893Z"},"links":{"cited_paper":"/paper/2404.13425","citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:ba63d9f8429effaca878be83b6592efcd3fd581d6e824fc934ed7724ca9d79bc","observation_id":"647e80db-2238-4247-b5ac-5712ba10c4ae","resolution":{"observed_at":"2026-08-08T22:06:38.867893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:38.871884Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.871884Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:ad5017a3dd107bc79e931e95844d8c5a8897f0119b0a72e52dc81f40bd405722","observation_id":"a58d39df-2145-446f-9607-a5fde0f7adc7","resolution":{"observed_at":"2026-08-08T22:06:38.871884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:07:24.791198Z","title":"How can we know when language models know? on the calibration of language models for question answering, 2021","venue":null,"work_id":"ec99fc80-8ea6-4150-99b9-23394a64830d","year":2021},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.875365Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:ee248c0cbb660dfb0f39ca70dab672a769e889bb95d2cd8fef59b156afd5a5cc","observation_id":"bb3c12cf-08a3-4207-8db7-166d8ce8c966","resolution":{"observed_at":"2026-08-08T22:07:24.794848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11932","last_updated":"2020-04-08T23:10:10Z","snapshot_observed_at":"2026-08-14T18:17:13.593912Z","submitted_at":"2019-07-27T15:07:04Z","title":"Is BERT Really Robust? A Strong Baseline for Natural Language Attack on Text Classification and Entailment","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11932","snapshot_observed_at":"2026-08-08T22:06:38.878882Z","title":"Is bert really robust? a strong baseline for natural language attack on text classification and entailment, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.878882Z"},"links":{"cited_paper":"/paper/1907.11932","citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:817378e9e1aa4e10a1c0ac6caf674d8f589a121d34e9b834d1e939f52c529201","observation_id":"d6c5a754-7370-4648-884e-ba0ce5eb0735","resolution":{"observed_at":"2026-08-08T22:06:38.878882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:38.882645Z","title":"T rivia QA : A large scale distantly supervised challenge dataset for reading comprehension","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.882645Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:d194d209a095a0d4b30d0a8631ccd494d0ead5da36a751012cfa8a8cecea3bb5","observation_id":"a9dbee5e-3d42-4649-9284-433a09178362","resolution":{"observed_at":"2026-08-08T22:06:38.882645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:38.886231Z","title":"Language models (mostly) know what they know, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.886231Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:5c898d42c29ee76b49f7754a6384e72e31aeab516ffb6516cad01a113fc4d899","observation_id":"1a369df4-247b-49f8-ba17-be4026cad235","resolution":{"observed_at":"2026-08-08T22:06:38.886231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.02533","last_updated":"2017-02-11T00:39:39Z","snapshot_observed_at":"2026-08-16T03:14:49.760924Z","submitted_at":"2016-07-08T21:12:11Z","title":"Adversarial examples in the physical world","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.02533","snapshot_observed_at":"2026-08-08T22:06:38.889683Z","title":"Adversarial examples in the physical world","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.889683Z"},"links":{"cited_paper":"/paper/1607.02533","citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:c9ca7fb3085dee32c533ab15d478065db7f1636e0a0524559399f49831c76b3f","observation_id":"aebd11f4-4d22-4b0c-9f9f-f4a8ac384a84","resolution":{"observed_at":"2026-08-08T22:06:38.889683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:38.893679Z","title":"TextBugger : Generating adversarial text against real-world applications","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.893679Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:8f14416e85750bb3ee947dba4012f9d695120dd53efb31471013ec4716d22505","observation_id":"3c3f464f-b1e8-4181-9921-8fb557c36dfd","resolution":{"observed_at":"2026-08-08T22:06:38.893679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:38.897124Z","title":"BERT - ATTACK : Adversarial attack against BERT using BERT","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.897124Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:faabbca5606c2ba6b266c5289e7799ef96138a21852bf3fb7e5df512c52f2604","observation_id":"60f91f8c-2ee1-48d2-b3f0-44a98023b594","resolution":{"observed_at":"2026-08-08T22:06:38.897124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:07:24.774371Z","title":"Teaching models to express their uncertainty in words, 2022","venue":null,"work_id":"289329bb-9cd0-45b6-92ec-c0adb01913d4","year":2022},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.900822Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:3a811ca92688be7b989219aeee19c634a192806c529f22a80c38e40dc3dcd3bf","observation_id":"539674aa-627c-4674-b010-3dab3568cdc1","resolution":{"observed_at":"2026-08-08T22:07:24.778000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v37i11.26553","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Sspattack: A simple and sweet paradigm for black-box hard-label textual adversarial attack","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"4fff4976-fbee-4661-9872-826e5d9add5e","year":2023},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.904446Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:26d0eaa493386fcae8c9d5cd41fe0daea8c715a86f5638f4b9d8aa1c1a0871bd","observation_id":"3dbed84e-2b53-4fa3-a8bf-19d53fac7d06","resolution":{"observed_at":"2026-08-08T22:06:39.187299Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15993","last_updated":"2024-10-23T08:33:54Z","snapshot_observed_at":"2026-08-18T07:54:59.904276Z","submitted_at":"2024-04-24T17:10:35Z","title":"Uncertainty Estimation and Quantification for LLMs: A Simple Supervised Approach","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15993","snapshot_observed_at":"2026-08-08T22:06:38.908043Z","title":"Uncertainty estimation and quantification for llms: A simple supervised approach, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.908043Z"},"links":{"cited_paper":"/paper/2404.15993","citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:ce987c220ae49f01369422b8d8d4cb91d0f76cb203108e150766c3c03c9818b8","observation_id":"6d2cdb81-a076-488c-b72b-0b8d5f0ce0bd","resolution":{"observed_at":"2026-08-08T22:06:38.908043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:07:24.763743Z","title":"Autodan: Generating stealthy jailbreak prompts on aligned large language models, 2024 b","venue":null,"work_id":"842771cf-eab6-48d1-950c-21893f82b4ea","year":2024},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.911862Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:940ee4a9e8a02c7c1ecacc0aec8f37e9dec0fe445a27a98e444651eef9f3acee","observation_id":"0863056b-d110-442d-911b-973bb4d2c7a9","resolution":{"observed_at":"2026-08-08T22:07:24.767514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02832","last_updated":"2026-05-15T07:55:39Z","snapshot_observed_at":"2026-08-16T23:15:47.586831Z","submitted_at":"2024-10-02T08:41:23Z","title":"FlipAttack: Jailbreak LLMs via Flipping","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02832","snapshot_observed_at":"2026-08-08T22:06:38.915187Z","title":"Flipattack: Jailbreak llms via flipping","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.915187Z"},"links":{"cited_paper":"/paper/2410.02832","citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:e9fbd7b8110a5e825ed4f796e0b89f3bbbf8ecd366614f640f233c5337b95eb2","observation_id":"fb786464-b4e3-4e5a-9f41-8d8f5ac31202","resolution":{"observed_at":"2026-08-08T22:06:38.915187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:07:24.752997Z","title":"At which training stage does code data help LLM s reasoning? In The Twelfth International Conference on Learning Representations, 2024","venue":null,"work_id":"7c8535f0-f169-4e2f-b4c8-0a2953208dc5","year":2024},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.918567Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:7b045cb05b38e2ee31896f54606d879e97555cf6686f8e823506b9fa99d1bb29","observation_id":"de135ef2-6a5a-4b40-939a-a6aca5ecf6ca","resolution":{"observed_at":"2026-08-08T22:07:24.756811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:38.922029Z","title":"Towards deep learning models resistant to adversarial attacks, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.922029Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:f20a47685618966e0f1473044608917facf1d18ca5ece653fe54471ed891455a","observation_id":"ba503021-ae33-4e33-938c-31770087a4ac","resolution":{"observed_at":"2026-08-08T22:06:38.922029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.14956","last_updated":"2021-04-29T10:59:14Z","snapshot_observed_at":"2026-08-16T18:55:21.752000Z","submitted_at":"2020-12-29T22:01:38Z","title":"Generating Natural Language Attacks in a Hard Label Black Box Setting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.14956","snapshot_observed_at":"2026-08-08T22:06:38.929089Z","title":"Generating natural language attacks in a hard label black box setting","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.929089Z"},"links":{"cited_paper":"/paper/2012.14956","citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:bdd604ad27735d0ee6dc5ce1616d7342672f0da0ddb0c4f08880e233bcb322b7","observation_id":"09dbc5ae-324f-42b1-b5ec-8c873be4c4a9","resolution":{"observed_at":"2026-08-08T22:06:38.929089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:07:24.736329Z","title":"Tree of attacks: Jailbreaking black-box LLM s automatically","venue":null,"work_id":"db0452c1-a2e2-4b45-a18e-db6f12857ac0","year":2024},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.932553Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:7d044e7bbd81b0d2ba01dc8653bbf557e527116d0cba0bfcfd3a6e4d5cfc0b99","observation_id":"2165e54e-bd21-48eb-a214-d6044b134154","resolution":{"observed_at":"2026-08-08T22:07:24.739968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.05909","last_updated":"2020-10-05T00:10:24Z","snapshot_observed_at":"2026-08-18T03:04:28.486504Z","submitted_at":"2020-04-29T21:33:35Z","title":"TextAttack: A Framework for Adversarial Attacks, Data Augmentation, and Adversarial Training in NLP","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.05909","snapshot_observed_at":"2026-08-08T22:06:38.935952Z","title":"Morris, Eli Lifland, Jin Yong Yoo, Jake Grigsby, Di Jin, and Yanjun Qi","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.935952Z"},"links":{"cited_paper":"/paper/2005.05909","citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:74d4391408b28359de325c93f87bdbefcd592d2c6045ce2eefe9460d4179ab8c","observation_id":"ccc52258-f62b-4fa7-84cd-293a857cff19","resolution":{"observed_at":"2026-08-08T22:06:38.935952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:07:24.725809Z","title":"Counter-fitting word vectors to linguistic constraints, 2016","venue":null,"work_id":"44f3195c-f0ee-46ed-ace2-b8d84ca7622f","year":2016},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.939857Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:648c923be1815385617282682503e86fbd0cb08a2eacaf58e8895c42051e0712","observation_id":"d9da8935-d51f-4a9b-a792-c83e8760fea0","resolution":{"observed_at":"2026-08-08T22:07:24.729303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:38.943199Z","title":"Strength in numbers: Estimating confidence of large language models by prompt agreement","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.943199Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:8e5782868bd96b8fe0e9c53b962f60b8588eca3209ec791b066d596f90af3922","observation_id":"99814762-4a55-427c-bb9e-0018b059dc82","resolution":{"observed_at":"2026-08-08T22:06:38.943199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.137","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Extreme miscalibration and the illusion of adversarial robustness","venue":null,"work_id":"72cc5604-d78e-49d8-91d9-e5ee14748909","year":2024},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.946560Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:7515f721789bec90776bc385d4ee16062c5648f0d83867625ec3a2a6bf89e2c5","observation_id":"0b692972-5525-4574-90fd-5ffd3812d1a7","resolution":{"observed_at":"2026-08-08T22:06:39.165669Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:38.949980Z","title":"Generating natural language adversarial examples through probability weighted word saliency","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.949980Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:e41437e94919af22f84423ef9e1dbdfff3e01e2a4a2a37615ad52b11e6f534e9","observation_id":"fb22cb1e-c1df-40a0-88fb-5a1eecd3561d","resolution":{"observed_at":"2026-08-08T22:06:38.949980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01833","last_updated":"2025-02-26T13:41:41Z","snapshot_observed_at":"2026-08-21T00:19:01.514656Z","submitted_at":"2024-04-02T10:45:49Z","title":"Great, Now Write an Article About That: The Crescendo Multi-Turn LLM Jailbreak Attack","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01833","snapshot_observed_at":"2026-08-08T22:06:38.953361Z","title":"Great, now write an article about that: The crescendo multi-turn llm jailbreak attack, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.953361Z"},"links":{"cited_paper":"/paper/2404.01833","citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:cb632693f1db68160a0474f25d44cdd2b2e3f481ea7027eb2fdbbdf2f6272946","observation_id":"433787ed-819e-4146-bb6d-81caca8aeef3","resolution":{"observed_at":"2026-08-08T22:06:38.953361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:07:24.709842Z","title":"Second-order uncertainty quantification: A distance-based approach","venue":null,"work_id":"999c8dc3-d515-4e39-8cb1-6d106bea577f","year":2024},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.957004Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:db913f07b37f6d30ec0583072088ba2614585a43828cd22f94aab98258ded402","observation_id":"698caa8c-9494-43b5-a1a5-1b55f3df3fe6","resolution":{"observed_at":"2026-08-08T22:07:24.713315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:38.960140Z","title":"Large language model uncertainty measurement and calibration for medical diagnosis and treatment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.960140Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:5a98c512acca6ca71d20908d571296acc2d4e07d1e4bd6fcb6a4a51463aa9611","observation_id":"1187fd41-1ccc-40ab-8e97-9cca394ffeb1","resolution":{"observed_at":"2026-08-08T22:06:38.960140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:38.963359Z","title":"Logan IV, Eric Wallace, and Sameer Singh","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.963359Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:9c3e2e8286b2ad46c2d2635ae8dba9124369817af7d9bb6590baccdf9b21e2ab","observation_id":"af0b722a-1a5b-4b47-8dd2-e27701252ace","resolution":{"observed_at":"2026-08-08T22:06:38.963359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6199","last_updated":"2014-02-19T16:33:14Z","snapshot_observed_at":"2026-08-15T16:41:15.505782Z","submitted_at":"2013-12-21T03:36:08Z","title":"Intriguing properties of neural networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6199","snapshot_observed_at":"2026-08-08T22:06:38.968013Z","title":"Goodfellow, and Rob Fergus","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.968013Z"},"links":{"cited_paper":"/paper/1312.6199","citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:7ed801abc85013dba91420ae5ce8f24dac704ad5126a53543777a6add5802b53","observation_id":"97c1b163-8670-4db1-842e-93bcfb764115","resolution":{"observed_at":"2026-08-08T22:06:38.968013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:38.971928Z","title":"It’s morphin’ time! combating linguistic discrimination with inflectional perturbations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.971928Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:cb1c77ad99decc3c40aba7edd8f9bf1d03b3ae12369c02b0dad3031c6683509f","observation_id":"84ec1773-6229-4829-8f1f-5bcab717b160","resolution":{"observed_at":"2026-08-08T22:06:38.971928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:38.975593Z","title":"Just ask for calibration: Strategies for eliciting calibrated confidence scores from language models fine-tuned with human feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.975593Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:7c25df204262cfdeaffb3d628990675b617a2979140be92eee17635648468e1f","observation_id":"0a22275b-c838-4bd1-9d2e-7ee053dd98dc","resolution":{"observed_at":"2026-08-08T22:06:38.975593Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:38.979076Z","title":"Llama: Open and efficient foundation language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.979076Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:bc87c302799f33680a322e9347641e49e7298a20d92a026d86ca9f0764c66357","observation_id":"72cc1b2a-8af4-49c4-bf2d-9aee28587879","resolution":{"observed_at":"2026-08-08T22:06:38.979076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:07:24.692842Z","title":"Calibrating large language models using their generations only, 2024","venue":null,"work_id":"a7ad86c1-ecc1-4172-b3f1-868861ef9e3c","year":2024},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.982491Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:54a7facd0920042c3e1615def630e501acec9e93ab0da71ed06a164fbe7769c2","observation_id":"7b15e501-be15-409a-bf6b-c9a51a6c8859","resolution":{"observed_at":"2026-08-08T22:07:24.696891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2020.emnlp-main.417","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"CAT -gen: Improving robustness in NLP models via controlled adversarial text generation","venue":null,"work_id":"1182166d-a70d-42e5-b8e9-8edb3809835f","year":2020},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.986041Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:e09ab669925ec354d2f4ea6a1f5e5a9b55939d1fd52796fb2184a19880817899","observation_id":"8fdd3a8c-99ef-4bb1-af56-75cd58f315b1","resolution":{"observed_at":"2026-08-08T22:06:39.122881Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:07:24.682493Z","title":"Adversarial training with fast gradient projection method against synonym substitution based text attacks, 2020 b","venue":null,"work_id":"8f23a29c-6d4f-4c9a-b30e-2f94a661ea88","year":2020},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.989513Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:4fc68c2f0b2350d21b575c899e2c62ad52899245198fda1a0c01393784b5689c","observation_id":"b36c88fd-7cd2-49cd-8d5c-8157d288a653","resolution":{"observed_at":"2026-08-08T22:07:24.686114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:38.993023Z","title":"Chi, Sharan Narang, Aakanksha Chowdhery, and Denny Zhou","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.993023Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:67db2864bde550c46da2eeb65975dae6dcb0601c86f1f6911d6e56452de9ee00","observation_id":"f6e96565-c004-4fc0-aa07-445f497f4a33","resolution":{"observed_at":"2026-08-08T22:06:38.993023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:07:24.665249Z","title":"Stop reasoning! when multimodal LLM with chain-of-thought reasoning meets adversarial image","venue":null,"work_id":"e78f93b5-7e93-4c7e-968a-73be6d15321d","year":2024},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:38.996680Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:738895a86592474e65d6dcbfac9767c507f35801b97ca8a9d2535d540a264085","observation_id":"8ab5336a-f3f1-4843-bcaa-f1f2059bf598","resolution":{"observed_at":"2026-08-08T22:07:24.668721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15589","last_updated":"2024-11-01T16:39:36Z","snapshot_observed_at":"2026-08-20T09:59:01.744109Z","submitted_at":"2024-05-24T14:20:09Z","title":"Efficient Adversarial Training in LLMs with Continuous Attacks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15589","snapshot_observed_at":"2026-08-08T22:06:39.000036Z","title":"Efficient adversarial training in llms with continuous attacks, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:39.000036Z"},"links":{"cited_paper":"/paper/2405.15589","citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:3959c5dc4fddea03e4cc1b8630efc1b6f9894adc767a4f11a84d3218d2164ec4","observation_id":"6ebfcde3-9af6-40d6-8439-04f0f2a2fb40","resolution":{"observed_at":"2026-08-08T22:06:39.000036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:39.003724Z","title":"Can LLM s express their uncertainty? an empirical evaluation of confidence elicitation in LLM s","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:39.003724Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:2b3ebfc0c1739099d7a1c1e37325439963ef7edaae7d43510e61341465972acf","observation_id":"9b033b79-1eba-46b0-823d-662a5c48207b","resolution":{"observed_at":"2026-08-08T22:06:39.003724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:07:24.648514Z","title":"An LLM can fool itself: A prompt-based adversarial attack","venue":null,"work_id":"41a816ce-a3b1-4ae6-9fbd-675e9a487de5","year":2024},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:39.007141Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:c53af160e2f5bb561636a53bb3f0d26d41489474a9c55ee72c089e9d7b5a66fc","observation_id":"094b0dbb-05e5-4da2-8b18-b13170dce54f","resolution":{"observed_at":"2026-08-08T22:07:24.652477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:39.010457Z","title":"Texthoaxer: Budgeted hard-label adversarial attacks on text","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:39.010457Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:4304c04b2fe32b44f07b1d07ddd02019cdcaa56e0e6c4aff3240dfaeadf74310","observation_id":"75b5120f-16f1-4b63-9b73-d351c7b6e6cb","resolution":{"observed_at":"2026-08-08T22:06:39.010457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20089","last_updated":"2025-03-20T15:28:18Z","snapshot_observed_at":"2026-08-16T13:14:12.950870Z","submitted_at":"2024-09-30T08:41:39Z","title":"Robust LLM safeguarding via refusal feature adversarial training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.20089","snapshot_observed_at":"2026-08-08T22:06:39.013987Z","title":"Robust llm safeguarding via refusal feature adversarial training, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:39.013987Z"},"links":{"cited_paper":"/paper/2409.20089","citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:0bfe1845c40c566ca82190ff5de887d1f5323e6fa304d84f6df5dbd4007907d1","observation_id":"7396e07c-d9fa-4b27-9dfb-febd8771e42d","resolution":{"observed_at":"2026-08-08T22:06:39.013987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2022.findings-emnlp.44","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"T ext H acker: Learning based hybrid local search algorithm for text hard-label adversarial attack","venue":null,"work_id":"54420954-a2bb-4cd0-8c71-be3399d5daf2","year":2022},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:39.017575Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:71477643407dbcea643fb55b1e299c7fcd7d976559ae591fffeed619b956077f","observation_id":"47a522f8-7b57-46dd-8f34-f847782b88ae","resolution":{"observed_at":"2026-08-08T22:06:39.104300Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:39.021017Z","title":"Word-level textual adversarial attacking as combinatorial optimization","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:39.021017Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:0ebfdccdd8292978b2aa983c721f4037e116eb277c88742405b39c9630a048d7","observation_id":"a5cc5fbb-c26f-452c-9afd-9f88e7193be6","resolution":{"observed_at":"2026-08-08T22:06:39.021017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17256","last_updated":"2025-07-23T18:43:18Z","snapshot_observed_at":"2026-08-20T09:22:08.869784Z","submitted_at":"2024-01-30T18:48:37Z","title":"Weak-to-Strong Jailbreaking on Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.17256","snapshot_observed_at":"2026-08-08T22:06:39.024687Z","title":"Weak-to-strong jailbreaking on large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:39.024687Z"},"links":{"cited_paper":"/paper/2401.17256","citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:87666224bfc67d9292df4d15fe9eeab4247239a95151dd2cb78a7aa024b16d1b","observation_id":"2ed9ab0e-3aec-4809-979b-34f74362d5ad","resolution":{"observed_at":"2026-08-08T22:06:39.024687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:07:24.639147Z","title":"Freelb: Enhanced adversarial training for natural language understanding, 2020","venue":null,"work_id":"e1181003-d843-4ecb-8409-4d3f25f4dfd7","year":2020},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:39.028166Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:e41306bbbad7b10c28758364fb85f80666a2b5d464b7d5c78601d2a2a70fa222","observation_id":"8c052fa2-8a76-449a-970c-d50b95a4944b","resolution":{"observed_at":"2026-08-08T22:07:24.642273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:07:24.629625Z","title":"Auto DAN : Automatic and interpretable adversarial attacks on large language models, 2024","venue":null,"work_id":"191fc768-d874-4e87-8411-8d8b6e571faf","year":2024},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:39.031566Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:4fa093b2a8b38a612f33de577e1355f6846cab5c881e81253f625bd0afabdda6","observation_id":"5909f52b-7a61-4cee-a95b-1cf22e6a19ae","resolution":{"observed_at":"2026-08-08T22:07:24.632898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:39.035313Z","title":"Zico Kolter, and Matt Fredrikson","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:39.035313Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:13a311941c25e5719078e1a690134849f83ac1479a0046998e62190d8e3d84f1","observation_id":"1bc43655-8808-4513-998e-d5b7dcfab70d","resolution":{"observed_at":"2026-08-08T22:06:39.035313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:39.038666Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:39.038666Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:b782adcdbcda5d4a2a624904ec644773989332a5d9fe8725d9e334a9ee1734f4","observation_id":"2c472bca-1d33-47c5-8e4a-fc6c6a62b05c","resolution":{"observed_at":"2026-08-08T22:06:39.038666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:39.042566Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:39.042566Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:5efb93aa48e56d5441f3f09aec924863a05541d3716de3fe197fd684901392f3","observation_id":"d9f9e5ad-4f3b-4f20-8dec-611662b5b6ca","resolution":{"observed_at":"2026-08-08T22:06:39.042566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:39.046484Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:39.046484Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:210d80574c6452f23ff412c2627d2fe2009f58f462f4fb96db94627029a6bd5c","observation_id":"99608ef3-78f9-46d0-aa74-a3e6914258a8","resolution":{"observed_at":"2026-08-08T22:06:39.046484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:06:39.050277Z","title":"jq5 ǝ.s] 5 o<tTK XXʵ 5? ouqͼς i 5צD.Vw \\ b> ? E Bj< &_z r, Sփ p","venue":null,"work_id":null,"year":1925},"citing_paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-08T22:06:39.050277Z"},"links":{"citing_paper":"/paper/2502.04643"},"observation_digest":"sha256:6326e404ac847b511a045b013fa8e9ae68f82ce9f3391dacce50ea4e477b80d3","observation_id":"58a96e54-cd1f-4ab0-b98f-c6899f1930fd","resolution":{"observed_at":"2026-08-08T22:06:39.050277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.04643","last_updated":"2025-02-10T06:46:48Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-21T12:51:27.316112Z","submitted_at":"2025-02-07T04:07:36Z","title":"Confidence Elicitation: A New Attack Vector for Large Language Models"},"reference_resolution":{"displayed":73,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":45,"verified_exact":8,"verified_fuzzy":19},"total_outbound_references":73},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 24 August 2026, this Paper Citation Record lists 73 of 73 outbound references and 0 inbound Pith citation observations for arXiv:2502.04643."}