{"as_of":"2026-08-15T20:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bb12365bf88f4fda74615766f689ee22a305b9a6537e5682d7d8f54224203979","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":22,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T17:20:17.907944Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T01:37:30.523597Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2111.02840","last_updated":"2022-01-10T06:05:16Z","snapshot_observed_at":"2026-08-13T17:39:43.122193Z","submitted_at":"2021-11-04T12:59:55Z","title":"Adversarial GLUE: A Multi-Task Benchmark for Robustness Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":"2111.02840","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.02840","snapshot_observed_at":"2026-07-03T01:37:30.523597Z","title":"Adversarial glue: A multi-task benchmark for robustness evaluation of language models","venue":null,"work_id":"445f4304-a89d-4e75-9f0f-22daeadcf559","year":2021},"citing_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-08-12T09:06:50.363435Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-24T07:42:09.112946Z"},"links":{"cited_paper":"/paper/2111.02840","citing_paper":"/paper/2307.15043"},"observation_digest":"sha256:8ef96f2af97c573e79d40437623fe094c7650137eebe0e362b9812592f7bab4f","observation_id":"299597fc-8011-4ba3-900f-bd62627e7964","resolution":{"observed_at":"2026-05-24T07:44:08.495253Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02840","last_updated":"2022-01-10T06:05:16Z","snapshot_observed_at":"2026-08-13T17:39:43.122193Z","submitted_at":"2021-11-04T12:59:55Z","title":"Adversarial GLUE: A Multi-Task Benchmark for Robustness Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":"2111.02840","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.02840","snapshot_observed_at":"2026-07-03T01:37:30.523597Z","title":"Adversarial glue: A multi-task benchmark for robustness evaluation of language models","venue":null,"work_id":"445f4304-a89d-4e75-9f0f-22daeadcf559","year":2021},"citing_paper":{"arxiv_id":"2401.05561","last_updated":"2024-09-30T10:17:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-10T22:07:21Z","title":"TrustLLM: Trustworthiness in Large Language Models","version":6},"reference_index":267,"source":"pdf_text","source_observed_at":"2026-05-18T11:17:08.108565Z"},"links":{"cited_paper":"/paper/2111.02840","citing_paper":"/paper/2401.05561"},"observation_digest":"sha256:5a4e2d1a561ac6be16e4c0bcc2430c856a428393b92b919eb389795e3974496a","observation_id":"5eda0ea9-d41e-4ad7-83a9-452544fbe937","resolution":{"observed_at":"2026-05-18T11:17:08.774235Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02840","last_updated":"2022-01-10T06:05:16Z","snapshot_observed_at":"2026-08-13T17:39:43.122193Z","submitted_at":"2021-11-04T12:59:55Z","title":"Adversarial GLUE: A Multi-Task Benchmark for Robustness Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":"2111.02840","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.02840","snapshot_observed_at":"2026-07-03T01:37:30.523597Z","title":"Adversarial glue: A multi-task benchmark for robustness evaluation of language models","venue":null,"work_id":"445f4304-a89d-4e75-9f0f-22daeadcf559","year":2021},"citing_paper":{"arxiv_id":"2406.04244","last_updated":"2024-06-06T16:41:39Z","snapshot_observed_at":"2026-07-30T15:43:06.151242Z","submitted_at":"2024-06-06T16:41:39Z","title":"Benchmark Data Contamination of Large Language Models: A Survey","version":1},"reference_index":149,"source":"pdf_text","source_observed_at":"2026-05-22T23:10:40.420241Z"},"links":{"cited_paper":"/paper/2111.02840","citing_paper":"/paper/2406.04244"},"observation_digest":"sha256:8070c8c5d2396653a2a7bd004ee77368703455bc2139299332a474d5aedcfb68","observation_id":"e0c194f5-dff8-434a-98bb-03e0a6e15350","resolution":{"observed_at":"2026-05-22T23:10:41.098865Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02840","last_updated":"2022-01-10T06:05:16Z","snapshot_observed_at":"2026-08-13T17:39:43.122193Z","submitted_at":"2021-11-04T12:59:55Z","title":"Adversarial GLUE: A Multi-Task Benchmark for Robustness Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02840","snapshot_observed_at":"2026-08-11T15:55:06.860412Z","title":"Adversarial glue: A multi-task benchmark for robustness evaluation of language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.10535","last_updated":"2024-12-13T20:04:25Z","snapshot_observed_at":"2026-08-12T23:11:55.879162Z","submitted_at":"2024-12-13T20:04:25Z","title":"On Adversarial Robustness and Out-of-Distribution Robustness of Large Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T15:55:06.860412Z"},"links":{"cited_paper":"/paper/2111.02840","citing_paper":"/paper/2412.10535"},"observation_digest":"sha256:ccf9e10a61cdd2420c2595ea9a24b373876921d29c056297579afe09c39acfcd","observation_id":"bef0e7fc-336f-4b0a-962b-42dce9246ae8","resolution":{"observed_at":"2026-08-11T15:55:06.860412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02840","last_updated":"2022-01-10T06:05:16Z","snapshot_observed_at":"2026-08-13T17:39:43.122193Z","submitted_at":"2021-11-04T12:59:55Z","title":"Adversarial GLUE: A Multi-Task Benchmark for Robustness Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02840","snapshot_observed_at":"2026-08-10T15:19:49.656199Z","title":"Adversarial glue: A multi-task benchmark for robustness evaluation of language models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.14205","last_updated":"2025-01-24T03:21:20Z","snapshot_observed_at":"2026-08-13T07:47:38.920178Z","submitted_at":"2025-01-24T03:21:20Z","title":"Serving Long-Context LLMs at the Mobile Edge: Test-Time Reinforcement Learning-based Model Caching and Inference Offloading","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T15:19:49.656199Z"},"links":{"cited_paper":"/paper/2111.02840","citing_paper":"/paper/2501.14205"},"observation_digest":"sha256:95185864008d13fb6454c29e71918da6ca24859e61fccc12a421b77da26cd311","observation_id":"81301fb8-5a9e-45f0-b363-1aa1c5868a03","resolution":{"observed_at":"2026-08-10T15:19:49.656199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02840","last_updated":"2022-01-10T06:05:16Z","snapshot_observed_at":"2026-08-13T17:39:43.122193Z","submitted_at":"2021-11-04T12:59:55Z","title":"Adversarial GLUE: A Multi-Task Benchmark for Robustness Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02840","snapshot_observed_at":"2026-08-09T17:36:28.830087Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00847","last_updated":"2025-02-02T16:40:21Z","snapshot_observed_at":"2026-08-13T13:52:59.877387Z","submitted_at":"2025-02-02T16:40:21Z","title":"SecPE: Secure Prompt Ensembling for Private and Robust Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-09T17:36:28.830087Z"},"links":{"cited_paper":"/paper/2111.02840","citing_paper":"/paper/2502.00847"},"observation_digest":"sha256:15837dd378c8c8883481a8aed9d5d9ea27d4c7f487ffadf8ec108d5d9bd67dd6","observation_id":"02a5b6f4-3520-42f2-b258-e7a0263ce9b5","resolution":{"observed_at":"2026-08-09T17:36:28.830087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02840","last_updated":"2022-01-10T06:05:16Z","snapshot_observed_at":"2026-08-13T17:39:43.122193Z","submitted_at":"2021-11-04T12:59:55Z","title":"Adversarial GLUE: A Multi-Task Benchmark for Robustness Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02840","snapshot_observed_at":"2026-08-07T23:35:42.872968Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-14T13:00:35.954303Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.872968Z"},"links":{"cited_paper":"/paper/2111.02840","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:c59ffbf0e03ea488ecbad6475294796bbdf7164c3b60706f1f74290d5b41558d","observation_id":"51a6cad7-7eab-4dbe-9466-5731b9e54fb6","resolution":{"observed_at":"2026-08-07T23:35:42.872968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02840","last_updated":"2022-01-10T06:05:16Z","snapshot_observed_at":"2026-08-13T17:39:43.122193Z","submitted_at":"2021-11-04T12:59:55Z","title":"Adversarial GLUE: A Multi-Task Benchmark for Robustness Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02840","snapshot_observed_at":"2026-08-07T10:17:27.007444Z","title":"Adversarial glue: A multi-task benchmark for robustness evaluation of language models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-13T12:53:10.459412Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":135,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:27.007444Z"},"links":{"cited_paper":"/paper/2111.02840","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:505544b368996a84c6398fa2f478a2ee8a89f94fd6a58e51e05b85cbb128dd4c","observation_id":"a2356488-2d08-4cfa-83ef-c2faa043053c","resolution":{"observed_at":"2026-08-07T10:17:27.007444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02840","last_updated":"2022-01-10T06:05:16Z","snapshot_observed_at":"2026-08-13T17:39:43.122193Z","submitted_at":"2021-11-04T12:59:55Z","title":"Adversarial GLUE: A Multi-Task Benchmark for Robustness Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02840","snapshot_observed_at":"2026-08-06T23:20:03.461424Z","title":"H., and Li, B","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18421","last_updated":"2025-07-14T06:09:12Z","snapshot_observed_at":"2026-08-13T21:22:47.097035Z","submitted_at":"2025-06-23T09:02:04Z","title":"TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:03.461424Z"},"links":{"cited_paper":"/paper/2111.02840","citing_paper":"/paper/2506.18421"},"observation_digest":"sha256:6590cd31b276532ff5e4c939c46b18e4d8948f7eb25037a8f1b294d917e4509b","observation_id":"6f6c6654-9fed-443f-8b78-24f80ffffc80","resolution":{"observed_at":"2026-08-06T23:20:03.461424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02840","last_updated":"2022-01-10T06:05:16Z","snapshot_observed_at":"2026-08-13T17:39:43.122193Z","submitted_at":"2021-11-04T12:59:55Z","title":"Adversarial GLUE: A Multi-Task Benchmark for Robustness Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02840","snapshot_observed_at":"2026-08-06T21:07:15.210109Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.00981","last_updated":"2025-07-02T18:22:59Z","snapshot_observed_at":"2026-08-12T17:14:33.525416Z","submitted_at":"2025-07-01T17:33:48Z","title":"Evaluating Robustness of Monocular Depth Estimation with Procedural Scene Perturbations","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:15.210109Z"},"links":{"cited_paper":"/paper/2111.02840","citing_paper":"/paper/2507.00981"},"observation_digest":"sha256:76d78f52055a9dcd59ddb508ea2ea0f11f8a3a00d69de244306977982b06e952","observation_id":"fc9f0b3b-194d-4e02-932d-47bbb20ff156","resolution":{"observed_at":"2026-08-06T21:07:15.210109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02840","last_updated":"2022-01-10T06:05:16Z","snapshot_observed_at":"2026-08-13T17:39:43.122193Z","submitted_at":"2021-11-04T12:59:55Z","title":"Adversarial GLUE: A Multi-Task Benchmark for Robustness Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":"2111.02840","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.02840","snapshot_observed_at":"2026-07-03T01:37:30.523597Z","title":"Adversarial glue: A multi-task benchmark for robustness evaluation of language models","venue":null,"work_id":"445f4304-a89d-4e75-9f0f-22daeadcf559","year":2021},"citing_paper":{"arxiv_id":"2507.05660","last_updated":"2026-05-21T16:31:21Z","snapshot_observed_at":"2026-07-29T18:54:03.959574Z","submitted_at":"2025-07-08T04:40:09Z","title":"Optimus: A Robust Defense Framework for Mitigating Toxicity while Fine-Tuning Conversational AI","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-22T12:17:59.458633Z"},"links":{"cited_paper":"/paper/2111.02840","citing_paper":"/paper/2507.05660"},"observation_digest":"sha256:a272ec96430d0ebe03ce5d45fe54f06b2d859b7f89a3894664b1cf50c41ccaf2","observation_id":"0e1e92a1-6ee0-4d9a-bb6d-3d55a5a0d33b","resolution":{"observed_at":"2026-05-22T12:21:31.072680Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02840","last_updated":"2022-01-10T06:05:16Z","snapshot_observed_at":"2026-08-13T17:39:43.122193Z","submitted_at":"2021-11-04T12:59:55Z","title":"Adversarial GLUE: A Multi-Task Benchmark for Robustness Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02840","snapshot_observed_at":"2026-08-06T17:35:48.496124Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.496124Z"},"links":{"cited_paper":"/paper/2111.02840","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:f0d97408ac033d37258efa75a5fd361678d8dedebddd7cf8c6ddf066d82db1ec","observation_id":"1581c38e-115f-4014-b61b-b00e5933eef6","resolution":{"observed_at":"2026-08-06T17:35:48.496124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02840","last_updated":"2022-01-10T06:05:16Z","snapshot_observed_at":"2026-08-13T17:39:43.122193Z","submitted_at":"2021-11-04T12:59:55Z","title":"Adversarial GLUE: A Multi-Task Benchmark for Robustness Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02840","snapshot_observed_at":"2026-08-15T17:20:17.907944Z","title":"Adversarial glue: A multi-task benchmark for robustness evaluation of language models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.14118","last_updated":"2025-08-18T12:31:55Z","snapshot_observed_at":"2026-08-15T18:00:25.360259Z","submitted_at":"2025-08-18T12:31:55Z","title":"Hallucinations in medical devices","version":1},"reference_index":130,"source":"pdf_text","source_observed_at":"2026-08-15T17:20:17.907944Z"},"links":{"cited_paper":"/paper/2111.02840","citing_paper":"/paper/2508.14118"},"observation_digest":"sha256:1ad3149e89d050c09dae061d28c5e8cd4f153961f1c3ce0187c983126ea3dd30","observation_id":"b3fe0c03-c654-4e8c-b354-8d4a1158847f","resolution":{"observed_at":"2026-08-15T17:20:17.907944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02840","last_updated":"2022-01-10T06:05:16Z","snapshot_observed_at":"2026-08-13T17:39:43.122193Z","submitted_at":"2021-11-04T12:59:55Z","title":"Adversarial GLUE: A Multi-Task Benchmark for Robustness Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02840","snapshot_observed_at":"2026-08-05T17:14:34.612856Z","title":"Adversarial glue: A multi-task benchmark for robustness evaluation of language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.18306","last_updated":"2025-08-23T02:50:55Z","snapshot_observed_at":"2026-08-14T20:23:35.152528Z","submitted_at":"2025-08-23T02:50:55Z","title":"SALMAN: Stability Analysis of Language Models Through the Maps Between Graph-based Manifolds","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T17:14:34.612856Z"},"links":{"cited_paper":"/paper/2111.02840","citing_paper":"/paper/2508.18306"},"observation_digest":"sha256:9d7380931bb2397ec14833a1590dde71186aaf6ad5840d921f9c5297ba0c1c29","observation_id":"770cff7c-c045-40a4-a587-8bee484c7ae1","resolution":{"observed_at":"2026-08-05T17:14:34.612856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02840","last_updated":"2022-01-10T06:05:16Z","snapshot_observed_at":"2026-08-13T17:39:43.122193Z","submitted_at":"2021-11-04T12:59:55Z","title":"Adversarial GLUE: A Multi-Task Benchmark for Robustness Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02840","snapshot_observed_at":"2026-08-03T03:07:44.414501Z","title":"InThe Twelfth International Conference on Learning Representations","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.09130","last_updated":"2026-05-23T15:19:05Z","snapshot_observed_at":"2026-08-13T09:31:28.247618Z","submitted_at":"2026-02-09T19:20:56Z","title":"UniComp: A Unified Evaluation of Large Language Model Compression via Pruning, Quantization and Distillation","version":5},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T03:07:44.414501Z"},"links":{"cited_paper":"/paper/2111.02840","citing_paper":"/paper/2602.09130"},"observation_digest":"sha256:15597e0e73008bd91eb772afdf069e7d008dab96fd3508d26ade64f230962b95","observation_id":"906feaee-1255-47a8-909b-097d40f3347d","resolution":{"observed_at":"2026-08-03T03:07:44.414501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02840","last_updated":"2022-01-10T06:05:16Z","snapshot_observed_at":"2026-08-13T17:39:43.122193Z","submitted_at":"2021-11-04T12:59:55Z","title":"Adversarial GLUE: A Multi-Task Benchmark for Robustness Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":"2111.02840","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.02840","snapshot_observed_at":"2026-07-03T01:37:30.523597Z","title":"Adversarial glue: A multi-task benchmark for robustness evaluation of language models","venue":null,"work_id":"445f4304-a89d-4e75-9f0f-22daeadcf559","year":2021},"citing_paper":{"arxiv_id":"2604.18389","last_updated":"2026-04-20T15:13:33Z","snapshot_observed_at":"2026-07-06T23:05:17.639285Z","submitted_at":"2026-04-20T15:13:33Z","title":"Understanding the Prompt Sensitivity","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-05-10T04:41:03.416429Z"},"links":{"cited_paper":"/paper/2111.02840","citing_paper":"/paper/2604.18389"},"observation_digest":"sha256:1294f622e32fafdb4881d859f2b6f1d031d49c2e9c3f50b8909f977f011ecca9","observation_id":"057b9cff-7b10-40c0-bb0b-d2e1fde96b51","resolution":{"observed_at":"2026-05-10T12:05:23.299039Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02840","last_updated":"2022-01-10T06:05:16Z","snapshot_observed_at":"2026-08-13T17:39:43.122193Z","submitted_at":"2021-11-04T12:59:55Z","title":"Adversarial GLUE: A Multi-Task Benchmark for Robustness Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":"2111.02840","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.02840","snapshot_observed_at":"2026-07-03T01:37:30.523597Z","title":"Adversarial glue: A multi-task benchmark for robustness evaluation of language models","venue":null,"work_id":"445f4304-a89d-4e75-9f0f-22daeadcf559","year":2021},"citing_paper":{"arxiv_id":"2605.14415","last_updated":"2026-05-14T06:04:40Z","snapshot_observed_at":"2026-08-11T17:35:44.920443Z","submitted_at":"2026-05-14T06:04:40Z","title":"SWE-Chain: Benchmarking Coding Agents on Chained Release-Level Package Upgrades","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-15T02:31:18.183715Z"},"links":{"cited_paper":"/paper/2111.02840","citing_paper":"/paper/2605.14415"},"observation_digest":"sha256:3fbbcdc86f091fecf9d91604cedf7768b2217a88f2666a610c28caf52a520ed7","observation_id":"12759f72-b577-4243-8e03-70be1f0978ec","resolution":{"observed_at":"2026-05-15T02:33:32.367930Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02840","last_updated":"2022-01-10T06:05:16Z","snapshot_observed_at":"2026-08-13T17:39:43.122193Z","submitted_at":"2021-11-04T12:59:55Z","title":"Adversarial GLUE: A Multi-Task Benchmark for Robustness Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":"2111.02840","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.02840","snapshot_observed_at":"2026-07-03T01:37:30.523597Z","title":"Adversarial glue: A multi-task benchmark for robustness evaluation of language models","venue":null,"work_id":"445f4304-a89d-4e75-9f0f-22daeadcf559","year":2021},"citing_paper":{"arxiv_id":"2605.20654","last_updated":"2026-06-03T08:00:52Z","snapshot_observed_at":"2026-08-15T07:14:01.028636Z","submitted_at":"2026-05-20T03:16:15Z","title":"REFLECTOR: Internalizing Step-wise Reflection against Indirect Jailbreak","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-21T06:16:01.040236Z"},"links":{"cited_paper":"/paper/2111.02840","citing_paper":"/paper/2605.20654"},"observation_digest":"sha256:8ea051572d40e92dd9432ebd3f332368907d987c5774f87c96bf771c3f424cb7","observation_id":"a0a3fae3-2bc8-407c-be7c-f78a3993fab6","resolution":{"observed_at":"2026-05-21T06:19:41.929065Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02840","last_updated":"2022-01-10T06:05:16Z","snapshot_observed_at":"2026-08-13T17:39:43.122193Z","submitted_at":"2021-11-04T12:59:55Z","title":"Adversarial GLUE: A Multi-Task Benchmark for Robustness Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":"2111.02840","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.02840","snapshot_observed_at":"2026-07-03T01:37:30.523597Z","title":"Adversarial glue: A multi-task benchmark for robustness evaluation of language models","venue":null,"work_id":"445f4304-a89d-4e75-9f0f-22daeadcf559","year":2021},"citing_paper":{"arxiv_id":"2606.03606","last_updated":"2026-06-03T12:40:36Z","snapshot_observed_at":"2026-08-05T13:58:58.657681Z","submitted_at":"2026-06-02T13:09:44Z","title":"Testing LLM Arithmetic Reasoning Generalization with Automatic Numeric-Remapping Attacks","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T09:27:30.923556Z"},"links":{"cited_paper":"/paper/2111.02840","citing_paper":"/paper/2606.03606"},"observation_digest":"sha256:4e32f2fd01d881eaada6c668219040578320e784390d95f8798dea2d6811ade2","observation_id":"d6314ba4-b8cf-4cc9-b9b0-f08fb46c7267","resolution":{"observed_at":"2026-07-02T04:06:35.135367Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02840","last_updated":"2022-01-10T06:05:16Z","snapshot_observed_at":"2026-08-13T17:39:43.122193Z","submitted_at":"2021-11-04T12:59:55Z","title":"Adversarial GLUE: A Multi-Task Benchmark for Robustness Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":"2111.02840","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.02840","snapshot_observed_at":"2026-07-03T01:37:30.523597Z","title":"Adversarial glue: A multi-task benchmark for robustness evaluation of language models","venue":null,"work_id":"445f4304-a89d-4e75-9f0f-22daeadcf559","year":2021},"citing_paper":{"arxiv_id":"2606.09711","last_updated":"2026-06-08T16:32:54Z","snapshot_observed_at":"2026-07-06T23:49:03.237958Z","submitted_at":"2026-06-08T16:32:54Z","title":"Proxy Reward Internalization and Mechanistic Exploitation: A Learned Precursor to Reward Hacking and Its Generalization","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-06-27T16:26:34.918099Z"},"links":{"cited_paper":"/paper/2111.02840","citing_paper":"/paper/2606.09711"},"observation_digest":"sha256:4493bc649a0f500e309b07737dc5837ffe7661d6d061297134d1323a85bcb32c","observation_id":"4fbfb9ed-1b90-4717-92e7-8a60808cc76d","resolution":{"observed_at":"2026-07-03T01:37:30.524920Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02840","last_updated":"2022-01-10T06:05:16Z","snapshot_observed_at":"2026-08-13T17:39:43.122193Z","submitted_at":"2021-11-04T12:59:55Z","title":"Adversarial GLUE: A Multi-Task Benchmark for Robustness Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":"2111.02840","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.02840","snapshot_observed_at":"2026-07-03T01:37:30.523597Z","title":"Adversarial glue: A multi-task benchmark for robustness evaluation of language models","venue":null,"work_id":"445f4304-a89d-4e75-9f0f-22daeadcf559","year":2021},"citing_paper":{"arxiv_id":"2607.00012","last_updated":"2026-05-08T10:35:13Z","snapshot_observed_at":"2026-08-12T10:34:28.270771Z","submitted_at":"2026-05-08T10:35:13Z","title":"PRA-RAG: Provably Robust Aggregation in Retrieval-Augmented Generation against Retrieval Corruption","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-07-02T23:42:23.695930Z"},"links":{"cited_paper":"/paper/2111.02840","citing_paper":"/paper/2607.00012"},"observation_digest":"sha256:43ef6b1467f9829adfff44eecda9ab5a335820b8e89c58239b4dc590cee3137e","observation_id":"ab15359e-50ef-4264-af87-7108b2756630","resolution":{"observed_at":"2026-07-02T23:47:27.205626Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02840","last_updated":"2022-01-10T06:05:16Z","snapshot_observed_at":"2026-08-13T17:39:43.122193Z","submitted_at":"2021-11-04T12:59:55Z","title":"Adversarial GLUE: A Multi-Task Benchmark for Robustness Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02840","snapshot_observed_at":"2026-08-15T15:14:29.548847Z","title":"Adversarial","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02670","last_updated":"2026-08-02T14:26:12Z","snapshot_observed_at":"2026-08-15T15:07:16.708424Z","submitted_at":"2026-08-02T14:26:12Z","title":"Permission Denied: Policy-Graded Evaluation of Coding Agents in Hardened Environments","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T15:14:29.548847Z"},"links":{"cited_paper":"/paper/2111.02840","citing_paper":"/paper/2608.02670"},"observation_digest":"sha256:84eea3f9ff7f70bc5ca0a069b656ad71c19ab37483021e534de4dabde46d545c","observation_id":"cbc473e1-9fb5-4ff0-87e8-bc8b7b39678a","resolution":{"observed_at":"2026-08-15T15:14:29.548847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2111.02840/citation-record","integrity":"/paper/2111.02840/integrity","json":"/paper/2111.02840/citation-record.json","paper":"/paper/2111.02840"},"outbound":[],"paper":{"arxiv_id":"2111.02840","last_updated":"2022-01-10T06:05:16Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-13T17:39:43.122193Z","submitted_at":"2021-11-04T12:59:55Z","title":"Adversarial GLUE: A Multi-Task Benchmark for Robustness Evaluation of Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 22 inbound Pith citation observations for arXiv:2111.02840."}