{"as_of":"2026-08-11T00:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:edb4e59551ae6ffb857af45d25898effd9dcd009d7e44830d41c130e916e5f14","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:56:17.294000Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T15:23:15.199636Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.00418","last_updated":"2024-12-31T12:40:02Z","snapshot_observed_at":"2026-08-10T22:49:22.397453Z","submitted_at":"2024-12-31T12:40:02Z","title":"Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00418","snapshot_observed_at":"2026-08-09T15:23:15.199636Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01458","last_updated":"2025-06-04T01:52:51Z","snapshot_observed_at":"2026-08-10T19:14:48.361895Z","submitted_at":"2025-02-03T15:48:28Z","title":"The Capabilities and Limitations of Weak-to-Strong Generalization: Generalization and Calibration","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-09T15:23:15.199636Z"},"links":{"cited_paper":"/paper/2501.00418","citing_paper":"/paper/2502.01458"},"observation_digest":"sha256:6e5c6296ecf4b50f680d9592c0fab449aef39185cc59ea8979c3c513ee60985d","observation_id":"b6afeab1-5c4c-4478-b064-1b062820a5b8","resolution":{"observed_at":"2026-08-09T15:23:15.199636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00418","last_updated":"2024-12-31T12:40:02Z","snapshot_observed_at":"2026-08-10T22:49:22.397453Z","submitted_at":"2024-12-31T12:40:02Z","title":"Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00418","snapshot_observed_at":"2026-08-07T11:17:46.722521Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03109","last_updated":"2025-06-03T17:40:08Z","snapshot_observed_at":"2026-08-08T19:52:36.095174Z","submitted_at":"2025-06-03T17:40:08Z","title":"On Weak-to-Strong Generalization and f-Divergence","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T11:17:46.722521Z"},"links":{"cited_paper":"/paper/2501.00418","citing_paper":"/paper/2506.03109"},"observation_digest":"sha256:ddc1c11075409a3f8e3e03deb55dd7ace4cd717ecc8c51139f9cc86487c6db02","observation_id":"6272a041-0594-41f9-9313-7adfab482516","resolution":{"observed_at":"2026-08-07T11:17:46.722521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00418","last_updated":"2024-12-31T12:40:02Z","snapshot_observed_at":"2026-08-10T22:49:22.397453Z","submitted_at":"2024-12-31T12:40:02Z","title":"Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models","version":1},"cited_work":{"arxiv_id":"2501.00418","doi":"10.48550/arxiv.2501.00418","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.00418","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2501.00418 , year=","venue":"arXiv (Cornell University)","work_id":"42eb29a8-e8f0-497d-a57c-56c589e07111","year":2025},"citing_paper":{"arxiv_id":"2605.05710","last_updated":"2026-05-07T05:55:10Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T05:55:10Z","title":"On the Blessing of Pre-training in Weak-to-Strong Generalization","version":1},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-05-08T14:59:19.883399Z"},"links":{"cited_paper":"/paper/2501.00418","citing_paper":"/paper/2605.05710"},"observation_digest":"sha256:7448e77c233847f1cef4fdf0c8bd7589097586d48e95d9141a45c3b25ec95dc8","observation_id":"3ba96de3-5d0a-4103-b537-81e561435348","resolution":{"observed_at":"2026-05-11T18:36:08.625742Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00418","last_updated":"2024-12-31T12:40:02Z","snapshot_observed_at":"2026-08-10T22:49:22.397453Z","submitted_at":"2024-12-31T12:40:02Z","title":"Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models","version":1},"cited_work":{"arxiv_id":"2501.00418","doi":"10.48550/arxiv.2501.00418","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.00418","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2501.00418 , year=","venue":"arXiv (Cornell University)","work_id":"42eb29a8-e8f0-497d-a57c-56c589e07111","year":2025},"citing_paper":{"arxiv_id":"2606.01000","last_updated":"2026-05-31T04:30:42Z","snapshot_observed_at":"2026-08-08T06:28:33.979360Z","submitted_at":"2026-05-31T04:30:42Z","title":"Trust Functions: Near-Lossless Weak-to-Strong Generalization by Learning When to Trust the Weak Teacher","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-06-28T17:35:24.108984Z"},"links":{"cited_paper":"/paper/2501.00418","citing_paper":"/paper/2606.01000"},"observation_digest":"sha256:792d26ddee80617cc96b290bc272cc39282ce94d14581ffdf43e695430b309bd","observation_id":"ddc2a02a-6551-4dd4-a954-018a6182b1af","resolution":{"observed_at":"2026-06-28T17:42:24.943936Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.00418/citation-record","integrity":"/paper/2501.00418/integrity","json":"/paper/2501.00418/citation-record.json","paper":"/paper/2501.00418"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:56:17.095613Z","title":"Deep learning with differential privacy","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.00418","last_updated":"2024-12-31T12:40:02Z","snapshot_observed_at":"2026-08-10T22:49:22.397453Z","submitted_at":"2024-12-31T12:40:02Z","title":"Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:17.095613Z"},"links":{"citing_paper":"/paper/2501.00418"},"observation_digest":"sha256:1bb0f7baf2351bc2d807d4a30efece1e2e918a81d23252508d44f101162359a6","observation_id":"5c8e58f1-382a-48e8-a37b-39e514e23e41","resolution":{"observed_at":"2026-08-10T22:56:17.095613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.06827","last_updated":"2021-12-14T19:15:34Z","snapshot_observed_at":"2026-08-10T03:11:04.256818Z","submitted_at":"2021-09-14T17:12:38Z","title":"Types of Out-of-Distribution Texts and How to Detect Them","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.06827","snapshot_observed_at":"2026-08-10T22:56:17.100416Z","title":"Types of out-of-distribution texts and how to detect them","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.00418","last_updated":"2024-12-31T12:40:02Z","snapshot_observed_at":"2026-08-10T22:49:22.397453Z","submitted_at":"2024-12-31T12:40:02Z","title":"Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:17.100416Z"},"links":{"cited_paper":"/paper/2109.06827","citing_paper":"/paper/2501.00418"},"observation_digest":"sha256:a0a6329b5804e5d008112093d52e73110de89c7234bf9d1b4d909d43e6cbc29e","observation_id":"4cf6d8b4-e7da-4200-af45-8fc4392de94a","resolution":{"observed_at":"2026-08-10T22:56:17.100416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:56:17.825054Z","title":"Pythia: A suite for analyzing large language models across training and scaling","venue":null,"work_id":"c8ccbe25-c113-4938-a42f-c8ec4749de71","year":2023},"citing_paper":{"arxiv_id":"2501.00418","last_updated":"2024-12-31T12:40:02Z","snapshot_observed_at":"2026-08-10T22:49:22.397453Z","submitted_at":"2024-12-31T12:40:02Z","title":"Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:17.105045Z"},"links":{"citing_paper":"/paper/2501.00418"},"observation_digest":"sha256:802dae6e1883a294607e1c3e34c71ca53b8c87ed37b9e53d4e149356dddb349c","observation_id":"ba0e8d9c-0793-4571-84e6-d83b7130f7fd","resolution":{"observed_at":"2026-08-10T22:56:17.829745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:56:17.110022Z","title":"Man is to computer programmer as woman is to homemaker? debiasing word embeddings","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.00418","last_updated":"2024-12-31T12:40:02Z","snapshot_observed_at":"2026-08-10T22:49:22.397453Z","submitted_at":"2024-12-31T12:40:02Z","title":"Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:17.110022Z"},"links":{"citing_paper":"/paper/2501.00418"},"observation_digest":"sha256:59335f8f14a9034f331b93c5a40b3f97a006739c223f3a793533cba16b13cd08","observation_id":"5db256fe-b703-400a-97f5-c90c9f1b2276","resolution":{"observed_at":"2026-08-10T22:56:17.110022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:56:17.801802Z","title":"Language models are realistic tabular data generators","venue":null,"work_id":"2466f634-5c81-4ffd-865c-73df21507bf9","year":2023},"citing_paper":{"arxiv_id":"2501.00418","last_updated":"2024-12-31T12:40:02Z","snapshot_observed_at":"2026-08-10T22:49:22.397453Z","submitted_at":"2024-12-31T12:40:02Z","title":"Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:17.114332Z"},"links":{"citing_paper":"/paper/2501.00418"},"observation_digest":"sha256:06275c37c48711ca3337ecaac2c576af3c9dfff48b05fd6feda316dde4fee991","observation_id":"c0e61272-cdf4-4e70-823d-b3b53a899bac","resolution":{"observed_at":"2026-08-10T22:56:17.806767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06349","last_updated":"2016-05-12T20:51:23Z","snapshot_observed_at":"2026-08-05T16:42:28.278134Z","submitted_at":"2015-11-19T20:38:45Z","title":"Generating Sentences from a Continuous Space","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06349","snapshot_observed_at":"2026-08-10T22:56:17.119094Z","title":"Generating sentences from a continuous space","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.00418","last_updated":"2024-12-31T12:40:02Z","snapshot_observed_at":"2026-08-10T22:49:22.397453Z","submitted_at":"2024-12-31T12:40:02Z","title":"Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:17.119094Z"},"links":{"cited_paper":"/paper/1511.06349","citing_paper":"/paper/2501.00418"},"observation_digest":"sha256:76f00ac52264be3e09bab44810ed6246b6a934b4b1764ef90d7cb4b7d9721a21","observation_id":"598298da-00ab-43c7-89f5-e8b19dc89534","resolution":{"observed_at":"2026-08-10T22:56:17.119094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.12712","last_updated":"2023-04-13T20:41:31Z","snapshot_observed_at":"2026-08-03T04:49:15.195814Z","submitted_at":"2023-03-22T16:51:28Z","title":"Sparks of Artificial General Intelligence: Early experiments with GPT-4","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.12712","snapshot_observed_at":"2026-08-10T22:56:17.123720Z","title":"Sparks of artificial general intelligence: Early experiments with gpt-4","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00418","last_updated":"2024-12-31T12:40:02Z","snapshot_observed_at":"2026-08-10T22:49:22.397453Z","submitted_at":"2024-12-31T12:40:02Z","title":"Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:17.123720Z"},"links":{"cited_paper":"/paper/2303.12712","citing_paper":"/paper/2501.00418"},"observation_digest":"sha256:5f51b638f3a41a373bc9d75582ab4de16a28ebaec7500757afb5078e5a1f6c0a","observation_id":"1bd0c2b0-c174-433c-9f08-5cd6a0801e6e","resolution":{"observed_at":"2026-08-10T22:56:17.123720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:56:17.786972Z","title":"Weak-to-strong generalization: Eliciting strong capabilities with weak supervision","venue":null,"work_id":"0aecf7a3-5ffa-472e-83ca-31eafab01c6e","year":2024},"citing_paper":{"arxiv_id":"2501.00418","last_updated":"2024-12-31T12:40:02Z","snapshot_observed_at":"2026-08-10T22:49:22.397453Z","submitted_at":"2024-12-31T12:40:02Z","title":"Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:17.127839Z"},"links":{"citing_paper":"/paper/2501.00418"},"observation_digest":"sha256:682bc97a115a409bf21888e968347db8330f3597c811750e7a555b0254565fd9","observation_id":"5c029ba4-6d01-4cfe-abc5-703bb9c29312","resolution":{"observed_at":"2026-08-10T22:56:17.792252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:56:17.132106Z","title":"Extracting training data from large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.00418","last_updated":"2024-12-31T12:40:02Z","snapshot_observed_at":"2026-08-10T22:49:22.397453Z","submitted_at":"2024-12-31T12:40:02Z","title":"Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:17.132106Z"},"links":{"citing_paper":"/paper/2501.00418"},"observation_digest":"sha256:be8d848a05d0493ffe987e7d5003ccacb27f6407280aedd6b738ac2b2601b85b","observation_id":"1307bddd-955d-4ba4-8c00-544026da2576","resolution":{"observed_at":"2026-08-10T22:56:17.132106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:56:17.758930Z","title":"Retiring adult: New datasets for fair machine learning","venue":null,"work_id":"ce6ba478-dde4-4991-a99d-5e857a8cb01b","year":2021},"citing_paper":{"arxiv_id":"2501.00418","last_updated":"2024-12-31T12:40:02Z","snapshot_observed_at":"2026-08-10T22:49:22.397453Z","submitted_at":"2024-12-31T12:40:02Z","title":"Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:17.136975Z"},"links":{"citing_paper":"/paper/2501.00418"},"observation_digest":"sha256:b64c87e2d0072fe6e6c7d4efca6f1310d92e86cfd8b27814a8395aa6debf47d6","observation_id":"8e9508fb-2ae6-4a58-b8c0-83135f298c20","resolution":{"observed_at":"2026-08-10T22:56:17.764110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:56:17.141214Z","title":"Calibrating noise to sensitivity in private data analysis","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2501.00418","last_updated":"2024-12-31T12:40:02Z","snapshot_observed_at":"2026-08-10T22:49:22.397453Z","submitted_at":"2024-12-31T12:40:02Z","title":"Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:17.141214Z"},"links":{"citing_paper":"/paper/2501.00418"},"observation_digest":"sha256:3596e3f3a8d17d2f2647d4c1ad7ae8cce7476c8962a150d658a0602c728314e1","observation_id":"b9f4d537-f9de-4555-95f8-77fe4e3e8bb7","resolution":{"observed_at":"2026-08-10T22:56:17.141214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:56:17.147521Z","title":"BAE: BERT-based adversarial examples for text classification","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.00418","last_updated":"2024-12-31T12:40:02Z","snapshot_observed_at":"2026-08-10T22:49:22.397453Z","submitted_at":"2024-12-31T12:40:02Z","title":"Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:17.147521Z"},"links":{"citing_paper":"/paper/2501.00418"},"observation_digest":"sha256:d02fa96a0e12a45c68c5690fa1de12bcca9fa981b2c023ebecf15e477664577f","observation_id":"654ac7ef-24dd-4ab6-924a-297dc1ea55fa","resolution":{"observed_at":"2026-08-10T22:56:17.147521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6572","last_updated":"2015-03-20T20:19:16Z","snapshot_observed_at":"2026-07-06T04:04:16.777653Z","submitted_at":"2014-12-20T01:17:12Z","title":"Explaining and Harnessing Adversarial Examples","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6572","snapshot_observed_at":"2026-08-10T22:56:17.152544Z","title":"Goodfellow, Jonathon Shlens, and Christian Szegedy","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.00418","last_updated":"2024-12-31T12:40:02Z","snapshot_observed_at":"2026-08-10T22:49:22.397453Z","submitted_at":"2024-12-31T12:40:02Z","title":"Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:17.152544Z"},"links":{"cited_paper":"/paper/1412.6572","citing_paper":"/paper/2501.00418"},"observation_digest":"sha256:d0703da134e2efa44fdb61a3fbe3e9b7b6e437f688db1a123c74d624a2db5be1","observation_id":"d1b1219e-6e47-4f6c-a5af-5027b6fe9d9b","resolution":{"observed_at":"2026-08-10T22:56:17.152544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:56:17.157126Z","title":"Reducing sentiment bias in language models via counterfactual evaluation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.00418","last_updated":"2024-12-31T12:40:02Z","snapshot_observed_at":"2026-08-10T22:49:22.397453Z","submitted_at":"2024-12-31T12:40:02Z","title":"Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:17.157126Z"},"links":{"citing_paper":"/paper/2501.00418"},"observation_digest":"sha256:bc48a2d70ba68def2e683945f70b12fdfb0d1f9835004f9db30e16cde1bb121b","observation_id":"dbf4754a-ae37-4c36-be28-9774298c1750","resolution":{"observed_at":"2026-08-10T22:56:17.157126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:56:17.736092Z","title":"Students parrot their teachers: Membership inference on model distillation","venue":null,"work_id":"65e1707b-9de9-467b-9669-66b0b7adeeb7","year":2024},"citing_paper":{"arxiv_id":"2501.00418","last_updated":"2024-12-31T12:40:02Z","snapshot_observed_at":"2026-08-10T22:49:22.397453Z","submitted_at":"2024-12-31T12:40:02Z","title":"Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:17.161816Z"},"links":{"citing_paper":"/paper/2501.00418"},"observation_digest":"sha256:f20550636121fd63960de9472aa5556ad4da5b24368533c81d69c37e1a6e9f67","observation_id":"944c1e52-49d2-41d5-9656-02dc8312debf","resolution":{"observed_at":"2026-08-10T22:56:17.740501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:56:17.166633Z","title":"Is BERT really robust? A strong baseline for natural language attack on text classification and entailment","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.00418","last_updated":"2024-12-31T12:40:02Z","snapshot_observed_at":"2026-08-10T22:49:22.397453Z","submitted_at":"2024-12-31T12:40:02Z","title":"Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:17.166633Z"},"links":{"citing_paper":"/paper/2501.00418"},"observation_digest":"sha256:fd772b5556e133d899f252e1a69db34b1a3ee17143065118f40c71baf8fb5731","observation_id":"2e93573f-77c8-4ee2-9961-923a8aea1940","resolution":{"observed_at":"2026-08-10T22:56:17.166633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:56:17.715658Z","title":"The enron corpus: A new dataset for email classification research","venue":null,"work_id":"3e2d38b1-ca50-4a8a-b6b8-cb1162f9e419","year":2004},"citing_paper":{"arxiv_id":"2501.00418","last_updated":"2024-12-31T12:40:02Z","snapshot_observed_at":"2026-08-10T22:49:22.397453Z","submitted_at":"2024-12-31T12:40:02Z","title":"Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:17.172051Z"},"links":{"citing_paper":"/paper/2501.00418"},"observation_digest":"sha256:44250a2022ab634610d2acfe61f659696be2d123833e9240e62107f0c0e8000f","observation_id":"39542e87-0d8b-4bb7-a84f-082094c8201c","resolution":{"observed_at":"2026-08-10T22:56:17.720294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:56:17.702346Z","title":"Certified robustness to adversarial examples with differential privacy","venue":null,"work_id":"0371e3c2-e341-4662-b91b-d8b22a29d762","year":2019},"citing_paper":{"arxiv_id":"2501.00418","last_updated":"2024-12-31T12:40:02Z","snapshot_observed_at":"2026-08-10T22:49:22.397453Z","submitted_at":"2024-12-31T12:40:02Z","title":"Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:17.177831Z"},"links":{"citing_paper":"/paper/2501.00418"},"observation_digest":"sha256:275679c72d9141b14202387c1d89515f68d5b89a8adc14864564b0f4889c83c9","observation_id":"9f46bc3b-ce1d-4d47-b89d-14a4c7096c61","resolution":{"observed_at":"2026-08-10T22:56:17.706453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:56:17.688653Z","title":"Gaussian membership inference privacy","venue":null,"work_id":"817956ff-dc86-4cd1-adbf-0041da5c2f5e","year":2024},"citing_paper":{"arxiv_id":"2501.00418","last_updated":"2024-12-31T12:40:02Z","snapshot_observed_at":"2026-08-10T22:49:22.397453Z","submitted_at":"2024-12-31T12:40:02Z","title":"Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:17.183166Z"},"links":{"citing_paper":"/paper/2501.00418"},"observation_digest":"sha256:fac8a40b7496dae1ba645e8772f4dda9eb6923677e87fe674dc458c905902b59","observation_id":"6a57a0d9-d202-4e51-b7fb-0dd768117b05","resolution":{"observed_at":"2026-08-10T22:56:17.693337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:56:17.674340Z","title":"Certified adversarial robustness with additive noise","venue":null,"work_id":"91ecc635-c99d-4a8e-a9c3-7d0d073b6fd1","year":2019},"citing_paper":{"arxiv_id":"2501.00418","last_updated":"2024-12-31T12:40:02Z","snapshot_observed_at":"2026-08-10T22:49:22.397453Z","submitted_at":"2024-12-31T12:40:02Z","title":"Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:17.187765Z"},"links":{"citing_paper":"/paper/2501.00418"},"observation_digest":"sha256:da57e2191cf30e9f1a986d89df53952f6c314f8eb3e96290c65aa9ff4f1fb6e0","observation_id":"cf75afa3-cb55-4c85-9c1b-76e55e8cc6c3","resolution":{"observed_at":"2026-08-10T22:56:17.678935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:56:17.192121Z","title":"BERT-ATTACK: Adversarial attack against BERT using BERT","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.00418","last_updated":"2024-12-31T12:40:02Z","snapshot_observed_at":"2026-08-10T22:49:22.397453Z","submitted_at":"2024-12-31T12:40:02Z","title":"Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:17.192121Z"},"links":{"citing_paper":"/paper/2501.00418"},"observation_digest":"sha256:ea24907dd11a1cb092b48d1c12e082cf2803da6148da6b8127d37a36493c53c6","observation_id":"9296abc1-78f1-40a0-9663-b3b4e0e407e6","resolution":{"observed_at":"2026-08-10T22:56:17.192121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1708.02002","last_updated":"2018-02-07T18:44:44Z","snapshot_observed_at":"2026-07-06T05:54:18.908943Z","submitted_at":"2017-08-07T06:32:42Z","title":"Focal Loss for Dense Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.02002","snapshot_observed_at":"2026-08-10T22:56:17.197196Z","title":"Focal loss for dense object detection","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.00418","last_updated":"2024-12-31T12:40:02Z","snapshot_observed_at":"2026-08-10T22:49:22.397453Z","submitted_at":"2024-12-31T12:40:02Z","title":"Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:17.197196Z"},"links":{"cited_paper":"/paper/1708.02002","citing_paper":"/paper/2501.00418"},"observation_digest":"sha256:03b2d99abc826bb72cbbf9f18e0c8ea6280945eaf61a7c6122350da98d7f4e09","observation_id":"e74d4151-545e-451a-bf51-b6dc2f8347b9","resolution":{"observed_at":"2026-08-10T22:56:17.197196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.06083","last_updated":"2019-09-04T18:53:10Z","snapshot_observed_at":"2026-08-07T14:27:46.872660Z","submitted_at":"2017-06-19T17:53:11Z","title":"Towards Deep Learning Models Resistant to Adversarial Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.06083","snapshot_observed_at":"2026-08-10T22:56:17.201696Z","title":"Towards deep learning models resistant to adversarial attacks.arXiv preprint arXiv:1706.06083, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.00418","last_updated":"2024-12-31T12:40:02Z","snapshot_observed_at":"2026-08-10T22:49:22.397453Z","submitted_at":"2024-12-31T12:40:02Z","title":"Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:17.201696Z"},"links":{"cited_paper":"/paper/1706.06083","citing_paper":"/paper/2501.00418"},"observation_digest":"sha256:783800e23269b24a011e0856c6540c2d7242c46e88621d45405f80664e1aca5b","observation_id":"cbadb186-30f5-4f49-8d96-d70ae8a0bd3e","resolution":{"observed_at":"2026-08-10T22:56:17.201696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:56:17.661875Z","title":"Towards deep learning models resistant to adversarial attacks","venue":null,"work_id":"ca8bec93-149e-4feb-89e0-7d1822e235a2","year":2018},"citing_paper":{"arxiv_id":"2501.00418","last_updated":"2024-12-31T12:40:02Z","snapshot_observed_at":"2026-08-10T22:49:22.397453Z","submitted_at":"2024-12-31T12:40:02Z","title":"Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:17.205854Z"},"links":{"citing_paper":"/paper/2501.00418"},"observation_digest":"sha256:0bd3ec5e3408b59531d18282556be374adfbc460ba2d338baaec320e815ade2c","observation_id":"1d5fbc65-ecf1-47a6-88d4-3ec3c324e019","resolution":{"observed_at":"2026-08-10T22:56:17.666263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:56:17.648401Z","title":"Repeated knowledge distillation with confidence masking to mitigate membership inference attacks","venue":null,"work_id":"ce0902a0-d4e1-4108-a87d-f5d179ba3eb4","year":2022},"citing_paper":{"arxiv_id":"2501.00418","last_updated":"2024-12-31T12:40:02Z","snapshot_observed_at":"2026-08-10T22:49:22.397453Z","submitted_at":"2024-12-31T12:40:02Z","title":"Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:17.209968Z"},"links":{"citing_paper":"/paper/2501.00418"},"observation_digest":"sha256:12496025826f8f419ca72418fb0fd8bb67e3d207beecd2d51bd1adf881ea7528","observation_id":"6cebab5c-3026-47af-936f-899534ed54f0","resolution":{"observed_at":"2026-08-10T22:56:17.652549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1610.05755","last_updated":"2017-03-03T18:56:43Z","snapshot_observed_at":"2026-07-06T05:15:05.941444Z","submitted_at":"2016-10-18T19:37:37Z","title":"Semi-supervised Knowledge Transfer for Deep Learning from Private Training Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.05755","snapshot_observed_at":"2026-08-10T22:56:17.214013Z","title":"Semi-supervised knowledge transfer for deep learning from private training data","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.00418","last_updated":"2024-12-31T12:40:02Z","snapshot_observed_at":"2026-08-10T22:49:22.397453Z","submitted_at":"2024-12-31T12:40:02Z","title":"Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:17.214013Z"},"links":{"cited_paper":"/paper/1610.05755","citing_paper":"/paper/2501.00418"},"observation_digest":"sha256:908a78746a2380c600079ec5407f08d0234e4e91369f31e8e2c0f310ccdc7709","observation_id":"cd4adfea-f16a-46a0-a719-993bc5f431f0","resolution":{"observed_at":"2026-08-10T22:56:17.214013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:56:17.219018Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.00418","last_updated":"2024-12-31T12:40:02Z","snapshot_observed_at":"2026-08-10T22:49:22.397453Z","submitted_at":"2024-12-31T12:40:02Z","title":"Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:17.219018Z"},"links":{"citing_paper":"/paper/2501.00418"},"observation_digest":"sha256:0e52e73c6454c5050ab06f5757df1ca34e2340bd9d17e4c7d334152695bd02d9","observation_id":"1ff2eb1f-94d6-4b69-a25e-747a0aca3286","resolution":{"observed_at":"2026-08-10T22:56:17.219018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:56:17.223166Z","title":"Are emergent abilities of large language models a mirage? Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00418","last_updated":"2024-12-31T12:40:02Z","snapshot_observed_at":"2026-08-10T22:49:22.397453Z","submitted_at":"2024-12-31T12:40:02Z","title":"Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:17.223166Z"},"links":{"citing_paper":"/paper/2501.00418"},"observation_digest":"sha256:27a5ce13ce84cfa03e09c4b102c25f50789366a79dd117caea54c5e368a65e04","observation_id":"2d320f86-b5d6-474a-abff-b480e52be49d","resolution":{"observed_at":"2026-08-10T22:56:17.223166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:56:17.620598Z","title":"Membership privacy for machine learning models through knowledge transfer","venue":null,"work_id":"05f0d1c5-ca4a-442a-9471-b0ae52e460f1","year":2021},"citing_paper":{"arxiv_id":"2501.00418","last_updated":"2024-12-31T12:40:02Z","snapshot_observed_at":"2026-08-10T22:49:22.397453Z","submitted_at":"2024-12-31T12:40:02Z","title":"Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:17.227063Z"},"links":{"citing_paper":"/paper/2501.00418"},"observation_digest":"sha256:b00d7ab4a7bc85ad3e9efb216a54c68561d5594b650215961164bff962f42db7","observation_id":"fde160cf-5a22-4a04-b497-a4af7dffca52","resolution":{"observed_at":"2026-08-10T22:56:17.625008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6199","last_updated":"2014-02-19T16:33:14Z","snapshot_observed_at":"2026-07-06T03:31:33.797310Z","submitted_at":"2013-12-21T03:36:08Z","title":"Intriguing properties of neural networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6199","snapshot_observed_at":"2026-08-10T22:56:17.231621Z","title":"Goodfellow, and Rob Fergus","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.00418","last_updated":"2024-12-31T12:40:02Z","snapshot_observed_at":"2026-08-10T22:49:22.397453Z","submitted_at":"2024-12-31T12:40:02Z","title":"Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:17.231621Z"},"links":{"cited_paper":"/paper/1312.6199","citing_paper":"/paper/2501.00418"},"observation_digest":"sha256:229ff8d69c12c99d8a75fcd700c68bdcfe153643a0d0316f00bfc257cbfe56d0","observation_id":"136abd5a-e8d0-448d-9c63-0776758c3d29","resolution":{"observed_at":"2026-08-10T22:56:17.231621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:56:17.235789Z","title":"Rethinking the inception architecture for computer vision","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.00418","last_updated":"2024-12-31T12:40:02Z","snapshot_observed_at":"2026-08-10T22:49:22.397453Z","submitted_at":"2024-12-31T12:40:02Z","title":"Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:17.235789Z"},"links":{"citing_paper":"/paper/2501.00418"},"observation_digest":"sha256:21acd4272616b80f105ea1628d39db0d45e251acb460fd35a59945bb55ec2195","observation_id":"4b50bbef-4638-454a-95e1-9126f9b9cd41","resolution":{"observed_at":"2026-08-10T22:56:17.235789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:56:17.595585Z","title":"Mitigating membership inference attacks by {Self-Distillation} through a novel ensemble architecture","venue":null,"work_id":"14c7d133-b2e0-41ec-af7b-6e87a249fb45","year":2022},"citing_paper":{"arxiv_id":"2501.00418","last_updated":"2024-12-31T12:40:02Z","snapshot_observed_at":"2026-08-10T22:49:22.397453Z","submitted_at":"2024-12-31T12:40:02Z","title":"Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:17.239929Z"},"links":{"citing_paper":"/paper/2501.00418"},"observation_digest":"sha256:c4af11af91f592b15000be7d5f6a21ea09487a0ab736162679c72752fa99f17a","observation_id":"56a17418-ccb2-4e3e-9145-eb28230bb3fa","resolution":{"observed_at":"2026-08-10T22:56:17.600289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:56:17.244405Z","title":"T3: Tree-autoencoder constrained adversarial text generation for targeted attack","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.00418","last_updated":"2024-12-31T12:40:02Z","snapshot_observed_at":"2026-08-10T22:49:22.397453Z","submitted_at":"2024-12-31T12:40:02Z","title":"Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:17.244405Z"},"links":{"citing_paper":"/paper/2501.00418"},"observation_digest":"sha256:30461040083a23ef38323247db1b2ca52dab15def1a7d8c6317ae360aa9765c0","observation_id":"79c8cc56-cfa2-4566-87af-1c26d0599b26","resolution":{"observed_at":"2026-08-10T22:56:17.244405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:56:17.565203Z","title":"Adversarial GLUE: A multi-task benchmark for robustness evaluation of language mod- els","venue":null,"work_id":"49eb54cb-8d32-415d-8ae0-2f2969fcfa2c","year":2021},"citing_paper":{"arxiv_id":"2501.00418","last_updated":"2024-12-31T12:40:02Z","snapshot_observed_at":"2026-08-10T22:49:22.397453Z","submitted_at":"2024-12-31T12:40:02Z","title":"Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:17.253890Z"},"links":{"citing_paper":"/paper/2501.00418"},"observation_digest":"sha256:a1d66c83c40beff3ff3b3bdea58ab858ea4bb8639d32b1118b6a3107e134ef23","observation_id":"9b50b6b4-6224-4985-8d20-3b03d2c13926","resolution":{"observed_at":"2026-08-10T22:56:17.570680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:56:17.551836Z","title":"Decodingtrust: A comprehensive assessment of trustworthiness in gpt models","venue":null,"work_id":"a299be47-b27f-4ef5-b615-e00a67a1e3e2","year":2023},"citing_paper":{"arxiv_id":"2501.00418","last_updated":"2024-12-31T12:40:02Z","snapshot_observed_at":"2026-08-10T22:49:22.397453Z","submitted_at":"2024-12-31T12:40:02Z","title":"Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:17.258921Z"},"links":{"citing_paper":"/paper/2501.00418"},"observation_digest":"sha256:d6f9be342303966671fb61b3c30ab642a9627a118959f57330cecbd6261674c8","observation_id":"95f7a2a4-031b-42ae-a276-03d4b2bf2b54","resolution":{"observed_at":"2026-08-10T22:56:17.556048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.11196","last_updated":"2019-08-25T23:11:07Z","snapshot_observed_at":"2026-08-10T16:55:05.317569Z","submitted_at":"2019-01-31T03:20:52Z","title":"EDA: Easy Data Augmentation Techniques for Boosting Performance on Text Classification Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.11196","snapshot_observed_at":"2026-08-10T22:56:17.264471Z","title":"Eda: Easy data augmentation techniques for boosting performance on text classification tasks","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2501.00418","last_updated":"2024-12-31T12:40:02Z","snapshot_observed_at":"2026-08-10T22:49:22.397453Z","submitted_at":"2024-12-31T12:40:02Z","title":"Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:17.264471Z"},"links":{"cited_paper":"/paper/1901.11196","citing_paper":"/paper/2501.00418"},"observation_digest":"sha256:c97ed96df177584748782893aa4652060ae98d8b01056bad23265f5d28ebe94d","observation_id":"b527d9bf-42fb-4362-b7fc-48c93c33d6df","resolution":{"observed_at":"2026-08-10T22:56:17.264471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07682","last_updated":"2022-10-26T05:06:24Z","snapshot_observed_at":"2026-08-02T15:56:35.249569Z","submitted_at":"2022-06-15T17:32:01Z","title":"Emergent Abilities of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.07682","snapshot_observed_at":"2026-08-10T22:56:17.268642Z","title":"Emergent abilities of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.00418","last_updated":"2024-12-31T12:40:02Z","snapshot_observed_at":"2026-08-10T22:49:22.397453Z","submitted_at":"2024-12-31T12:40:02Z","title":"Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:17.268642Z"},"links":{"cited_paper":"/paper/2206.07682","citing_paper":"/paper/2501.00418"},"observation_digest":"sha256:c1f41232e5a402386522ab768aa2e4636cbba86300b9badb090cd8c1e5bc8cb6","observation_id":"4b9fdc43-8667-428d-b59f-596aafea6ff5","resolution":{"observed_at":"2026-08-10T22:56:17.268642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:56:17.538283Z","title":"Revisiting out-of-distribution robustness in nlp: Benchmarks, analysis, and llms evaluations","venue":null,"work_id":"72eff159-b1ba-4e64-b1cc-c2addb4c3c89","year":2023},"citing_paper":{"arxiv_id":"2501.00418","last_updated":"2024-12-31T12:40:02Z","snapshot_observed_at":"2026-08-10T22:49:22.397453Z","submitted_at":"2024-12-31T12:40:02Z","title":"Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:17.272777Z"},"links":{"citing_paper":"/paper/2501.00418"},"observation_digest":"sha256:accd1ecc2fc8fabbe5ccd7292eb7ef8f03ccf3732b456a519eaae375ac5d65c9","observation_id":"571b1777-95d2-47a5-81e0-8cf3004c8391","resolution":{"observed_at":"2026-08-10T22:56:17.542888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:56:17.523715Z","title":"Fairness constraints: Mechanisms for fair classification","venue":null,"work_id":"c0b8d659-14c1-483a-b2ad-231628e6932b","year":2017},"citing_paper":{"arxiv_id":"2501.00418","last_updated":"2024-12-31T12:40:02Z","snapshot_observed_at":"2026-08-10T22:49:22.397453Z","submitted_at":"2024-12-31T12:40:02Z","title":"Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:17.276628Z"},"links":{"citing_paper":"/paper/2501.00418"},"observation_digest":"sha256:3fd407aed6baee75e4317881164a6cd195107306ee89fde26fe47be31ae9d34f","observation_id":"ca347c03-fe7f-45e7-8344-5967c4a4ee8c","resolution":{"observed_at":"2026-08-10T22:56:17.528494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:56:17.280424Z","title":"Word-level textual adversarial attacking as combinatorial optimization","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.00418","last_updated":"2024-12-31T12:40:02Z","snapshot_observed_at":"2026-08-10T22:49:22.397453Z","submitted_at":"2024-12-31T12:40:02Z","title":"Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:17.280424Z"},"links":{"citing_paper":"/paper/2501.00418"},"observation_digest":"sha256:9adc657dd43fc53da780539f4cac79d5ca989a32f731cb8b0a81515a0338ebe9","observation_id":"7d72000f-3ebc-449d-83d3-2bcffab1ab4c","resolution":{"observed_at":"2026-08-10T22:56:17.280424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:56:17.284964Z","title":"Gender bias in coreference resolution: Evaluation and debiasing methods","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.00418","last_updated":"2024-12-31T12:40:02Z","snapshot_observed_at":"2026-08-10T22:49:22.397453Z","submitted_at":"2024-12-31T12:40:02Z","title":"Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:17.284964Z"},"links":{"citing_paper":"/paper/2501.00418"},"observation_digest":"sha256:ddd28f2c57bacdeee05ded3d5d51bac5dffb55385664b7726929c53fa22f55f8","observation_id":"eae24b9f-29e0-4a75-a1bc-93bc9519a2fb","resolution":{"observed_at":"2026-08-10T22:56:17.284964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:56:17.508405Z","title":"Resisting membership inference attacks through knowledge distillation","venue":null,"work_id":"7a7aa4a3-05c1-4456-990b-d50b37442c07","year":2021},"citing_paper":{"arxiv_id":"2501.00418","last_updated":"2024-12-31T12:40:02Z","snapshot_observed_at":"2026-08-10T22:49:22.397453Z","submitted_at":"2024-12-31T12:40:02Z","title":"Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:17.289433Z"},"links":{"citing_paper":"/paper/2501.00418"},"observation_digest":"sha256:0412efcd86d9c6791362619fb30965176e67280982523316d601fd52207c6ad6","observation_id":"c77db318-aa73-46a4-944e-4f3fd6db689e","resolution":{"observed_at":"2026-08-10T22:56:17.514659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11764","last_updated":"2020-04-23T07:19:00Z","snapshot_observed_at":"2026-07-06T08:24:38.792721Z","submitted_at":"2019-09-25T20:50:32Z","title":"FreeLB: Enhanced Adversarial Training for Natural Language Understanding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.11764","snapshot_observed_at":"2026-08-10T22:56:17.294000Z","title":"Freelb: Enhanced adversarial training for natural language understanding","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2501.00418","last_updated":"2024-12-31T12:40:02Z","snapshot_observed_at":"2026-08-10T22:49:22.397453Z","submitted_at":"2024-12-31T12:40:02Z","title":"Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:17.294000Z"},"links":{"cited_paper":"/paper/1909.11764","citing_paper":"/paper/2501.00418"},"observation_digest":"sha256:37e5fb62d64c3599e01503b85b01f1b153064e627bbe2ba78b87e60ed0087a3e","observation_id":"3bc2b9de-59b9-47d6-b537-9db6bc2b7ee4","resolution":{"observed_at":"2026-08-10T22:56:17.294000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:56:17.580873Z","title":null,"venue":null,"work_id":"fb2b361b-6ccb-43c3-9c7f-7836244a6811","year":2020},"citing_paper":{"arxiv_id":"2501.00418","last_updated":"2024-12-31T12:40:02Z","snapshot_observed_at":"2026-08-10T22:49:22.397453Z","submitted_at":"2024-12-31T12:40:02Z","title":"Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models","version":1},"reference_index":495,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:17.248663Z"},"links":{"citing_paper":"/paper/2501.00418"},"observation_digest":"sha256:40857b2ce2a1a3ae2b2dc6c249431de0488971fb088bb5c1087af243cdd0d143","observation_id":"b4588d93-7f23-4a3b-8257-e29287254382","resolution":{"observed_at":"2026-08-10T22:56:17.585753Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.00418","last_updated":"2024-12-31T12:40:02Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T22:49:22.397453Z","submitted_at":"2024-12-31T12:40:02Z","title":"Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":18},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 4 inbound Pith citation observations for arXiv:2501.00418."}