{"as_of":"2026-08-23T23:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:363f66bacbe9b85ed847a6e884e7d8001a0cf8e715e2d0445ebe075d67e264c6","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T13:39:11.853587Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T00:31:24.708173Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-11T00:31:24.851480Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.20453","last_updated":"2025-09-06T03:33:17Z","snapshot_observed_at":"2026-08-23T07:55:38.311808Z","submitted_at":"2025-07-28T01:07:22Z","title":"Your Attention Matters: to Improve Model Robustness to Noise and Spurious Correlations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20453","snapshot_observed_at":"2026-08-03T11:22:14.762729Z","title":"Rohan Taori, Achal Dave, Vaishaal Shankar, Nicholas Carlini, Benjamin Recht, and Ludwig Schmidt","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.06891","last_updated":"2026-06-29T13:35:54Z","snapshot_observed_at":"2026-08-22T08:33:24.818590Z","submitted_at":"2026-01-11T12:31:55Z","title":"CLIMP: Contrastive Language-Image Mamba Pretraining","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T11:22:14.762729Z"},"links":{"cited_paper":"/paper/2507.20453","citing_paper":"/paper/2601.06891"},"observation_digest":"sha256:8c8f13dd50316d8b1479c4a968c7df6e7afbd4b7c99b61ba5ce5a0fded954b01","observation_id":"6c55fbb0-586e-4a8d-b505-a02be515a64a","resolution":{"observed_at":"2026-08-03T11:22:14.762729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20453","last_updated":"2025-09-06T03:33:17Z","snapshot_observed_at":"2026-08-23T07:55:38.311808Z","submitted_at":"2025-07-28T01:07:22Z","title":"Your Attention Matters: to Improve Model Robustness to Noise and Spurious Correlations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20453","snapshot_observed_at":"2026-08-01T17:31:49.632661Z","title":"Your attention matters: to improve model robustness to noise and spurious correlations.arXiv:2507.20453,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17624","last_updated":"2026-07-20T07:26:17Z","snapshot_observed_at":"2026-08-18T06:31:54.070932Z","submitted_at":"2026-07-20T07:26:17Z","title":"Can Transformers Really Do It All? On the Compatibility of Inductive Biases Across Tasks","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T17:31:49.632661Z"},"links":{"cited_paper":"/paper/2507.20453","citing_paper":"/paper/2607.17624"},"observation_digest":"sha256:c1e136902019b48f1e3a4e1b41eddc27ec51156e9d8c34acc2bbb9d1bde6ad31","observation_id":"55d62c7f-84ec-4740-825a-6bdaab62d682","resolution":{"observed_at":"2026-08-01T17:31:49.632661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20453","last_updated":"2025-09-06T03:33:17Z","snapshot_observed_at":"2026-08-23T07:55:38.311808Z","submitted_at":"2025-07-28T01:07:22Z","title":"Your Attention Matters: to Improve Model Robustness to Noise and Spurious Correlations","version":3},"cited_work":{"arxiv_id":"2507.20453","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.20453","snapshot_observed_at":"2026-08-11T00:31:24.851480Z","title":"Your Attention Matters: to Improve Model Robustness to Noise and Spurious Correlations","venue":"cs.LG","work_id":"21b50531-2f36-4f96-8f81-5b855501de72","year":2025},"citing_paper":{"arxiv_id":"2608.07681","last_updated":"2026-08-07T18:09:31Z","snapshot_observed_at":"2026-08-22T23:13:46.191757Z","submitted_at":"2026-08-07T18:09:31Z","title":"PhysAttNet: Enhancing Predictive Performance in Industrial and Astrophysical Time Series via Physics-Informed Attention","version":1},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-08-11T00:31:24.708173Z"},"links":{"cited_paper":"/paper/2507.20453","citing_paper":"/paper/2608.07681"},"observation_digest":"sha256:ffe115d4e344a45f2b631303b92d13d7be9fd48f5bacd37b0be99409db896315","observation_id":"6b08b1f9-958d-4f83-96a7-7d094f9ad5bb","resolution":{"observed_at":"2026-08-11T00:31:24.857384Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.20453/citation-record","integrity":"/paper/2507.20453/integrity","json":"/paper/2507.20453/citation-record.json","paper":"/paper/2507.20453"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:07.441503Z","title":"Flamingo: a visual language model for few-shot learning.Advances in neural information processing systems, 35:23716–23736, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20453","last_updated":"2025-09-06T03:33:17Z","snapshot_observed_at":"2026-08-23T07:55:38.311808Z","submitted_at":"2025-07-28T01:07:22Z","title":"Your Attention Matters: to Improve Model Robustness to Noise and Spurious Correlations","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:07.441503Z"},"links":{"citing_paper":"/paper/2507.20453"},"observation_digest":"sha256:3fa78b1f774e9f3b5ddf68257f6ac30aef1a12736ff019c87866133f64e70cb3","observation_id":"5870c6bf-742b-4fee-a443-1a95d21e4d52","resolution":{"observed_at":"2026-08-06T13:39:07.441503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:14.813991Z","title":"Understanding robustness of transformers for image classification","venue":null,"work_id":"7e51d62d-f49e-439b-b056-f1e7bec1cdcf","year":2021},"citing_paper":{"arxiv_id":"2507.20453","last_updated":"2025-09-06T03:33:17Z","snapshot_observed_at":"2026-08-23T07:55:38.311808Z","submitted_at":"2025-07-28T01:07:22Z","title":"Your Attention Matters: to Improve Model Robustness to Noise and Spurious Correlations","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:07.515077Z"},"links":{"citing_paper":"/paper/2507.20453"},"observation_digest":"sha256:b0cf3682ee49e067bbc7be356bcbe1906abe33e6618d4d64434eaa5625472a66","observation_id":"22a9e9b6-89f2-4f9b-8eba-bfb12d1bd8e1","resolution":{"observed_at":"2026-08-06T13:39:14.965696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:07.600611Z","title":"End-to-end object detection with transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.20453","last_updated":"2025-09-06T03:33:17Z","snapshot_observed_at":"2026-08-23T07:55:38.311808Z","submitted_at":"2025-07-28T01:07:22Z","title":"Your Attention Matters: to Improve Model Robustness to Noise and Spurious Correlations","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:07.600611Z"},"links":{"citing_paper":"/paper/2507.20453"},"observation_digest":"sha256:b25c3277e7bd214fd7085cefe31bab3ceb67925289d760b453f56fca1130fd25","observation_id":"0f3f48ad-df09-4c95-a872-7c1e59b22d4a","resolution":{"observed_at":"2026-08-06T13:39:07.600611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.14794","last_updated":"2022-11-19T12:45:21Z","snapshot_observed_at":"2026-08-12T04:58:34.201421Z","submitted_at":"2020-09-30T17:09:09Z","title":"Rethinking Attention with Performers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.14794","snapshot_observed_at":"2026-08-06T13:39:07.725621Z","title":"Rethinking attention with performers","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.20453","last_updated":"2025-09-06T03:33:17Z","snapshot_observed_at":"2026-08-23T07:55:38.311808Z","submitted_at":"2025-07-28T01:07:22Z","title":"Your Attention Matters: to Improve Model Robustness to Noise and Spurious Correlations","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:07.725621Z"},"links":{"cited_paper":"/paper/2009.14794","citing_paper":"/paper/2507.20453"},"observation_digest":"sha256:86dfd6098e6e59233944e0f54c148e24b1d523aacba116bf18c42aff70a42a3d","observation_id":"2882d72b-abbe-4bdc-a7db-d554fc2279aa","resolution":{"observed_at":"2026-08-06T13:39:07.725621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:07.839052Z","title":"Autoaugment: Learning augmentation strategies from data","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.20453","last_updated":"2025-09-06T03:33:17Z","snapshot_observed_at":"2026-08-23T07:55:38.311808Z","submitted_at":"2025-07-28T01:07:22Z","title":"Your Attention Matters: to Improve Model Robustness to Noise and Spurious Correlations","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:07.839052Z"},"links":{"citing_paper":"/paper/2507.20453"},"observation_digest":"sha256:c09d5be905ff9e1d3a2edfb2678580450d7b7dd3edda07005147990da8094e7e","observation_id":"9bd29eca-f9cb-4cc2-b7cb-120d481ac684","resolution":{"observed_at":"2026-08-06T13:39:07.839052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:07.904746Z","title":"Bert: Pre-training of deep bidi- rectional transformers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.20453","last_updated":"2025-09-06T03:33:17Z","snapshot_observed_at":"2026-08-23T07:55:38.311808Z","submitted_at":"2025-07-28T01:07:22Z","title":"Your Attention Matters: to Improve Model Robustness to Noise and Spurious Correlations","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:07.904746Z"},"links":{"citing_paper":"/paper/2507.20453"},"observation_digest":"sha256:1657c8f0333a6614396c45c81ce77b8245b1c2dd5cd2d7c48551e431a5b8bde0","observation_id":"4c832bd2-53c7-456c-85e3-c39bd04f6224","resolution":{"observed_at":"2026-08-06T13:39:07.904746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1708.04552","last_updated":"2017-11-29T14:51:40Z","snapshot_observed_at":"2026-08-13T11:54:46.030796Z","submitted_at":"2017-08-15T15:21:53Z","title":"Improved Regularization of Convolutional Neural Networks with Cutout","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.04552","snapshot_observed_at":"2026-08-06T13:39:08.033556Z","title":"Improved regularization of convolutional neural networks with cutout.arXiv preprint arXiv:1708.04552, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.20453","last_updated":"2025-09-06T03:33:17Z","snapshot_observed_at":"2026-08-23T07:55:38.311808Z","submitted_at":"2025-07-28T01:07:22Z","title":"Your Attention Matters: to Improve Model Robustness to Noise and Spurious Correlations","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:08.033556Z"},"links":{"cited_paper":"/paper/1708.04552","citing_paper":"/paper/2507.20453"},"observation_digest":"sha256:8859327db16a6099c12a88d3ae866e450d410f24056be002e72b7d62fa0aa77f","observation_id":"7edc3bca-a5e1-4e6b-8ae8-2835fddf658d","resolution":{"observed_at":"2026-08-06T13:39:08.033556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T13:39:08.207466Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale.arXiv preprint arXiv:2010.11929, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.20453","last_updated":"2025-09-06T03:33:17Z","snapshot_observed_at":"2026-08-23T07:55:38.311808Z","submitted_at":"2025-07-28T01:07:22Z","title":"Your Attention Matters: to Improve Model Robustness to Noise and Spurious Correlations","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:08.207466Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2507.20453"},"observation_digest":"sha256:1c11cf942fb1e9d574b2a592ea9dcd8b86bb745a7956644df8cfca5d9b5cbf70","observation_id":"3b24ecae-da8e-44fa-a01d-3f9abed2507c","resolution":{"observed_at":"2026-08-06T13:39:08.207466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:08.350999Z","title":"Imagenet-trained cnns are biased towards texture; increasing shape bias improves accuracy and robustness","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.20453","last_updated":"2025-09-06T03:33:17Z","snapshot_observed_at":"2026-08-23T07:55:38.311808Z","submitted_at":"2025-07-28T01:07:22Z","title":"Your Attention Matters: to Improve Model Robustness to Noise and Spurious Correlations","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:08.350999Z"},"links":{"citing_paper":"/paper/2507.20453"},"observation_digest":"sha256:2670dca414f0b1d762b3dac5fed282d64afc099578163f9a58f1daf0f43b2c05","observation_id":"e16ae978-1952-4651-ac2e-7c5851014a6d","resolution":{"observed_at":"2026-08-06T13:39:08.350999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-17T23:50:11.173365Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-06T13:39:08.440360Z","title":"Ast: Audio spectrogram transformer.arXiv preprint arXiv:2104.01778, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20453","last_updated":"2025-09-06T03:33:17Z","snapshot_observed_at":"2026-08-23T07:55:38.311808Z","submitted_at":"2025-07-28T01:07:22Z","title":"Your Attention Matters: to Improve Model Robustness to Noise and Spurious Correlations","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:08.440360Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2507.20453"},"observation_digest":"sha256:e7cd7cca8c736f83705de8ddff905a2c13760cc9f9a0f3434261d57486e937ab","observation_id":"8517328c-d79c-4fe0-ab3a-4c568edbdbc9","resolution":{"observed_at":"2026-08-06T13:39:08.440360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6572","last_updated":"2015-03-20T20:19:16Z","snapshot_observed_at":"2026-08-19T07:17:20.004918Z","submitted_at":"2014-12-20T01:17:12Z","title":"Explaining and Harnessing Adversarial Examples","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6572","snapshot_observed_at":"2026-08-06T13:39:08.572368Z","title":"Explaining and harnessing adversarial examples","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.20453","last_updated":"2025-09-06T03:33:17Z","snapshot_observed_at":"2026-08-23T07:55:38.311808Z","submitted_at":"2025-07-28T01:07:22Z","title":"Your Attention Matters: to Improve Model Robustness to Noise and Spurious Correlations","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:08.572368Z"},"links":{"cited_paper":"/paper/1412.6572","citing_paper":"/paper/2507.20453"},"observation_digest":"sha256:86033a315a29c22f60f72011119b20bd01765d4cb7945dc7c30227967e356240","observation_id":"7fd47f6c-1443-4dce-9fc5-14005e8b750a","resolution":{"observed_at":"2026-08-06T13:39:08.572368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:08.649221Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.20453","last_updated":"2025-09-06T03:33:17Z","snapshot_observed_at":"2026-08-23T07:55:38.311808Z","submitted_at":"2025-07-28T01:07:22Z","title":"Your Attention Matters: to Improve Model Robustness to Noise and Spurious Correlations","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:08.649221Z"},"links":{"citing_paper":"/paper/2507.20453"},"observation_digest":"sha256:7de4862f228956b38f32f0f5df0fd30b2139d6cdae49a09657aecf611842aa99","observation_id":"a5d92a85-4446-453a-99f4-beb937c84657","resolution":{"observed_at":"2026-08-06T13:39:08.649221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.12261","last_updated":"2019-03-28T20:56:37Z","snapshot_observed_at":"2026-08-15T10:34:34.836991Z","submitted_at":"2019-03-28T20:56:37Z","title":"Benchmarking Neural Network Robustness to Common Corruptions and Perturbations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.12261","snapshot_observed_at":"2026-08-06T13:39:08.726255Z","title":"Benchmarking neural network robustness to common corruptions and perturbations.arXiv preprint arXiv:1903.12261, 2019","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2507.20453","last_updated":"2025-09-06T03:33:17Z","snapshot_observed_at":"2026-08-23T07:55:38.311808Z","submitted_at":"2025-07-28T01:07:22Z","title":"Your Attention Matters: to Improve Model Robustness to Noise and Spurious Correlations","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:08.726255Z"},"links":{"cited_paper":"/paper/1903.12261","citing_paper":"/paper/2507.20453"},"observation_digest":"sha256:c2fb52626a6971f2df9f42a0d3b642d2ecc66cd3b59a1004ace0629f6ef9d7e3","observation_id":"40677a84-cce1-4580-b2ee-df15b1dbe1af","resolution":{"observed_at":"2026-08-06T13:39:08.726255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:14.546855Z","title":"Imagenette: A smaller subset of 10 easily classified classes from imagenet","venue":null,"work_id":"76859826-1625-4549-9a11-2ca984f5e931","year":2019},"citing_paper":{"arxiv_id":"2507.20453","last_updated":"2025-09-06T03:33:17Z","snapshot_observed_at":"2026-08-23T07:55:38.311808Z","submitted_at":"2025-07-28T01:07:22Z","title":"Your Attention Matters: to Improve Model Robustness to Noise and Spurious Correlations","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:08.816067Z"},"links":{"citing_paper":"/paper/2507.20453"},"observation_digest":"sha256:f0861f8b66f4d020f1db49b963e9a09b3c3dda34e7f5b8b91321bd70d2e03832","observation_id":"0e78be30-efab-4974-89d9-c45413ca3e58","resolution":{"observed_at":"2026-08-06T13:39:14.677106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:08.967669Z","title":"Batch normalization: Accelerating deep network training by reducing internal covariate shift","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.20453","last_updated":"2025-09-06T03:33:17Z","snapshot_observed_at":"2026-08-23T07:55:38.311808Z","submitted_at":"2025-07-28T01:07:22Z","title":"Your Attention Matters: to Improve Model Robustness to Noise and Spurious Correlations","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:08.967669Z"},"links":{"citing_paper":"/paper/2507.20453"},"observation_digest":"sha256:65cfa205266851c4adef0d5f0663f7a2198e7b19e5bde479978f9f46c52ca3fc","observation_id":"477624a4-e0b4-47ea-bfb1-3fe4620f2a6f","resolution":{"observed_at":"2026-08-06T13:39:08.967669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:09.045191Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.20453","last_updated":"2025-09-06T03:33:17Z","snapshot_observed_at":"2026-08-23T07:55:38.311808Z","submitted_at":"2025-07-28T01:07:22Z","title":"Your Attention Matters: to Improve Model Robustness to Noise and Spurious Correlations","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:09.045191Z"},"links":{"citing_paper":"/paper/2507.20453"},"observation_digest":"sha256:847ca090c59ddecef3ee13ab3b31038a9ccf276775444b56f9e802444b7a872f","observation_id":"506b581b-65f8-401f-85ac-ef834d2e0caa","resolution":{"observed_at":"2026-08-06T13:39:09.045191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:09.169731Z","title":"Vilt: Vision-and-language transformer without convolution or region supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20453","last_updated":"2025-09-06T03:33:17Z","snapshot_observed_at":"2026-08-23T07:55:38.311808Z","submitted_at":"2025-07-28T01:07:22Z","title":"Your Attention Matters: to Improve Model Robustness to Noise and Spurious Correlations","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:09.169731Z"},"links":{"citing_paper":"/paper/2507.20453"},"observation_digest":"sha256:f6792f24c77a55fd3d3459aa0586b71fb069aa16d2697a59980fb7f56f88fc2e","observation_id":"846dee64-4276-434e-a023-b7f9698855f2","resolution":{"observed_at":"2026-08-06T13:39:09.169731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:09.255703Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.20453","last_updated":"2025-09-06T03:33:17Z","snapshot_observed_at":"2026-08-23T07:55:38.311808Z","submitted_at":"2025-07-28T01:07:22Z","title":"Your Attention Matters: to Improve Model Robustness to Noise and Spurious Correlations","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:09.255703Z"},"links":{"citing_paper":"/paper/2507.20453"},"observation_digest":"sha256:73dd4afcbd2a3e3218d835f56dae4ca684748329f0484330edf39bf4e8194e77","observation_id":"160786ee-16c0-452e-a040-65e79d35b843","resolution":{"observed_at":"2026-08-06T13:39:09.255703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:14.234383Z","title":"Imagenet classification with deep convolutional neural networks","venue":null,"work_id":"c0ef6035-5669-4454-83ea-275e3e34851c","year":2012},"citing_paper":{"arxiv_id":"2507.20453","last_updated":"2025-09-06T03:33:17Z","snapshot_observed_at":"2026-08-23T07:55:38.311808Z","submitted_at":"2025-07-28T01:07:22Z","title":"Your Attention Matters: to Improve Model Robustness to Noise and Spurious Correlations","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:09.324084Z"},"links":{"citing_paper":"/paper/2507.20453"},"observation_digest":"sha256:4ae2294c5e83e1bdf6a4e56677c111ab22159ff8f7d7ac8bfa20f99ffd857e08","observation_id":"a45f5797-fc5a-4f97-b563-d9f4efdff127","resolution":{"observed_at":"2026-08-06T13:39:14.323587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:14.008600Z","title":"Doubly stochastic normalization of the gaussian kernel is robust to heteroskedastic noise.SIAM journal on mathematics of data science, 3(1):388–413, 2021","venue":null,"work_id":"91103cc8-6fe8-4caf-9e25-6158cf245d8a","year":2021},"citing_paper":{"arxiv_id":"2507.20453","last_updated":"2025-09-06T03:33:17Z","snapshot_observed_at":"2026-08-23T07:55:38.311808Z","submitted_at":"2025-07-28T01:07:22Z","title":"Your Attention Matters: to Improve Model Robustness to Noise and Spurious Correlations","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:09.469234Z"},"links":{"citing_paper":"/paper/2507.20453"},"observation_digest":"sha256:81ac23f2f08dc15dda5ee8d97af2ad534f1471dce0fe452d76bf785e5183b12f","observation_id":"d2290f4a-af96-4315-b66f-db674b25f533","resolution":{"observed_at":"2026-08-06T13:39:14.091118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:09.566945Z","title":"Gradient-based learning applied to document recognition.Proceedings of the IEEE, 86(11):2278–2324, 1998","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2507.20453","last_updated":"2025-09-06T03:33:17Z","snapshot_observed_at":"2026-08-23T07:55:38.311808Z","submitted_at":"2025-07-28T01:07:22Z","title":"Your Attention Matters: to Improve Model Robustness to Noise and Spurious Correlations","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:09.566945Z"},"links":{"citing_paper":"/paper/2507.20453"},"observation_digest":"sha256:fd673813ec2b3e20824ad68b334e6d0e9fc177def71d6d1a7e13211e55884c4e","observation_id":"d800f262-9164-4660-9d08-d8369c09c8e5","resolution":{"observed_at":"2026-08-06T13:39:09.566945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:09.646704Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20453","last_updated":"2025-09-06T03:33:17Z","snapshot_observed_at":"2026-08-23T07:55:38.311808Z","submitted_at":"2025-07-28T01:07:22Z","title":"Your Attention Matters: to Improve Model Robustness to Noise and Spurious Correlations","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:09.646704Z"},"links":{"citing_paper":"/paper/2507.20453"},"observation_digest":"sha256:11cc4023cc0f92604eba337a9af317ffdb23c45ae7cf240dff85f7ceaf192a8e","observation_id":"d842f138-7091-43e1-b584-b1662f41d283","resolution":{"observed_at":"2026-08-06T13:39:09.646704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.06083","last_updated":"2019-09-04T18:53:10Z","snapshot_observed_at":"2026-08-07T14:27:46.872660Z","submitted_at":"2017-06-19T17:53:11Z","title":"Towards Deep Learning Models Resistant to Adversarial Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.06083","snapshot_observed_at":"2026-08-06T13:39:09.777205Z","title":"Towards deep learning models resistant to adversarial attacks.arXiv preprint arXiv:1706.06083, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.20453","last_updated":"2025-09-06T03:33:17Z","snapshot_observed_at":"2026-08-23T07:55:38.311808Z","submitted_at":"2025-07-28T01:07:22Z","title":"Your Attention Matters: to Improve Model Robustness to Noise and Spurious Correlations","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:09.777205Z"},"links":{"cited_paper":"/paper/1706.06083","citing_paper":"/paper/2507.20453"},"observation_digest":"sha256:6408a4c4549ec448b0e95a8d7556a22b29998c430f023b5c0d28160acac6b110","observation_id":"6c878e9e-a404-448d-8fe3-7ef637b374f8","resolution":{"observed_at":"2026-08-06T13:39:09.777205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2409.18747","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:12.569923Z","title":"Cottention: Linear transformers with cosine attention","venue":null,"work_id":"a4944e0c-9cab-4eeb-8e7c-3143a56a2d9c","year":2024},"citing_paper":{"arxiv_id":"2507.20453","last_updated":"2025-09-06T03:33:17Z","snapshot_observed_at":"2026-08-23T07:55:38.311808Z","submitted_at":"2025-07-28T01:07:22Z","title":"Your Attention Matters: to Improve Model Robustness to Noise and Spurious Correlations","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:09.865025Z"},"links":{"citing_paper":"/paper/2507.20453"},"observation_digest":"sha256:6dba86d113380006d5410c15ef011cf2669c3d7ce44e03f0d624c716c481c318","observation_id":"338a7bd0-8533-48cc-b072-52b0782fa78e","resolution":{"observed_at":"2026-08-06T13:39:12.674747Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.03875","last_updated":"2020-10-29T06:17:11Z","snapshot_observed_at":"2026-08-19T12:48:43.997088Z","submitted_at":"2019-11-10T08:17:11Z","title":"Rethinking Self-Attention: Towards Interpretability in Neural Parsing","version":3},"cited_work":{"arxiv_id":"1911.03875","doi":null,"metadata_source":"pith","pith_arxiv_id":"1911.03875","snapshot_observed_at":"2026-08-06T13:39:12.234447Z","title":"Rethinking Self-Attention: Towards Interpretability in Neural Parsing","venue":"cs.CL","work_id":"6b3e32bc-c75f-48c2-ba8f-0ef469514482","year":2019},"citing_paper":{"arxiv_id":"2507.20453","last_updated":"2025-09-06T03:33:17Z","snapshot_observed_at":"2026-08-23T07:55:38.311808Z","submitted_at":"2025-07-28T01:07:22Z","title":"Your Attention Matters: to Improve Model Robustness to Noise and Spurious Correlations","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:09.973995Z"},"links":{"cited_paper":"/paper/1911.03875","citing_paper":"/paper/2507.20453"},"observation_digest":"sha256:7864aebc1231128f9b0f8d56fc59bbd933adfc08e00daa7b5037390deecd2708","observation_id":"17c4307d-a460-412f-bda6-6b8bf80c940e","resolution":{"observed_at":"2026-08-06T13:39:12.320656Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:10.085428Z","title":"Vision transformers are robust learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20453","last_updated":"2025-09-06T03:33:17Z","snapshot_observed_at":"2026-08-23T07:55:38.311808Z","submitted_at":"2025-07-28T01:07:22Z","title":"Your Attention Matters: to Improve Model Robustness to Noise and Spurious Correlations","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:10.085428Z"},"links":{"citing_paper":"/paper/2507.20453"},"observation_digest":"sha256:46a7c4cdd03433d406791c4241c8c998f62d7ffdde083cd3d6c4952aa3ec4ad8","observation_id":"83021d80-2f89-4118-9b5f-0cddb464e601","resolution":{"observed_at":"2026-08-06T13:39:10.085428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:10.190723Z","title":"Improving language understanding by generative pre-training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.20453","last_updated":"2025-09-06T03:33:17Z","snapshot_observed_at":"2026-08-23T07:55:38.311808Z","submitted_at":"2025-07-28T01:07:22Z","title":"Your Attention Matters: to Improve Model Robustness to Noise and Spurious Correlations","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:10.190723Z"},"links":{"citing_paper":"/paper/2507.20453"},"observation_digest":"sha256:a568254d7a44a8e4c38e646a00db943a8c654042d616959831bc53d1db28a0ef","observation_id":"fb055d8d-21a3-419a-84d6-859cd562eae6","resolution":{"observed_at":"2026-08-06T13:39:10.190723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:10.291889Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20453","last_updated":"2025-09-06T03:33:17Z","snapshot_observed_at":"2026-08-23T07:55:38.311808Z","submitted_at":"2025-07-28T01:07:22Z","title":"Your Attention Matters: to Improve Model Robustness to Noise and Spurious Correlations","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:10.291889Z"},"links":{"citing_paper":"/paper/2507.20453"},"observation_digest":"sha256:245606ac8e16cb09d213addcaf935d833d3680e9ca3048911d4039efe59fb163","observation_id":"63e5b590-c494-4205-96df-d5e168bdf421","resolution":{"observed_at":"2026-08-06T13:39:10.291889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04431","last_updated":"2025-01-22T01:18:51Z","snapshot_observed_at":"2026-08-16T13:20:40.886114Z","submitted_at":"2024-09-06T17:53:26Z","title":"Theory, Analysis, and Best Practices for Sigmoid Self-Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04431","snapshot_observed_at":"2026-08-06T13:39:10.426250Z","title":"Theory, analysis, and best practices for sigmoid self-attention.arXiv preprint arXiv:2409.04431, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20453","last_updated":"2025-09-06T03:33:17Z","snapshot_observed_at":"2026-08-23T07:55:38.311808Z","submitted_at":"2025-07-28T01:07:22Z","title":"Your Attention Matters: to Improve Model Robustness to Noise and Spurious Correlations","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:10.426250Z"},"links":{"cited_paper":"/paper/2409.04431","citing_paper":"/paper/2507.20453"},"observation_digest":"sha256:2a3577ad1c5b823900d81c1662e9bf1766583805e518f52d7f4e1cf080e79099","observation_id":"3b93fb8e-4c74-4dcb-aca6-d41795f98465","resolution":{"observed_at":"2026-08-06T13:39:10.426250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.06175","last_updated":"2022-11-11T10:04:29Z","snapshot_observed_at":"2026-08-14T09:46:32.787845Z","submitted_at":"2022-05-12T16:03:26Z","title":"A Generalist Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.06175","snapshot_observed_at":"2026-08-06T13:39:10.522584Z","title":"A generalist agent","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20453","last_updated":"2025-09-06T03:33:17Z","snapshot_observed_at":"2026-08-23T07:55:38.311808Z","submitted_at":"2025-07-28T01:07:22Z","title":"Your Attention Matters: to Improve Model Robustness to Noise and Spurious Correlations","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:10.522584Z"},"links":{"cited_paper":"/paper/2205.06175","citing_paper":"/paper/2507.20453"},"observation_digest":"sha256:5a0e1d37af9ab741a65c51516ec896e42a2a2feebf59b9211e9a246c9d88b332","observation_id":"1c0dedde-95e7-4240-995e-f60e99e48247","resolution":{"observed_at":"2026-08-06T13:39:10.522584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:13.698445Z","title":"Sinkformers: Transformers with doubly stochastic attention","venue":null,"work_id":"a19d3604-7c6b-496b-8c16-adc145bd5814","year":2022},"citing_paper":{"arxiv_id":"2507.20453","last_updated":"2025-09-06T03:33:17Z","snapshot_observed_at":"2026-08-23T07:55:38.311808Z","submitted_at":"2025-07-28T01:07:22Z","title":"Your Attention Matters: to Improve Model Robustness to Noise and Spurious Correlations","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:10.674647Z"},"links":{"citing_paper":"/paper/2507.20453"},"observation_digest":"sha256:1d2f169dc71f255c41efb1951c2403dfebd6d2df907006887d6d6f59f8c328d9","observation_id":"93f6a0de-7e0c-4a79-815b-c8d64170f2c3","resolution":{"observed_at":"2026-08-06T13:39:13.796855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-08-17T19:17:06.411141Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-06T13:39:11.028293Z","title":"Very deep convolutional networks for large-scale image recogni- tion.arXiv preprint arXiv:1409.1556, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.20453","last_updated":"2025-09-06T03:33:17Z","snapshot_observed_at":"2026-08-23T07:55:38.311808Z","submitted_at":"2025-07-28T01:07:22Z","title":"Your Attention Matters: to Improve Model Robustness to Noise and Spurious Correlations","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:11.028293Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/2507.20453"},"observation_digest":"sha256:309c2ffc84414d0eb10672b30b102db17cbe4ab18887988beef338a48d440794","observation_id":"a10c65a9-c1e8-49c2-acfb-b45946385079","resolution":{"observed_at":"2026-08-06T13:39:11.028293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:13.488408Z","title":"Dropout: a simple way to prevent neural networks from overfitting.The journal of machine learning research, 15(1): 1929–1958, 2014","venue":null,"work_id":"f4d29206-120c-4070-b2cf-3033fb0366dc","year":1929},"citing_paper":{"arxiv_id":"2507.20453","last_updated":"2025-09-06T03:33:17Z","snapshot_observed_at":"2026-08-23T07:55:38.311808Z","submitted_at":"2025-07-28T01:07:22Z","title":"Your Attention Matters: to Improve Model Robustness to Noise and Spurious Correlations","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:11.201379Z"},"links":{"citing_paper":"/paper/2507.20453"},"observation_digest":"sha256:a4d17985ab8b426885b000b5a0e80122cde969358c55ff9df9dac57f4f986c08","observation_id":"0775cff6-db90-4bcc-85b5-e8c23c85225d","resolution":{"observed_at":"2026-08-06T13:39:13.567812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:11.337832Z","title":"Going deeper with convolutions","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.20453","last_updated":"2025-09-06T03:33:17Z","snapshot_observed_at":"2026-08-23T07:55:38.311808Z","submitted_at":"2025-07-28T01:07:22Z","title":"Your Attention Matters: to Improve Model Robustness to Noise and Spurious Correlations","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:11.337832Z"},"links":{"citing_paper":"/paper/2507.20453"},"observation_digest":"sha256:51f96cdb6a34a3f49ecb72da399d21b6d525906df7212dad38297f8d02a642c5","observation_id":"1aae96fa-9a07-4f43-9be8-42ce4733c9e2","resolution":{"observed_at":"2026-08-06T13:39:11.337832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:11.420842Z","title":"Mean teachers are better role models: Weight-averaged consistency targets improve semi-supervised deep learning results.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.20453","last_updated":"2025-09-06T03:33:17Z","snapshot_observed_at":"2026-08-23T07:55:38.311808Z","submitted_at":"2025-07-28T01:07:22Z","title":"Your Attention Matters: to Improve Model Robustness to Noise and Spurious Correlations","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:11.420842Z"},"links":{"citing_paper":"/paper/2507.20453"},"observation_digest":"sha256:77fb8332a7f2f106e77acf913cf0c1b6a8af43b4c0999a190b4adfae1f23a26b","observation_id":"5cd4e59c-24fb-4e2c-a0fb-6e0998e46276","resolution":{"observed_at":"2026-08-06T13:39:11.420842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:11.508627Z","title":"Going deeper with image transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20453","last_updated":"2025-09-06T03:33:17Z","snapshot_observed_at":"2026-08-23T07:55:38.311808Z","submitted_at":"2025-07-28T01:07:22Z","title":"Your Attention Matters: to Improve Model Robustness to Noise and Spurious Correlations","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:11.508627Z"},"links":{"citing_paper":"/paper/2507.20453"},"observation_digest":"sha256:38880bfb52f6975575ef630a832ae6a3e8b2a5f4886f1bee3d0cddbc74845e18","observation_id":"f8afc304-6734-488c-93a5-9858e8529c69","resolution":{"observed_at":"2026-08-06T13:39:11.508627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:11.592745Z","title":"Attention is all you need.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.20453","last_updated":"2025-09-06T03:33:17Z","snapshot_observed_at":"2026-08-23T07:55:38.311808Z","submitted_at":"2025-07-28T01:07:22Z","title":"Your Attention Matters: to Improve Model Robustness to Noise and Spurious Correlations","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:11.592745Z"},"links":{"citing_paper":"/paper/2507.20453"},"observation_digest":"sha256:c6d028f45f165d0281f38d07853b284cb021d72dba5f10f8be4aeb1260f66c20","observation_id":"c002362e-e902-4d44-a217-e30dc6a985b5","resolution":{"observed_at":"2026-08-06T13:39:11.592745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04768","last_updated":"2020-06-14T08:15:54Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:37:52Z","title":"Linformer: Self-Attention with Linear Complexity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04768","snapshot_observed_at":"2026-08-06T13:39:11.691599Z","title":"Linformer: Self-attention with linear complexity.arXiv preprint arXiv:2006.04768, 2020","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.20453","last_updated":"2025-09-06T03:33:17Z","snapshot_observed_at":"2026-08-23T07:55:38.311808Z","submitted_at":"2025-07-28T01:07:22Z","title":"Your Attention Matters: to Improve Model Robustness to Noise and Spurious Correlations","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:11.691599Z"},"links":{"cited_paper":"/paper/2006.04768","citing_paper":"/paper/2507.20453"},"observation_digest":"sha256:45aeaf828b686ca127809ff7d5fce5ae36dbc6b145e6c6e6f3f4ad2b163a3cb9","observation_id":"8e0abeff-b491-4245-9253-cf4cb223b71e","resolution":{"observed_at":"2026-08-06T13:39:11.691599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:13.160897Z","title":"Xlnet: Generalized autoregressive pretraining for language understanding.Advances in neural information processing systems, 32, 2019","venue":null,"work_id":"efeabff5-e5ab-4179-8876-9cb6bb234b5d","year":2019},"citing_paper":{"arxiv_id":"2507.20453","last_updated":"2025-09-06T03:33:17Z","snapshot_observed_at":"2026-08-23T07:55:38.311808Z","submitted_at":"2025-07-28T01:07:22Z","title":"Your Attention Matters: to Improve Model Robustness to Noise and Spurious Correlations","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:11.771132Z"},"links":{"citing_paper":"/paper/2507.20453"},"observation_digest":"sha256:01bee003e38a49d7c71a2e4040bcc279be33e9b6733d19a20b80583c152b6299","observation_id":"531b80a2-f7b0-496f-83b6-a5eaf0c6387e","resolution":{"observed_at":"2026-08-06T13:39:13.289835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.09412","last_updated":"2018-04-27T21:39:25Z","snapshot_observed_at":"2026-08-08T10:28:19.597631Z","submitted_at":"2017-10-25T18:30:49Z","title":"mixup: Beyond Empirical Risk Minimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.09412","snapshot_observed_at":"2026-08-06T13:39:11.853587Z","title":"mixup: Beyond empirical risk minimization.arXiv preprint arXiv:1710.09412, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.20453","last_updated":"2025-09-06T03:33:17Z","snapshot_observed_at":"2026-08-23T07:55:38.311808Z","submitted_at":"2025-07-28T01:07:22Z","title":"Your Attention Matters: to Improve Model Robustness to Noise and Spurious Correlations","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:11.853587Z"},"links":{"cited_paper":"/paper/1710.09412","citing_paper":"/paper/2507.20453"},"observation_digest":"sha256:6996a72451fc27e6f2dee27b71e102d796399b73ff61803408f7d51f84d074ad","observation_id":"3a2d5546-4a36-4862-90a1-54095ba2982a","resolution":{"observed_at":"2026-08-06T13:39:11.853587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.20453","last_updated":"2025-09-06T03:33:17Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-23T07:55:38.311808Z","submitted_at":"2025-07-28T01:07:22Z","title":"Your Attention Matters: to Improve Model Robustness to Noise and Spurious Correlations"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":2,"verified_fuzzy":7},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 3 inbound Pith citation observations for arXiv:2507.20453."}