{"as_of":"2026-08-16T19:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ee2ce4da9a0ed872fb1441b69357b80791ec920569814863b527259440a33fa7","coverage":[{"denominator":295,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:22:07.681399Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.12084/citation-record","integrity":"/paper/2608.12084/integrity","json":"/paper/2608.12084/citation-record.json","paper":"/paper/2608.12084"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:22:07.314500Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.314500Z"},"links":{"citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:12e6c9d5c0380dead20a3a0196063f55541ab3cc97bc370b521bb595a9058901","observation_id":"e95a6b9a-17cc-49d9-82b0-1c641ccaabc7","resolution":{"observed_at":"2026-08-16T00:22:07.314500Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.12249","last_updated":"2021-01-28T19:40:50Z","snapshot_observed_at":"2026-08-16T18:49:14.769851Z","submitted_at":"2021-01-28T19:40:50Z","title":"A Survey of Complex-Valued Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.12249","snapshot_observed_at":"2026-08-16T00:22:07.318933Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.318933Z"},"links":{"cited_paper":"/paper/2101.12249","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:3837bce980c0ff82633fb7f16878403ce837779062ec44eea18c512606594510","observation_id":"de5f47a7-eea7-466e-8016-9e3dd33db0dd","resolution":{"observed_at":"2026-08-16T00:22:07.318933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:22:07.323182Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.323182Z"},"links":{"citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:8487b4d3488b9f0b0830001bfb909644beb5c241672fb6a53791765507eeeb18","observation_id":"e3399ca0-97d1-41f7-ba2b-da196b28a08c","resolution":{"observed_at":"2026-08-16T00:22:07.323182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08222","last_updated":"2022-06-16T14:46:10Z","snapshot_observed_at":"2026-08-16T17:07:26.412891Z","submitted_at":"2022-06-16T14:46:10Z","title":"Adapting Self-Supervised Vision Transformers by Probing Attention-Conditioned Masking Consistency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08222","snapshot_observed_at":"2026-08-16T00:22:07.327057Z","title":"Adapting","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.327057Z"},"links":{"cited_paper":"/paper/2206.08222","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:255147662f3be82aa266e5b85f5407aba3ecc04b4d0d92d2ebbbcc2ff01907d1","observation_id":"cb13eb2e-afa0-487e-8700-ca39ebbaefd4","resolution":{"observed_at":"2026-08-16T00:22:07.327057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.13100","last_updated":"2022-07-06T09:33:16Z","snapshot_observed_at":"2026-08-16T17:24:45.006829Z","submitted_at":"2022-01-31T10:23:23Z","title":"Adversarial Masking for Self-Supervised Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.13100","snapshot_observed_at":"2026-08-16T00:22:07.330927Z","title":"and Torr, Philip H","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.330927Z"},"links":{"cited_paper":"/paper/2201.13100","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:9657cac2722ee7232a497fabc81585e2ad6d1619a2f005e96abd244a10e7335a","observation_id":"832e4d17-8733-48ba-abe1-1370092d545c","resolution":{"observed_at":"2026-08-16T00:22:07.330927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.14103","last_updated":"2021-09-21T18:04:55Z","snapshot_observed_at":"2026-08-16T18:21:21.019790Z","submitted_at":"2021-05-28T20:45:30Z","title":"An Attention Free Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.14103","snapshot_observed_at":"2026-08-16T00:22:07.335007Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.335007Z"},"links":{"cited_paper":"/paper/2105.14103","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:6555e798f7c07f55f5365ccf9245d5c1281c6206f1f32ffa850535af9ffea26e","observation_id":"c22d5ee6-72ee-402f-9d59-62821b619fae","resolution":{"observed_at":"2026-08-16T00:22:07.335007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:22:07.339021Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.339021Z"},"links":{"citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:3169b30f608a36e383cdc8d8c0679be58dfc06dc845bd08a9b368b47581f6bc2","observation_id":"e80baf6d-b31a-44c7-b200-a6a050df2ac1","resolution":{"observed_at":"2026-08-16T00:22:07.339021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01580","last_updated":"2022-05-03T15:54:44Z","snapshot_observed_at":"2026-08-16T17:02:52.870834Z","submitted_at":"2022-05-03T15:54:44Z","title":"Better plain ViT baselines for ImageNet-1k","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01580","snapshot_observed_at":"2026-08-16T00:22:07.342586Z","title":"Better Plain","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.342586Z"},"links":{"cited_paper":"/paper/2205.01580","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:b2e61bc6a787f3c32789468195fc4221c74dd37caa9ddc02a8cff98ae37dd0ea","observation_id":"89bede07-e8b2-4c62-8252-3ab3210c3429","resolution":{"observed_at":"2026-08-16T00:22:07.342586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:22:07.346746Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.346746Z"},"links":{"citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:c7883cb9a8cf1ec3186719e36d93df63937e14aa3604d0ffb413c51d969ea6b9","observation_id":"c321b4fb-97f7-4ad1-96a9-44d87aa3ab0a","resolution":{"observed_at":"2026-08-16T00:22:07.346746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10760","last_updated":"2023-04-12T17:33:41Z","snapshot_observed_at":"2026-08-16T16:58:39.606052Z","submitted_at":"2022-05-22T06:22:27Z","title":"CNNs Avoid Curse of Dimensionality by Learning on Patches","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.10760","snapshot_observed_at":"2026-08-16T00:22:07.350391Z","title":"and Chandrasekaran, Shivkumar , year = 2022, month = jun, number =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.350391Z"},"links":{"cited_paper":"/paper/2205.10760","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:c2460b5f1cf6778d3c44bdba0925c1818bf1d72bb0775958a25ddb16cfcb179e","observation_id":"ad02696a-20f6-4d1c-b82a-c5a7138f8d7a","resolution":{"observed_at":"2026-08-16T00:22:07.350391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04803","last_updated":"2021-09-15T06:05:13Z","snapshot_observed_at":"2026-08-16T18:18:32.351508Z","submitted_at":"2021-06-09T04:35:31Z","title":"CoAtNet: Marrying Convolution and Attention for All Data Sizes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04803","snapshot_observed_at":"2026-08-16T00:22:07.354189Z","title":"and Tan, Mingxing , year = 2021, month = sep, number =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.354189Z"},"links":{"cited_paper":"/paper/2106.04803","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:a5fe1f94cf4b06a14d1fd3679a45b836fd7b879232fbdcbd475af8b1dcb43f27","observation_id":"f95b0388-a09d-4fd7-8669-6a31f40eb729","resolution":{"observed_at":"2026-08-16T00:22:07.354189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.03892","last_updated":"2022-05-19T16:28:37Z","snapshot_observed_at":"2026-08-16T17:01:48.716400Z","submitted_at":"2022-05-08T15:12:19Z","title":"ConvMAE: Masked Convolution Meets Masked Autoencoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.03892","snapshot_observed_at":"2026-08-16T00:22:07.357901Z","title":"arXiv , langid =:2205.03892 , primaryclass =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.357901Z"},"links":{"cited_paper":"/paper/2205.03892","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:277a82916613df5b78bf75092bb959d9c2e5f301abbf3e06b605e0d4de1d7167","observation_id":"fea9c5c5-67c6-48a8-a711-94271ac71974","resolution":{"observed_at":"2026-08-16T00:22:07.357901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03555","last_updated":"2022-10-25T20:27:17Z","snapshot_observed_at":"2026-08-16T17:22:58.576201Z","submitted_at":"2022-02-07T22:52:11Z","title":"data2vec: A General Framework for Self-supervised Learning in Speech, Vision and Language","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.03555","snapshot_observed_at":"2026-08-16T00:22:07.361774Z","title":"Data2vec:","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.361774Z"},"links":{"cited_paper":"/paper/2202.03555","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:aaa1d1f4ae5899d6a191fe987b9639078f92339b9bcc46cfc65b04bdaee40aa0","observation_id":"e097292c-ad4a-4674-9d9f-dd30111ae547","resolution":{"observed_at":"2026-08-16T00:22:07.361774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:22:07.365628Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.365628Z"},"links":{"citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:caa3faab445b053d9e1d0012627a298e30576e07439dc2acd7a5a3d3d1858ed6","observation_id":"f9347a67-40c9-4d5d-81c1-2cac2a44db21","resolution":{"observed_at":"2026-08-16T00:22:07.365628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:22:07.369502Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.369502Z"},"links":{"citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:463feb230eca00089e05d912fe70c199794282153e2db350a0527539115330b0","observation_id":"083153b5-b9da-4ef0-a998-2aceb2b1637a","resolution":{"observed_at":"2026-08-16T00:22:07.369502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.00386","last_updated":"2022-06-01T10:39:12Z","snapshot_observed_at":"2026-08-16T16:56:03.236010Z","submitted_at":"2022-06-01T10:39:12Z","title":"DiVAE: Photorealistic Images Synthesis with Denoising Diffusion Decoder","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.00386","snapshot_observed_at":"2026-08-16T00:22:07.373159Z","title":"arXiv , langid =:2206.00386 , primaryclass =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.373159Z"},"links":{"cited_paper":"/paper/2206.00386","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:e30c8d4b813e98f1863a5156ee822e4a9fcad8aebadb39735379d5ee8b5d55ab","observation_id":"48245ccb-ce80-4e3e-a94c-047eff2f4c39","resolution":{"observed_at":"2026-08-16T00:22:07.373159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:22:07.376832Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.376832Z"},"links":{"citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:0d8afc0edf2eb1c1d6ca15cba4ce960da69dba318bd24893f129e2832e54f6d9","observation_id":"f00026f8-75cc-4a4b-bb45-6a3ffb3d8610","resolution":{"observed_at":"2026-08-16T00:22:07.376832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.00790","last_updated":"2025-03-22T21:25:12Z","snapshot_observed_at":"2026-08-16T16:55:52.798544Z","submitted_at":"2022-06-01T22:46:34Z","title":"Efficient Self-supervised Vision Pretraining with Local Masked Reconstruction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.00790","snapshot_observed_at":"2026-08-16T00:22:07.380446Z","title":"Efficient","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.380446Z"},"links":{"cited_paper":"/paper/2206.00790","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:5461275942254fbd8331d81677831846677b4df850e283c9b4aa4f214678547f","observation_id":"b9cce0e6-7a71-46fa-b473-aca06af98f69","resolution":{"observed_at":"2026-08-16T00:22:07.380446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:22:07.383703Z","title":"Efficient","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.383703Z"},"links":{"citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:029c259018ab67d8be683d7420b90ec800999b36cd41555d199e0792b4f8fc93","observation_id":"7d40fa24-711f-4efb-b659-1841b60451da","resolution":{"observed_at":"2026-08-16T00:22:07.383703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.01191","last_updated":"2022-10-11T03:06:16Z","snapshot_observed_at":"2026-08-16T16:55:41.591812Z","submitted_at":"2022-06-02T17:51:03Z","title":"EfficientFormer: Vision Transformers at MobileNet Speed","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.01191","snapshot_observed_at":"2026-08-16T00:22:07.386967Z","title":"arXiv , langid =:2206.01191 , primaryclass =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.386967Z"},"links":{"cited_paper":"/paper/2206.01191","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:9f7cdb4d6e2630a10c2d2106753c96660bd02f3135e9e91d76bec3e1ec8a97c9","observation_id":"ef4e8273-db4d-41ed-8620-c343a96dc717","resolution":{"observed_at":"2026-08-16T00:22:07.386967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.08924","last_updated":"2023-05-17T21:17:29Z","snapshot_observed_at":"2026-08-16T18:09:04.515554Z","submitted_at":"2021-07-19T14:37:57Z","title":"Epistemic Neural Networks","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.08924","snapshot_observed_at":"2026-08-16T00:22:07.390344Z","title":"Epistemic","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.390344Z"},"links":{"cited_paper":"/paper/2107.08924","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:89d1f976ff8e9179710fe4e82dd8f98abf8129062ddb884daac90fdb1e6853d5","observation_id":"5be3dc6b-0803-4824-90ca-54cee956ff0a","resolution":{"observed_at":"2026-08-16T00:22:07.390344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.00244","last_updated":"2022-06-01T06:00:13Z","snapshot_observed_at":"2026-08-16T16:56:07.255227Z","submitted_at":"2022-06-01T06:00:13Z","title":"Fair Comparison between Efficient Attentions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.00244","snapshot_observed_at":"2026-08-16T00:22:07.393669Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.393669Z"},"links":{"cited_paper":"/paper/2206.00244","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:aa3e7c950f4721f9a806183f1f98135f8f62234b6a653ec04cc76fa5e1c3a8a4","observation_id":"efb86f50-f0c7-42d2-a2af-d0f84da01446","resolution":{"observed_at":"2026-08-16T00:22:07.393669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.09959","last_updated":"2023-06-06T08:17:18Z","snapshot_observed_at":"2026-08-16T16:51:40.858640Z","submitted_at":"2022-06-20T18:42:44Z","title":"Global Context Vision Transformers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.09959","snapshot_observed_at":"2026-08-16T00:22:07.397520Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.397520Z"},"links":{"cited_paper":"/paper/2206.09959","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:3a5132853e0c7ba489729e782607a8102ca82f5fd6a49df075df85c39939d90d","observation_id":"5ba3e4aa-10b7-44c0-84d6-0750a8b7966e","resolution":{"observed_at":"2026-08-16T00:22:07.397520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.02177","last_updated":"2022-01-06T18:43:37Z","snapshot_observed_at":"2026-08-16T17:48:47.771397Z","submitted_at":"2022-01-06T18:43:37Z","title":"Grokking: Generalization Beyond Overfitting on Small Algorithmic Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.02177","snapshot_observed_at":"2026-08-16T00:22:07.401356Z","title":"Grokking:","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.401356Z"},"links":{"cited_paper":"/paper/2201.02177","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:4a2bc14c386a80cfc66b942bceaf6d8102a55a1b1b8a2cb240aada9e512726a5","observation_id":"33266d0d-c6d2-4362-a54e-9ba1bb75d360","resolution":{"observed_at":"2026-08-16T00:22:07.401356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:22:07.404982Z","title":"How to Train Your","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.404982Z"},"links":{"citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:7689680e81823a3b62d1ad485e8d53cead12e3f3e5766972ec273b7686b7533c","observation_id":"a4ae21cb-a8c5-431a-836d-9e16fb8d578c","resolution":{"observed_at":"2026-08-16T00:22:07.404982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.16007","last_updated":"2023-02-08T07:12:51Z","snapshot_observed_at":"2026-08-16T16:56:14.026456Z","submitted_at":"2022-05-31T17:59:53Z","title":"Improved Vector Quantized Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.16007","snapshot_observed_at":"2026-08-16T00:22:07.408548Z","title":"Improved","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.408548Z"},"links":{"cited_paper":"/paper/2205.16007","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:da45439044bdc70fef96ff6b1aca2b20d44a919f6062d2f727cb75a95b2d647f","observation_id":"cc47cae7-b909-41ec-a57e-8ab0a1d1301a","resolution":{"observed_at":"2026-08-16T00:22:07.408548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15508","last_updated":"2022-03-25T06:12:58Z","snapshot_observed_at":"2026-08-16T17:11:54.483744Z","submitted_at":"2022-03-25T06:12:58Z","title":"Improving Contrastive Learning with Model Augmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15508","snapshot_observed_at":"2026-08-16T00:22:07.412592Z","title":"and Xiong, Caiming , year = 2022, month = mar, number =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.412592Z"},"links":{"cited_paper":"/paper/2203.15508","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:43abd178595627ab5350b90e504147412b65c5d3cd1f3092cf83a4d8597c40a8","observation_id":"47cb1655-e47c-48eb-b141-1c02e259e18f","resolution":{"observed_at":"2026-08-16T00:22:07.412592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.15369","last_updated":"2023-03-10T10:22:17Z","snapshot_observed_at":"2026-08-16T16:49:11.468725Z","submitted_at":"2022-06-30T15:43:51Z","title":"No Reason for No Supervision: Improved Generalization in Supervised Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.15369","snapshot_observed_at":"2026-08-16T00:22:07.416764Z","title":"Improving the","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.416764Z"},"links":{"cited_paper":"/paper/2206.15369","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:181bfa2e043ecff8ae860ceb031b2ff39fbe91277454748419d69fc7c4358550","observation_id":"d7475b78-6e4c-479f-8594-d623188df8c4","resolution":{"observed_at":"2026-08-16T00:22:07.416764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10936","last_updated":"2022-06-22T09:27:41Z","snapshot_observed_at":"2026-08-16T16:51:14.811128Z","submitted_at":"2022-06-22T09:27:41Z","title":"Information Geometry of Dropout Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10936","snapshot_observed_at":"2026-08-16T00:22:07.420660Z","title":"Information","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.420660Z"},"links":{"cited_paper":"/paper/2206.10936","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:19de0b1df962bfba0cd8266d29a2879fe76fbf05b14733f9b61b3101fb40593a","observation_id":"73ce39bd-26d2-4c8f-add6-5c1228193f7d","resolution":{"observed_at":"2026-08-16T00:22:07.420660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.08239","last_updated":"2022-02-10T16:30:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-20T15:44:37Z","title":"LaMDA: Language Models for Dialog Applications","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.08239","snapshot_observed_at":"2026-08-16T00:22:07.424305Z","title":"arXiv , langid =:2201.08239 , primaryclass =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.424305Z"},"links":{"cited_paper":"/paper/2201.08239","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:c578085dd3dd285f55ce7ec3ad766ab6f16b93dfa0a4e3d8a9dd0f44b116ce81","observation_id":"ba9e9012-743b-4179-8406-79232cc8807a","resolution":{"observed_at":"2026-08-16T00:22:07.424305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.11894","last_updated":"2022-08-06T10:09:47Z","snapshot_observed_at":"2026-08-16T16:50:48.383558Z","submitted_at":"2022-06-23T17:59:33Z","title":"MaskViT: Masked Visual Pre-Training for Video Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.11894","snapshot_observed_at":"2026-08-16T00:22:07.428242Z","title":"arXiv , langid =:2206.11894 , primaryclass =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.428242Z"},"links":{"cited_paper":"/paper/2206.11894","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:a3bb54225f5117f93e608882f40a10a4d2c0fef034fc4555aae7698372ffc400","observation_id":"565007b6-7a68-4824-b6dc-87feefde53e1","resolution":{"observed_at":"2026-08-16T00:22:07.428242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04041","last_updated":"2023-04-11T06:11:14Z","snapshot_observed_at":"2026-08-16T16:54:23.685015Z","submitted_at":"2022-06-08T17:55:28Z","title":"Neural Collapse: A Review on Modelling Principles and Generalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04041","snapshot_observed_at":"2026-08-16T00:22:07.431949Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.431949Z"},"links":{"cited_paper":"/paper/2206.04041","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:07a12a5917a43caa5787a4cd9eb6144ce8761185c63307b061445d1ba21b1080","observation_id":"eaa26e45-5c23-4d2e-a206-9cac8d5c9913","resolution":{"observed_at":"2026-08-16T00:22:07.431949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.11267","last_updated":"2023-12-21T19:00:00Z","snapshot_observed_at":"2026-08-16T16:51:06.113656Z","submitted_at":"2022-06-22T18:00:00Z","title":"Neural Implicit Manifold Learning for Topology-Aware Density Estimation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.11267","snapshot_observed_at":"2026-08-16T00:22:07.435885Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.435885Z"},"links":{"cited_paper":"/paper/2206.11267","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:8472b62f1314ba3bbe21800831aefea11831f67b99648c4e5735f956dd90ed70","observation_id":"104a2a09-2a06-48df-9c85-42749f3bd1c0","resolution":{"observed_at":"2026-08-16T00:22:07.435885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.10000","last_updated":"2022-01-24T23:13:37Z","snapshot_observed_at":"2026-08-16T17:26:15.668046Z","submitted_at":"2022-01-24T23:13:37Z","title":"Neural Manifold Clustering and Embedding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.10000","snapshot_observed_at":"2026-08-16T00:22:07.439494Z","title":", year = 2022, month = jan, number =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.439494Z"},"links":{"cited_paper":"/paper/2201.10000","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:9e77064329522da583f060fa54e9a12eec6b288f2ae05d2e39e46e9003d181da","observation_id":"34e83012-42b6-4e47-b5ab-9bddc859a020","resolution":{"observed_at":"2026-08-16T00:22:07.439494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.02435","last_updated":"2022-02-04T23:32:29Z","snapshot_observed_at":"2026-08-16T17:23:29.126004Z","submitted_at":"2022-02-04T23:32:29Z","title":"On Neural Differential Equations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.02435","snapshot_observed_at":"2026-08-16T00:22:07.443252Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.443252Z"},"links":{"cited_paper":"/paper/2202.02435","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:b884363b479e8b35ad39313e02aa44d5895982662b9bd4228733cfdd85d09ae7","observation_id":"bdff1898-8f68-44dd-8cda-82f419808660","resolution":{"observed_at":"2026-08-16T00:22:07.443252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10654","last_updated":"2023-05-23T21:04:12Z","snapshot_observed_at":"2026-08-16T16:51:22.914056Z","submitted_at":"2022-06-21T18:06:24Z","title":"On the Maximum Hessian Eigenvalue and Generalization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10654","snapshot_observed_at":"2026-08-16T00:22:07.447148Z","title":", year = 2022, month = jun, number =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.447148Z"},"links":{"cited_paper":"/paper/2206.10654","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:80e3dfc0d54fcbada069aa22b4e37a2077ffe7443f50d239b1d7206f40b4916f","observation_id":"bb165fbf-2ecf-4b8a-9dd5-cff54bc088a0","resolution":{"observed_at":"2026-08-16T00:22:07.447148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.01547","last_updated":"2019-11-25T13:02:04Z","snapshot_observed_at":"2026-07-06T08:34:41.399203Z","submitted_at":"2019-11-05T00:31:38Z","title":"On the Measure of Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.01547","snapshot_observed_at":"2026-08-16T00:22:07.451002Z","title":null,"venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.451002Z"},"links":{"cited_paper":"/paper/1911.01547","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:f27fda5b05f082486e55d160abbd2e29746d49378dedd92884b6fc0bae4d07f2","observation_id":"772018ed-5b5b-439f-8370-6a8464832ca9","resolution":{"observed_at":"2026-08-16T00:22:07.451002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:22:07.454892Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.454892Z"},"links":{"citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:86847ea6a40e4957d1f2f9499df22e83200e791bb9233ad705190dcf88182b9a","observation_id":"2cce39e1-518e-4caa-b596-f2cc5743db36","resolution":{"observed_at":"2026-08-16T00:22:07.454892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11487","last_updated":"2022-05-23T17:42:53Z","snapshot_observed_at":"2026-08-12T12:48:35.419134Z","submitted_at":"2022-05-23T17:42:53Z","title":"Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.11487","snapshot_observed_at":"2026-08-16T00:22:07.458645Z","title":"Sara and Lopes, Rapha Gontijo and Salimans, Tim and Ho, Jonathan and Fleet, David J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.458645Z"},"links":{"cited_paper":"/paper/2205.11487","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:314a9155e4aecbe20f28c981b77669088e886133d5e6049652d906aa66dc3741","observation_id":"0e66b12e-91dc-4400-bed5-121b6f8ddb1c","resolution":{"observed_at":"2026-08-16T00:22:07.458645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.11167","last_updated":"2022-06-11T13:42:27Z","snapshot_observed_at":"2026-08-16T17:05:02.246492Z","submitted_at":"2022-04-24T02:46:43Z","title":"RelViT: Concept-guided Vision Transformer for Visual Relational Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.11167","snapshot_observed_at":"2026-08-16T00:22:07.462697Z","title":"arXiv , langid =:2204.11167 , primaryclass =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.462697Z"},"links":{"cited_paper":"/paper/2204.11167","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:4298b2f698818265e222cec1834d919c3eb6241e4c053b38fa529966a2aaa834","observation_id":"0368450f-bcaa-40d2-bf81-f431815fc837","resolution":{"observed_at":"2026-08-16T00:22:07.462697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:22:07.466342Z","title":"Revitalizing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.466342Z"},"links":{"citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:a67b748fb9b9a7a5b008b7e1acf2fc5aaecdcf09931626d361cf88541b31f883","observation_id":"dc6e796f-0c51-40a7-8346-1f9ce19c50d7","resolution":{"observed_at":"2026-08-16T00:22:07.466342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.09723","last_updated":"2022-07-03T19:28:10Z","snapshot_observed_at":"2026-08-16T16:59:06.583085Z","submitted_at":"2022-05-19T17:34:18Z","title":"Robust and Efficient Medical Imaging with Self-Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.09723","snapshot_observed_at":"2026-08-16T00:22:07.469366Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.469366Z"},"links":{"cited_paper":"/paper/2205.09723","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:b5a239ef137b848657640498affa37cc903aea3f96025cc65762a9c8596a4627","observation_id":"4b8e3323-1463-4617-a701-2b063fce41a5","resolution":{"observed_at":"2026-08-16T00:22:07.469366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-08-14T02:29:38.306439Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-16T00:22:07.472917Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.472917Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:262a504b9b70b3e0b445de9e906925035231f2e1e4f00cd1cae39476dc4edd2b","observation_id":"c1599fb2-4196-447b-842f-b4e0cf52b873","resolution":{"observed_at":"2026-08-16T00:22:07.472917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09121","last_updated":"2021-06-16T20:50:59Z","snapshot_observed_at":"2026-08-16T18:16:34.344763Z","submitted_at":"2021-06-16T20:50:59Z","title":"Scaling-up Diverse Orthogonal Convolutional Networks with a Paraunitary Framework","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09121","snapshot_observed_at":"2026-08-16T00:22:07.475878Z","title":"Scaling-up","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.475878Z"},"links":{"cited_paper":"/paper/2106.09121","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:323e7907da9e8b8a6acb18045003806eafd5b526ca02b309b97f7d506b21400f","observation_id":"cca073a2-f13a-40a0-8650-f14772aa3c8f","resolution":{"observed_at":"2026-08-16T00:22:07.475878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:22:07.478954Z","title":"Self-Supervised","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.478954Z"},"links":{"citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:51960d98c2e920b15a73028dc875c1b747559dc152275f45b815304ba6484704","observation_id":"4713158c-4ae4-4fe6-9801-f722fd306f8a","resolution":{"observed_at":"2026-08-16T00:22:07.478954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15173","last_updated":"2022-06-07T15:42:14Z","snapshot_observed_at":"2026-08-16T16:56:37.412589Z","submitted_at":"2022-05-30T15:25:37Z","title":"Self-Supervised Pre-training of Vision Transformers for Dense Prediction Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15173","snapshot_observed_at":"2026-08-16T00:22:07.482232Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.482232Z"},"links":{"cited_paper":"/paper/2205.15173","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:465eb1ce008885464edd3805932299692942e76f8ef3965eddbde3c0cb936893","observation_id":"008ca386-7a3f-4fa1-8fb6-2f3dc0c85a85","resolution":{"observed_at":"2026-08-16T00:22:07.482232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.03602","last_updated":"2022-12-26T19:42:50Z","snapshot_observed_at":"2026-08-16T18:33:04.951521Z","submitted_at":"2021-04-08T08:34:04Z","title":"SiT: Self-supervised vIsion Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.03602","snapshot_observed_at":"2026-08-16T00:22:07.487328Z","title":"arXiv , langid =:2104.03602 , primaryclass =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.487328Z"},"links":{"cited_paper":"/paper/2104.03602","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:17630c01d7cc651319f9036740d8fe5d33f22c960b03c141dbd4fc699cfc5c18","observation_id":"18301d1a-e6fc-4454-810f-66927207702d","resolution":{"observed_at":"2026-08-16T00:22:07.487328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.03475","last_updated":"2022-05-12T05:44:38Z","snapshot_observed_at":"2026-08-16T17:08:33.597513Z","submitted_at":"2022-04-07T14:43:58Z","title":"Solving ImageNet: a Unified Scheme for Training any Backbone to Top Results","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.03475","snapshot_observed_at":"2026-08-16T00:22:07.490995Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.490995Z"},"links":{"cited_paper":"/paper/2204.03475","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:5a4c74c2fc73cec2966c7999ed52f9695834f71e762b46daaa67e0469a374044","observation_id":"a666cacb-7557-4bc1-b39c-8b22eac796ff","resolution":{"observed_at":"2026-08-16T00:22:07.490995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08514","last_updated":"2022-02-17T08:37:50Z","snapshot_observed_at":"2026-08-16T17:20:38.591240Z","submitted_at":"2022-02-17T08:37:50Z","title":"Survey on Self-supervised Representation Learning Using Image Transformations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08514","snapshot_observed_at":"2026-08-16T00:22:07.494621Z","title":"Survey on","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.494621Z"},"links":{"cited_paper":"/paper/2202.08514","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:1d83160046e3f6aed26c3c6286c1667fb002d470e0330166f25055c72a33b948","observation_id":"2bd53122-7499-4e72-8352-1c9d1089c6d6","resolution":{"observed_at":"2026-08-16T00:22:07.494621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-16T17:16:25.053180Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-16T00:22:07.498354Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.498354Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:37cbb2b44972a5c58a7bdae9752031a614a9f595f400bbac9ebc1216068cb5ca","observation_id":"5f8bddf1-f722-4f11-afe2-4948ed620294","resolution":{"observed_at":"2026-08-16T00:22:07.498354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.11011","last_updated":"2022-03-03T15:43:20Z","snapshot_observed_at":"2026-08-16T18:43:55.638049Z","submitted_at":"2021-02-22T14:09:20Z","title":"The Uncanny Similarity of Recurrence and Depth","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.11011","snapshot_observed_at":"2026-08-16T00:22:07.501985Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.501985Z"},"links":{"cited_paper":"/paper/2102.11011","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:4a24e9601d1915e9806748e1ae58ca1cd0f8f92d654e7d5252221bbe9fd4f25e","observation_id":"39a90354-165f-46c2-8437-d1733b2f3707","resolution":{"observed_at":"2026-08-16T00:22:07.501985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10698","last_updated":"2022-06-23T17:36:11Z","snapshot_observed_at":"2026-08-16T16:51:21.871312Z","submitted_at":"2022-06-21T19:44:01Z","title":"TiCo: Transformation Invariance and Covariance Contrast for Self-Supervised Visual Representation Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10698","snapshot_observed_at":"2026-08-16T00:22:07.505578Z","title":"and Karakulak, Serkan and Sobol, Vlad and Canziani, Alfredo and LeCun, Yann , year = 2022, month = jun, number =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.505578Z"},"links":{"cited_paper":"/paper/2206.10698","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:55c6f456d1ad4431249946366d9af814fe0eeef700941bfd6d6a7a3054d070ef","observation_id":"a7027d8a-28df-42d5-9108-fc7e745e7697","resolution":{"observed_at":"2026-08-16T00:22:07.505578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.12877","last_updated":"2021-01-15T15:52:50Z","snapshot_observed_at":"2026-08-16T18:56:20.052364Z","submitted_at":"2020-12-23T18:42:10Z","title":"Training data-efficient image transformers & distillation through attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.12877","snapshot_observed_at":"2026-08-16T00:22:07.509212Z","title":"arXiv , langid =:2012.12877 , primaryclass =","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.509212Z"},"links":{"cited_paper":"/paper/2012.12877","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:6fcc31ca8f7ee05126c4cec97c89a6dbb5e8515f56eda9bb991902f0d238e88b","observation_id":"6e9df63c-be00-445a-8a2b-823c27e339b8","resolution":{"observed_at":"2026-08-16T00:22:07.509212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.02028","last_updated":"2022-05-04T12:39:25Z","snapshot_observed_at":"2026-08-16T17:02:40.623190Z","submitted_at":"2022-05-04T12:39:25Z","title":"TransRank: Self-supervised Video Representation Learning via Ranking-based Transformation Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.02028","snapshot_observed_at":"2026-08-16T00:22:07.512759Z","title":"arXiv , langid =:2205.02028 , primaryclass =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.512759Z"},"links":{"cited_paper":"/paper/2205.02028","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:5223fc86889c694e08ee2f3d5b7fbddb2dd89995331fd83f5c8a617484a7c686","observation_id":"f27e22b1-635d-44b4-9ffb-37fa5870a60b","resolution":{"observed_at":"2026-08-16T00:22:07.512759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08360","last_updated":"2022-02-22T18:15:21Z","snapshot_observed_at":"2026-08-16T17:20:43.611977Z","submitted_at":"2022-02-16T22:26:47Z","title":"Vision Models Are More Robust And Fair When Pretrained On Uncurated Images Without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08360","snapshot_observed_at":"2026-08-16T00:22:07.516838Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.516838Z"},"links":{"cited_paper":"/paper/2202.08360","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:cb975c189c47178c252745a6e5d37eb298027cc1a2a80bd259f18129d982a2aa","observation_id":"61747859-71ed-4b6b-95c9-2fae8fc5852f","resolution":{"observed_at":"2026-08-16T00:22:07.516838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.00481","last_updated":"2022-10-13T14:11:34Z","snapshot_observed_at":"2026-08-16T16:56:01.175238Z","submitted_at":"2022-06-01T13:25:32Z","title":"Where are my Neighbors? Exploiting Patches Relations in Self-Supervised Vision Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.00481","snapshot_observed_at":"2026-08-16T00:22:07.520623Z","title":"Where Are My","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.520623Z"},"links":{"cited_paper":"/paper/2206.00481","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:b577290c9299f1ca2252fa149ee02a474572aec52626c624527a46e0774400f8","observation_id":"a18ca1dc-bbe6-433b-9575-44aa22864757","resolution":{"observed_at":"2026-08-16T00:22:07.520623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.13805","last_updated":"2022-05-27T07:47:22Z","snapshot_observed_at":"2026-08-16T16:57:15.996133Z","submitted_at":"2022-05-27T07:47:22Z","title":"X-ViT: High Performance Linear Vision Transformer without Softmax","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.13805","snapshot_observed_at":"2026-08-16T00:22:07.524279Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.524279Z"},"links":{"cited_paper":"/paper/2205.13805","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:1d394b93b34697f8f02f5341dd95022faf3d5c230e5ef0f18b20adb60de42f90","observation_id":"1e6526b8-b485-47c5-8bb3-ef25a7c29729","resolution":{"observed_at":"2026-08-16T00:22:07.524279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-16T00:22:07.528089Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.528089Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:72386a3c51348b8187ba3ff1e063f9bff5647438fbd00d7db1e34226a43379c4","observation_id":"fdb59593-1e7d-4656-a9c5-00a9e0f28889","resolution":{"observed_at":"2026-08-16T00:22:07.528089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.03722","last_updated":"2021-04-08T12:17:54Z","snapshot_observed_at":"2026-08-16T18:33:01.628925Z","submitted_at":"2021-04-08T12:17:54Z","title":"HindSight: A Graph-Based Vision Model Architecture For Representing Part-Whole Hierarchies","version":1},"cited_work":{"arxiv_id":"2104.03722","doi":"10.48550/arxiv.2104.03722","metadata_source":"pith","pith_arxiv_id":"2104.03722","snapshot_observed_at":"2026-08-16T12:16:17.039197Z","title":"HindSight: A Graph-Based Vision Model Architecture For Representing Part-Whole Hierarchies","venue":"cs.CV","work_id":"4d3cf60d-0e05-4daa-adca-6f5e0b09b083","year":2021},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.531760Z"},"links":{"cited_paper":"/paper/2104.03722","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:7822cd0e695c8363838ebd923bae96c7ebf74a2a1dd6e052f3a1b3f6e7f096d0","observation_id":"67beb522-641a-4a2c-9ac1-197ecec13792","resolution":{"observed_at":"2026-08-16T00:23:41.702242Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01228","last_updated":"2022-07-06T21:51:38Z","snapshot_observed_at":"2026-08-16T18:57:06.020428Z","submitted_at":"2022-05-02T21:41:14Z","title":"Paragraph-based Transformer Pre-training for Multi-Sentence Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01228","snapshot_observed_at":"2026-08-16T00:22:07.535352Z","title":"Paragraph-Based","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.535352Z"},"links":{"cited_paper":"/paper/2205.01228","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:1b044a0fd1e3a2ece690bdb32d53c849f7d74d85451413dfc51f31402ddc55e9","observation_id":"d7e3b65e-6ea1-489e-ba09-4015aa3b07d6","resolution":{"observed_at":"2026-08-16T00:22:07.535352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.05822","last_updated":"2022-05-16T07:04:54Z","snapshot_observed_at":"2026-08-16T17:21:54.972386Z","submitted_at":"2022-02-11T18:35:25Z","title":"CLIPasso: Semantically-Aware Object Sketching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.05822","snapshot_observed_at":"2026-08-16T00:22:07.538953Z","title":"and Bachmann, Roman Christian and Bermano, Amit Haim and","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.538953Z"},"links":{"cited_paper":"/paper/2202.05822","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:4d554e6f8128e34e88f584c8eb27dcd16ac57e3dc7434b2174a201ac1ec5a0f6","observation_id":"cd2c6f56-e01d-4468-8511-16fd0107037d","resolution":{"observed_at":"2026-08-16T00:22:07.538953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.03044","last_updated":"2020-12-05T14:54:08Z","snapshot_observed_at":"2026-08-16T19:00:46.601864Z","submitted_at":"2020-12-05T14:54:08Z","title":"Self-Supervised Visual Representation Learning from Hierarchical Grouping","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.03044","snapshot_observed_at":"2026-08-16T00:22:07.542826Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.542826Z"},"links":{"cited_paper":"/paper/2012.03044","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:9c4ebd5589a13cf35771317c62b52573250462fa394e8d12d69cba4ce33b49e0","observation_id":"fac01ad9-16be-4396-b908-64b01b4ca6a6","resolution":{"observed_at":"2026-08-16T00:22:07.542826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.06606","last_updated":"2021-01-19T15:45:44Z","snapshot_observed_at":"2026-08-16T14:36:36.883435Z","submitted_at":"2020-06-11T16:55:07Z","title":"What makes instance discrimination good for transfer learning?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.06606","snapshot_observed_at":"2026-08-16T00:22:07.546746Z","title":"doi:10.48550/arXiv.2006.06606 , urldate =","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.546746Z"},"links":{"cited_paper":"/paper/2006.06606","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:943cea943d0c963ddbfc9b5cf6daa48925bf61868c4060db3c73c4befb201956","observation_id":"d9bdfc2d-8839-49d1-8c8f-387d61e265f7","resolution":{"observed_at":"2026-08-16T00:22:07.546746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.14881","last_updated":"2021-10-25T19:54:23Z","snapshot_observed_at":"2026-08-16T18:13:54.025166Z","submitted_at":"2021-06-28T17:59:33Z","title":"Early Convolutions Help Transformers See Better","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.14881","snapshot_observed_at":"2026-08-16T00:22:07.550583Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.550583Z"},"links":{"cited_paper":"/paper/2106.14881","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:a4ca53b89c5a48eb1379b500d4ffa8523085efca88236b669cc80be61fda3cf8","observation_id":"4f7a65a3-566b-4817-93c8-c9ba079629f9","resolution":{"observed_at":"2026-08-16T00:22:07.550583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-16T00:22:07.554504Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.554504Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:c7c5472ec81730e2d0bcd8276273d9063ddf63cfadbf317fed7b04fe432b2260","observation_id":"f033a130-16f1-418d-878e-54fb07a6f3fe","resolution":{"observed_at":"2026-08-16T00:22:07.554504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.03584","last_updated":"2020-01-10T09:06:09Z","snapshot_observed_at":"2026-08-15T05:21:16.745798Z","submitted_at":"2019-11-08T23:48:38Z","title":"On the Relationship between Self-Attention and Convolutional Layers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.03584","snapshot_observed_at":"2026-08-16T00:22:07.558331Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.558331Z"},"links":{"cited_paper":"/paper/1911.03584","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:aaea3bffde908b5a26760632a0cd61cef0fe01b8334d945e9b1b6a72bd98f46a","observation_id":"acb488cc-b72b-45b9-afab-2118d0c9d4f6","resolution":{"observed_at":"2026-08-16T00:22:07.558331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:22:07.561735Z","title":"International","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.561735Z"},"links":{"citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:35b7e2b48603dab2a5b772b9f0ad9e9a89c51d52fcd3d4337f99f25141279772","observation_id":"5d2672df-07b6-4552-b83d-555acc857037","resolution":{"observed_at":"2026-08-16T00:22:07.561735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:22:07.564729Z","title":"Proceedings of the 37th","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.564729Z"},"links":{"citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:d65e4b79e2935647838c69016c7ba60b423e173ee1a3b573e3060c3476b215a4","observation_id":"78a04d3c-fad6-4cf1-8ca7-2662c3a9a3e5","resolution":{"observed_at":"2026-08-16T00:22:07.564729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.10882","last_updated":"2023-02-13T01:19:57Z","snapshot_observed_at":"2026-08-16T18:43:58.639735Z","submitted_at":"2021-02-22T10:29:55Z","title":"Conditional Positional Encodings for Vision Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.10882","snapshot_observed_at":"2026-08-16T00:22:07.568038Z","title":"Conditional","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.568038Z"},"links":{"cited_paper":"/paper/2102.10882","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:c261bba671c8c75685afbc98ac9de8d59d5284e36ad5e76cf0e6c964a01defcf","observation_id":"63344016-8127-4f0f-a1d4-1d5559ccae53","resolution":{"observed_at":"2026-08-16T00:22:07.568038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.13840","last_updated":"2021-09-30T02:16:36Z","snapshot_observed_at":"2026-08-16T18:28:27.566417Z","submitted_at":"2021-04-28T15:42:31Z","title":"Twins: Revisiting the Design of Spatial Attention in Vision Transformers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.13840","snapshot_observed_at":"2026-08-16T00:22:07.571386Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.571386Z"},"links":{"cited_paper":"/paper/2104.13840","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:6c1d065abb6932a18e6789548c3ec6901070043c4ac3ef33bd28f0b8a49cdb51","observation_id":"efa3882b-1e6a-4bd4-a302-4482f4112a55","resolution":{"observed_at":"2026-08-16T00:22:07.571386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09681","last_updated":"2021-06-18T15:33:31Z","snapshot_observed_at":"2026-08-16T18:16:19.424312Z","submitted_at":"2021-06-17T17:33:35Z","title":"XCiT: Cross-Covariance Image Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09681","snapshot_observed_at":"2026-08-16T00:22:07.575429Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.575429Z"},"links":{"cited_paper":"/paper/2106.09681","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:eec17ea39f245ea9f1265c8d05737e82baa0fc3783d45e4ebe24cc78600b72b8","observation_id":"137895e7-81ac-49ae-8f0d-e1c9ca5035a5","resolution":{"observed_at":"2026-08-16T00:22:07.575429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.15075","last_updated":"2021-10-26T14:08:00Z","snapshot_observed_at":"2026-08-16T18:20:49.316384Z","submitted_at":"2021-05-31T16:04:10Z","title":"Not All Images are Worth 16x16 Words: Dynamic Transformers for Efficient Image Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.15075","snapshot_observed_at":"2026-08-16T00:22:07.579157Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.579157Z"},"links":{"cited_paper":"/paper/2105.15075","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:cc1423d8d7171059925c8aaf1cc92d3f0600cd0e20e44699743af3d6512d0479","observation_id":"209f1b0f-a7ba-4614-aaac-36fb53d1cd00","resolution":{"observed_at":"2026-08-16T00:22:07.579157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.03348","last_updated":"2021-12-24T02:57:08Z","snapshot_observed_at":"2026-08-16T18:19:13.527927Z","submitted_at":"2021-06-07T05:31:06Z","title":"ViTAE: Vision Transformer Advanced by Exploring Intrinsic Inductive Bias","version":4},"cited_work":{"arxiv_id":"2106.03348","doi":"10.48550/arxiv.2106.03348","metadata_source":"pith","pith_arxiv_id":"2106.03348","snapshot_observed_at":"2026-08-16T12:16:17.039197Z","title":"ViTAE: Vision Transformer Advanced by Exploring Intrinsic Inductive Bias","venue":"cs.CV","work_id":"3a3f9377-c7e2-4d11-805c-997715934565","year":2021},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.583072Z"},"links":{"cited_paper":"/paper/2106.03348","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:290c93c31d7d1040543dd22b43159c21a16f3ecc5a6cc7e801b30e1cbc6fcec9","observation_id":"7e3b444d-5f76-446e-8bf8-4195579436e5","resolution":{"observed_at":"2026-08-16T00:23:41.486977Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14949","last_updated":"2022-05-30T09:34:44Z","snapshot_observed_at":"2026-08-16T16:56:43.732937Z","submitted_at":"2022-05-30T09:34:44Z","title":"HiViT: Hierarchical Vision Transformer Meets Masked Image Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14949","snapshot_observed_at":"2026-08-16T00:22:07.586896Z","title":"doi:10.48550/arXiv.2205.14949 , urldate =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.586896Z"},"links":{"cited_paper":"/paper/2205.14949","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:fd18951407705ec2623276f516859ac798df4ad9899e593cb72bae4b30a7b71e","observation_id":"bd7c8ee5-43e7-4633-97a2-74e543cb2b10","resolution":{"observed_at":"2026-08-16T00:22:07.586896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.02767","last_updated":"2022-03-23T19:10:58Z","snapshot_observed_at":"2026-08-16T17:29:36.551226Z","submitted_at":"2022-01-08T05:45:32Z","title":"QuadTree Attention for Vision Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.02767","snapshot_observed_at":"2026-08-16T00:22:07.590846Z","title":"doi:10.48550/arXiv.2201.02767 , urldate =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.590846Z"},"links":{"cited_paper":"/paper/2201.02767","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:6b2eefcb2c6a13722fe6e83841232a6701dfb060365c636c6d4803bae40ad1ad","observation_id":"6f74c388-48f9-4938-834b-58c164f4f6ae","resolution":{"observed_at":"2026-08-16T00:22:07.590846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.05707","last_updated":"2025-02-12T13:35:59Z","snapshot_observed_at":"2026-08-16T18:32:09.126626Z","submitted_at":"2021-04-12T17:59:22Z","title":"LocalViT: Analyzing Locality in Vision Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.05707","snapshot_observed_at":"2026-08-16T00:22:07.594500Z","title":"doi:10.48550/arXiv.2104.05707 , urldate =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.594500Z"},"links":{"cited_paper":"/paper/2104.05707","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:85fb871f16d4626a22792e2af5684de212c265d96409d876792c13c9cb070cdc","observation_id":"97ebe45e-d919-4da9-b215-779e32a7c30a","resolution":{"observed_at":"2026-08-16T00:22:07.594500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.02689","last_updated":"2022-03-31T03:20:15Z","snapshot_observed_at":"2026-08-16T18:19:33.155629Z","submitted_at":"2021-06-04T19:57:11Z","title":"RegionViT: Regional-to-Local Attention for Vision Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.02689","snapshot_observed_at":"2026-08-16T00:22:07.598422Z","title":"doi:10.48550/arXiv.2106.02689 , urldate =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.598422Z"},"links":{"cited_paper":"/paper/2106.02689","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:28f5666a4dd4b09b542ac195aff195d702cdb527f7c2bc8d8309ef5a21c540b1","observation_id":"c253ba82-f804-484f-91f1-f7ebd378814c","resolution":{"observed_at":"2026-08-16T00:22:07.598422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.02940","last_updated":"2019-07-27T08:03:46Z","snapshot_observed_at":"2026-08-16T14:43:26.591184Z","submitted_at":"2019-06-07T07:47:24Z","title":"Selfie: Self-supervised Pretraining for Image Embedding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.02940","snapshot_observed_at":"2026-08-16T00:22:07.602569Z","title":"and Luong, Minh-Thang and Le, Quoc V","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.602569Z"},"links":{"cited_paper":"/paper/1906.02940","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:89a3c8926844192158528b374d8e422a63648cf4ae687d49556f72dbb89df18a","observation_id":"5557f7ac-4b1d-4bc1-913c-97ee4edfd3e8","resolution":{"observed_at":"2026-08-16T00:22:07.602569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.04713","last_updated":"2022-06-16T22:12:01Z","snapshot_observed_at":"2026-08-16T17:22:26.335261Z","submitted_at":"2022-02-09T20:33:37Z","title":"PINs: Progressive Implicit Networks for Multi-Scale Neural Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.04713","snapshot_observed_at":"2026-08-16T00:22:07.606480Z","title":"doi:10.48550/arXiv.2202.04713 , urldate =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.606480Z"},"links":{"cited_paper":"/paper/2202.04713","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:1f5bab2323b0f545d5809d6971433d320e952e42c33b6ec0bfa2de0a1fbbed12","observation_id":"e8c9abb7-ee68-4d0d-8d79-28f10a162f87","resolution":{"observed_at":"2026-08-16T00:22:07.606480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07700","last_updated":"2022-06-15T17:52:23Z","snapshot_observed_at":"2026-08-16T16:52:44.815432Z","submitted_at":"2022-06-15T17:52:23Z","title":"Masked Siamese ConvNets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.07700","snapshot_observed_at":"2026-08-16T00:22:07.610349Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.610349Z"},"links":{"cited_paper":"/paper/2206.07700","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:bbe68bcfb3f14f57a34fa08af2eeb8324852af89434dac8764a4c7bc74d721ca","observation_id":"270d4b63-0ff8-4601-a1b9-62ca0e71dc2a","resolution":{"observed_at":"2026-08-16T00:22:07.610349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.00899","last_updated":"2022-03-15T01:42:01Z","snapshot_observed_at":"2026-08-16T17:45:40.029346Z","submitted_at":"2021-10-28T17:21:33Z","title":"Equivariant Contrastive Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.00899","snapshot_observed_at":"2026-08-16T00:22:07.614092Z","title":"Equivariant","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.614092Z"},"links":{"cited_paper":"/paper/2111.00899","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:5eeea61c8d08794ceee53144471e6f2c8d17e04f1485898572ad4f096b62f03b","observation_id":"90aeeab0-5c39-4c1c-8cf6-6219506d0a33","resolution":{"observed_at":"2026-08-16T00:22:07.614092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.09348","last_updated":"2022-04-23T16:44:20Z","snapshot_observed_at":"2026-08-16T17:48:26.312603Z","submitted_at":"2021-10-18T14:22:19Z","title":"Understanding Dimensional Collapse in Contrastive Self-supervised Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.09348","snapshot_observed_at":"2026-08-16T00:22:07.617714Z","title":"Understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.617714Z"},"links":{"cited_paper":"/paper/2110.09348","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:bbe57ea089d873a19467f7b0da92a6dbb3674a590e0cd3891d689b2c829ed72e","observation_id":"fab8a51f-d297-4dba-bb44-d2e291cc2001","resolution":{"observed_at":"2026-08-16T00:22:07.617714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03230","last_updated":"2021-06-14T14:09:43Z","snapshot_observed_at":"2026-08-16T18:41:10.851922Z","submitted_at":"2021-03-04T18:55:09Z","title":"Barlow Twins: Self-Supervised Learning via Redundancy Reduction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03230","snapshot_observed_at":"2026-08-16T00:22:07.621141Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.621141Z"},"links":{"cited_paper":"/paper/2103.03230","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:b75bf8b2d02986816d825e4b07344452efa0284192cfc8cf432724d762fa9099","observation_id":"8131f68d-a91e-4918-9303-7f4913431e4f","resolution":{"observed_at":"2026-08-16T00:22:07.621141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09785","last_updated":"2022-07-06T18:56:54Z","snapshot_observed_at":"2026-08-16T18:16:16.246919Z","submitted_at":"2021-06-17T19:57:33Z","title":"Efficient Self-supervised Vision Transformers for Representation Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09785","snapshot_observed_at":"2026-08-16T00:22:07.624836Z","title":"Efficient","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.624836Z"},"links":{"cited_paper":"/paper/2106.09785","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:523fbd27d7da07eedd3fb11075fc4141190990a202d78bcd1b6f1152a73c61d2","observation_id":"7e36be43-e386-4aeb-b486-5a5db272fb61","resolution":{"observed_at":"2026-08-16T00:22:07.624836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.09753","last_updated":"2023-12-13T20:02:00Z","snapshot_observed_at":"2026-08-16T16:51:47.310422Z","submitted_at":"2022-06-20T13:01:46Z","title":"Visualizing and Understanding Contrastive Learning","version":3},"cited_work":{"arxiv_id":"2206.09753","doi":"10.48550/arxiv.2206.09753","metadata_source":"pith","pith_arxiv_id":"2206.09753","snapshot_observed_at":"2026-08-16T12:16:17.039197Z","title":"Visualizing and Understanding Contrastive Learning","venue":"cs.CV","work_id":"f028c93b-7439-43bf-b0e2-fcae69a44def","year":2022},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.628255Z"},"links":{"cited_paper":"/paper/2206.09753","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:f1e7aae4e4d9664928d457e09f84a769eba6e58c2262f1c38438130244e4ee28","observation_id":"7661c542-6f20-441d-bc21-2e11e728a1a1","resolution":{"observed_at":"2026-08-16T00:23:41.159185Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.05656","last_updated":"2021-10-24T06:59:05Z","snapshot_observed_at":"2026-08-16T18:18:07.891435Z","submitted_at":"2021-06-10T11:05:18Z","title":"MST: Masked Self-Supervised Transformer for Visual Representation","version":2},"cited_work":{"arxiv_id":"2106.05656","doi":"10.48550/arxiv.2106.05656","metadata_source":"pith","pith_arxiv_id":"2106.05656","snapshot_observed_at":"2026-08-16T12:16:17.039197Z","title":"MST: Masked Self-Supervised Transformer for Visual Representation","venue":"cs.CV","work_id":"365f9c7e-7057-4da4-a2f0-4313f08291fb","year":2021},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.631931Z"},"links":{"cited_paper":"/paper/2106.05656","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:24925b9b321794fb00bf4287c3e4f5b28ac57324a9b38796a7f31163dab9cf34","observation_id":"8e2c660f-aa01-4e5a-bbfe-d7c80b509ec2","resolution":{"observed_at":"2026-08-16T00:23:41.135375Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.09238","last_updated":"2022-07-19T12:49:02Z","snapshot_observed_at":"2026-08-16T16:44:52.195403Z","submitted_at":"2022-07-19T12:49:02Z","title":"Formal Algorithms for Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.09238","snapshot_observed_at":"2026-08-16T00:22:07.635138Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.635138Z"},"links":{"cited_paper":"/paper/2207.09238","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:6066d4a6ef117098859da50c9d0f897f9f08c7cb88453e9707b8e6064b1a0cb3","observation_id":"fab6a7b7-ff6f-4114-a7b4-e6266cebb093","resolution":{"observed_at":"2026-08-16T00:22:07.635138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.01881","last_updated":"2023-12-12T22:56:44Z","snapshot_observed_at":"2026-08-16T17:17:10.111219Z","submitted_at":"2022-03-03T17:48:23Z","title":"Measuring Self-Supervised Representation Quality for Downstream Classification using Discriminative Features","version":6},"cited_work":{"arxiv_id":"2203.01881","doi":"10.48550/arxiv.2203.01881","metadata_source":"pith","pith_arxiv_id":"2203.01881","snapshot_observed_at":"2026-08-16T12:16:17.039197Z","title":"Measuring Self-Supervised Representation Quality for Downstream Classification using Discriminative Features","venue":"cs.LG","work_id":"d8f0e9a1-1333-4c88-8d39-8ae12c758d03","year":2022},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.638350Z"},"links":{"cited_paper":"/paper/2203.01881","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:358e1456077f715eac10fd5cf4111e002c3651eabdad144a674b7ad3731f8a71","observation_id":"5e664d3e-f47c-4f2f-8775-efce38083a81","resolution":{"observed_at":"2026-08-16T00:23:41.017007Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.12710","last_updated":"2022-12-07T19:11:20Z","snapshot_observed_at":"2026-08-16T17:39:32.417256Z","submitted_at":"2021-11-24T18:59:58Z","title":"PeCo: Perceptual Codebook for BERT Pre-training of Vision Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.12710","snapshot_observed_at":"2026-08-16T00:22:07.641395Z","title":"doi:10.48550/arXiv.2111.12710 , urldate =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.641395Z"},"links":{"cited_paper":"/paper/2111.12710","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:013d24a8ad688f15e6f6edcaf84c129d425254977c9574f6e593a0e92feea27b","observation_id":"c8bce2d2-ac28-45c3-8c53-f1b24e0ab10f","resolution":{"observed_at":"2026-08-16T00:22:07.641395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.10551","last_updated":"2022-07-21T15:50:22Z","snapshot_observed_at":"2026-08-16T16:44:16.282152Z","submitted_at":"2022-07-21T15:50:22Z","title":"Scaling Laws vs Model Architectures: How does Inductive Bias Influence Scaling?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.10551","snapshot_observed_at":"2026-08-16T00:22:07.644317Z","title":"and Yogatama, Dani and Metzler, Donald , year = 2022, month = jul, number =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.644317Z"},"links":{"cited_paper":"/paper/2207.10551","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:6d328b79e6260520c4e2846d925d7e9c900a1caaaed3df9fe8251cbfea30ce46","observation_id":"04cb0b00-dcc3-4aa4-885b-bdcda099d3b3","resolution":{"observed_at":"2026-08-16T00:22:07.644317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07733","last_updated":"2020-09-10T09:46:02Z","snapshot_observed_at":"2026-08-14T05:53:12.800111Z","submitted_at":"2020-06-13T22:35:21Z","title":"Bootstrap your own latent: A new approach to self-supervised Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.07733","snapshot_observed_at":"2026-08-16T00:22:07.647678Z","title":"doi:10.48550/arXiv.2006.07733 , urldate =","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.647678Z"},"links":{"cited_paper":"/paper/2006.07733","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:fb2a56850098a99930e616a60aa8f6013da6593c298d7404bd7c907afa7e7929","observation_id":"279a3187-b1e1-4cbc-9c25-12e13c63e65d","resolution":{"observed_at":"2026-08-16T00:22:07.647678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.10243","last_updated":"2020-12-18T10:01:34Z","snapshot_observed_at":"2026-08-16T14:37:45.839488Z","submitted_at":"2020-05-20T17:59:57Z","title":"What Makes for Good Views for Contrastive Learning?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.10243","snapshot_observed_at":"2026-08-16T00:22:07.651261Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.651261Z"},"links":{"cited_paper":"/paper/2005.10243","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:4b1732552e1555b87c2377f4fbb89590db85dfc5e94126e45c15ca86b9d461d9","observation_id":"ee490953-e825-4b59-9915-280e07a6bb0c","resolution":{"observed_at":"2026-08-16T00:22:07.651261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.15340","last_updated":"2021-11-30T12:36:38Z","snapshot_observed_at":"2026-08-16T17:38:14.592141Z","submitted_at":"2021-11-30T12:36:38Z","title":"MC-SSL0.0: Towards Multi-Concept Self-Supervised Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.15340","snapshot_observed_at":"2026-08-16T00:22:07.654675Z","title":"doi:10.48550/arXiv.2111.15340 , urldate =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.654675Z"},"links":{"cited_paper":"/paper/2111.15340","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:336f36bba64b04f5cca4bf05ca85f89c4702414fc6e1583560ba1e79c4e8c60f","observation_id":"988dd4cd-8fb7-4094-8ea8-649edf350ad2","resolution":{"observed_at":"2026-08-16T00:22:07.654675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05709","last_updated":"2020-07-01T00:09:08Z","snapshot_observed_at":"2026-08-15T20:49:51.676387Z","submitted_at":"2020-02-13T18:50:45Z","title":"A Simple Framework for Contrastive Learning of Visual Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05709","snapshot_observed_at":"2026-08-16T00:22:07.658292Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.658292Z"},"links":{"cited_paper":"/paper/2002.05709","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:069c12a19f27014d13463680c7fb3e20032725448d6e8f74753abdfd7d133952","observation_id":"71771a7c-056e-4ada-9fba-fc72fc1bc580","resolution":{"observed_at":"2026-08-16T00:22:07.658292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.04887","last_updated":"2020-06-25T00:09:04Z","snapshot_observed_at":"2026-08-16T14:39:51.085226Z","submitted_at":"2020-03-10T17:58:01Z","title":"ReZero is All You Need: Fast Convergence at Large Depth","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.04887","snapshot_observed_at":"2026-08-16T00:22:07.662157Z","title":"and McAuley, Julian , year = 2020, month = jun, number =","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.662157Z"},"links":{"cited_paper":"/paper/2003.04887","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:8ab16e13bc9781c382e91cd8dc61238b02068a2555a58c31fb6f7b1de0270401","observation_id":"7e3806e3-198a-45c8-99e0-fa515c46861f","resolution":{"observed_at":"2026-08-16T00:22:07.662157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.05790","last_updated":"2022-01-08T16:59:18Z","snapshot_observed_at":"2026-08-16T18:10:30.331272Z","submitted_at":"2021-07-13T00:27:01Z","title":"Visual Parser: Representing Part-whole Hierarchies with Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.05790","snapshot_observed_at":"2026-08-16T00:22:07.666091Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.666091Z"},"links":{"cited_paper":"/paper/2107.05790","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:cf8daa5892c6e415b08838f104364a6b01b535192b10f96de02c2d4017815a09","observation_id":"5b003ca3-8a9d-4959-a4af-dbf1f482a312","resolution":{"observed_at":"2026-08-16T00:22:07.666091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.06801","last_updated":"2022-10-13T12:08:14Z","snapshot_observed_at":"2026-08-16T16:53:08.012582Z","submitted_at":"2022-06-14T12:47:47Z","title":"Peripheral Vision Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.06801","snapshot_observed_at":"2026-08-16T00:22:07.670240Z","title":"Peripheral","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.670240Z"},"links":{"cited_paper":"/paper/2206.06801","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:ca64974848e43107c28b893da17872f74909d043fb031dff3f4de24a742bc266","observation_id":"ce496744-50d1-4760-8a39-4c4219f7c82e","resolution":{"observed_at":"2026-08-16T00:22:07.670240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.07579","last_updated":"2021-03-13T00:18:19Z","snapshot_observed_at":"2026-08-16T18:39:13.525684Z","submitted_at":"2021-03-13T00:18:19Z","title":"Revisiting ResNets: Improved Training and Scaling Strategies","version":1},"cited_work":{"arxiv_id":"2103.07579","doi":"10.48550/arxiv.2103.07579","metadata_source":"pith","pith_arxiv_id":"2103.07579","snapshot_observed_at":"2026-08-16T12:16:17.039197Z","title":"Revisiting ResNets: Improved Training and Scaling Strategies","venue":"cs.CV","work_id":"700ba295-d246-4b9e-8d7c-819f9401730f","year":2021},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.674024Z"},"links":{"cited_paper":"/paper/2103.07579","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:f0a4d0056e6be08728152e0e9a0d46cfbf78dfd50842bf85c04bf7256787618d","observation_id":"0315a93f-1937-48f6-8b46-dfd423f6e8c5","resolution":{"observed_at":"2026-08-16T00:23:40.774361Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:22:07.677887Z","title":"Self-Supervised","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.677887Z"},"links":{"citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:766118280962177d888582ded2ada7effaefb56b9cea4bc599faafaadf4e3a04","observation_id":"98048345-c542-4b97-a455-35ee51be5f1d","resolution":{"observed_at":"2026-08-16T00:22:07.677887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.12451","last_updated":"2022-11-08T15:52:39Z","snapshot_observed_at":"2026-08-16T17:04:26.217764Z","submitted_at":"2022-04-26T17:16:32Z","title":"Understanding The Robustness in Vision Transformers","version":4},"cited_work":{"arxiv_id":"2204.12451","doi":"10.48550/arxiv.2204.12451","metadata_source":"pith","pith_arxiv_id":"2204.12451","snapshot_observed_at":"2026-08-16T12:16:17.039197Z","title":"Understanding The Robustness in Vision Transformers","venue":"cs.CV","work_id":"0759b72d-a0b0-4a26-b6ac-0a44915d127a","year":2022},"citing_paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-16T00:22:07.681399Z"},"links":{"cited_paper":"/paper/2204.12451","citing_paper":"/paper/2608.12084"},"observation_digest":"sha256:0d16c5a10e8e84084a6a57d5659cabcdec4af57a9ab4c67c6dc3e08410fed88a","observation_id":"a85e7347-e64f-4221-9434-69f515a3e026","resolution":{"observed_at":"2026-08-16T00:23:40.697927Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.12084","last_updated":"2026-08-12T14:07:09Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T00:50:45.268717Z","submitted_at":"2026-08-12T14:07:09Z","title":"NAE: Normalizing AutoEncoder"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":5,"parse_uncertain":1,"unresolved":92,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":295},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 100 of 295 outbound references and 0 inbound Pith citation observations for arXiv:2608.12084."}