{"as_of":"2026-08-15T07:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7f3308585bb3f6510c41ba7c641919f5cd318940a399999ea0a6bcbad063e16c","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T00:55:21.245290Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.04181/citation-record","integrity":"/paper/2508.04181/integrity","json":"/paper/2508.04181/citation-record.json","paper":"/paper/2508.04181"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-15T04:53:45.483331Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-06T00:55:18.323666Z","title":"Layer normalization","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.04181","last_updated":"2025-08-06T08:08:04Z","snapshot_observed_at":"2026-08-11T12:54:47.270181Z","submitted_at":"2025-08-06T08:08:04Z","title":"Deeper Inside Deep ViT","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T00:55:18.323666Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2508.04181"},"observation_digest":"sha256:2a00e821c50db681053ca7b3b6a83038b93f84fad98ef0c44f6282c6379022ee","observation_id":"ce9b271e-cd5b-4d9d-940e-c775af7487cb","resolution":{"observed_at":"2026-08-06T00:55:18.323666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.01261","last_updated":"2018-10-17T17:51:36Z","snapshot_observed_at":"2026-08-15T04:21:38.631648Z","submitted_at":"2018-06-04T17:58:18Z","title":"Relational inductive biases, deep learning, and graph networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.01261","snapshot_observed_at":"2026-08-06T00:55:18.394404Z","title":"Relational inductive biases, deep learning, and graph networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.04181","last_updated":"2025-08-06T08:08:04Z","snapshot_observed_at":"2026-08-11T12:54:47.270181Z","submitted_at":"2025-08-06T08:08:04Z","title":"Deeper Inside Deep ViT","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T00:55:18.394404Z"},"links":{"cited_paper":"/paper/1806.01261","citing_paper":"/paper/2508.04181"},"observation_digest":"sha256:5cf32b81f5b5eb8cef287cef2b4e2f651a61e2f3a6d9501be5a53f19b29d8634","observation_id":"d537ff11-9f77-447a-afdb-510a52e6cf7a","resolution":{"observed_at":"2026-08-06T00:55:18.394404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-06T00:55:18.484513Z","title":"On the opportunities and risks of foundation models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.04181","last_updated":"2025-08-06T08:08:04Z","snapshot_observed_at":"2026-08-11T12:54:47.270181Z","submitted_at":"2025-08-06T08:08:04Z","title":"Deeper Inside Deep ViT","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T00:55:18.484513Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2508.04181"},"observation_digest":"sha256:ee1e4793b8ee8f825b0165a4ab1a8425b2b05fb106a8f48b9072045f2c66b985","observation_id":"4f6f39e6-7e90-44b9-ad55-4f8a6e01e562","resolution":{"observed_at":"2026-08-06T00:55:18.484513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.04793","last_updated":"2021-01-12T23:02:26Z","snapshot_observed_at":"2026-08-09T17:39:26.616120Z","submitted_at":"2021-01-12T23:02:26Z","title":"Generative Adversarial U-Net for Domain-free Medical Image Augmentation","version":1},"cited_work":{"arxiv_id":"2101.04793","doi":null,"metadata_source":"pith","pith_arxiv_id":"2101.04793","snapshot_observed_at":"2026-08-06T00:55:21.716157Z","title":"Generative Adversarial U-Net for Domain-free Medical Image Augmentation","venue":"eess.IV","work_id":"ab5fe7a9-2152-4e7f-a4a8-fcbbecb11c95","year":2021},"citing_paper":{"arxiv_id":"2508.04181","last_updated":"2025-08-06T08:08:04Z","snapshot_observed_at":"2026-08-11T12:54:47.270181Z","submitted_at":"2025-08-06T08:08:04Z","title":"Deeper Inside Deep ViT","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T00:55:18.623767Z"},"links":{"cited_paper":"/paper/2101.04793","citing_paper":"/paper/2508.04181"},"observation_digest":"sha256:32dcefa68b261600a77ff8fde8561e4b4387e0cc95bc4d1f3fd7b473ba447dee","observation_id":"aa14b0b7-5eeb-4708-b860-50af89a7d2fb","resolution":{"observed_at":"2026-08-06T00:55:21.739413Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:55:18.690708Z","title":"Palm: Scaling language modeling with pathways","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.04181","last_updated":"2025-08-06T08:08:04Z","snapshot_observed_at":"2026-08-11T12:54:47.270181Z","submitted_at":"2025-08-06T08:08:04Z","title":"Deeper Inside Deep ViT","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T00:55:18.690708Z"},"links":{"citing_paper":"/paper/2508.04181"},"observation_digest":"sha256:691ff1015936699fdd102f10007a4c37c20b5e3b5a2721c3e29eeef6a6c12976","observation_id":"a5a602c9-a8e9-49a9-9edf-510b727b5714","resolution":{"observed_at":"2026-08-06T00:55:18.690708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:55:18.792634Z","title":"Scaling vision transformers to 22 billion parameters","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.04181","last_updated":"2025-08-06T08:08:04Z","snapshot_observed_at":"2026-08-11T12:54:47.270181Z","submitted_at":"2025-08-06T08:08:04Z","title":"Deeper Inside Deep ViT","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T00:55:18.792634Z"},"links":{"citing_paper":"/paper/2508.04181"},"observation_digest":"sha256:1bdd5f9570390f43afdfae541ee0e6e9840aa78003022c1c17af590ec843312c","observation_id":"01f3bddd-061e-4613-a21c-1a5084f7a61b","resolution":{"observed_at":"2026-08-06T00:55:18.792634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T14:19:26.598265Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T00:55:18.861097Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2508.04181","last_updated":"2025-08-06T08:08:04Z","snapshot_observed_at":"2026-08-11T12:54:47.270181Z","submitted_at":"2025-08-06T08:08:04Z","title":"Deeper Inside Deep ViT","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T00:55:18.861097Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2508.04181"},"observation_digest":"sha256:5ff4602ec7440c93ae3029a6fb9509fe63024874a51a8f8fccb0255b5c83acc7","observation_id":"83ed8d73-6c15-47e0-b8a7-f963ee453f4a","resolution":{"observed_at":"2026-08-06T00:55:18.861097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:55:23.635985Z","title":"Convit: Improving vision transformers with soft convolutional inductive biases","venue":null,"work_id":"7e02dc40-1df6-4642-9ce2-b01b744b9c9d","year":2021},"citing_paper":{"arxiv_id":"2508.04181","last_updated":"2025-08-06T08:08:04Z","snapshot_observed_at":"2026-08-11T12:54:47.270181Z","submitted_at":"2025-08-06T08:08:04Z","title":"Deeper Inside Deep ViT","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T00:55:18.934779Z"},"links":{"citing_paper":"/paper/2508.04181"},"observation_digest":"sha256:18ccc10c9bd8fcdbec7eb5f1f238ccb936a1ce22c3c5e7fdcbae572378ee53a3","observation_id":"cf9adae1-dc56-48e0-8c76-3ba137bf0695","resolution":{"observed_at":"2026-08-06T00:55:23.676642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:55:19.028566Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.04181","last_updated":"2025-08-06T08:08:04Z","snapshot_observed_at":"2026-08-11T12:54:47.270181Z","submitted_at":"2025-08-06T08:08:04Z","title":"Deeper Inside Deep ViT","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T00:55:19.028566Z"},"links":{"citing_paper":"/paper/2508.04181"},"observation_digest":"sha256:b41ca2671b2558d9f32396400569358af9eaa2a2f83dc165b77b427ade233cdb","observation_id":"c4cc6f83-8ac1-4b2c-8a5d-0ae99cbf394a","resolution":{"observed_at":"2026-08-06T00:55:19.028566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:55:23.421125Z","title":"Se (3)-transformers: 3d roto-translation equivariant attention networks","venue":null,"work_id":"ca4f40d1-53db-4f48-a819-9d2e1154fea3","year":1970},"citing_paper":{"arxiv_id":"2508.04181","last_updated":"2025-08-06T08:08:04Z","snapshot_observed_at":"2026-08-11T12:54:47.270181Z","submitted_at":"2025-08-06T08:08:04Z","title":"Deeper Inside Deep ViT","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T00:55:19.101598Z"},"links":{"citing_paper":"/paper/2508.04181"},"observation_digest":"sha256:cf95324c1b9220f705915580dbb20449e39ca2c8ebd194bccb5db570f623560c","observation_id":"7f89c464-df8a-4d16-abb7-8ad516a64c4e","resolution":{"observed_at":"2026-08-06T00:55:23.530908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:55:23.215929Z","title":"Intriguing properties of transformer training instabilities, 2023","venue":null,"work_id":"f28fbd3d-8c67-429a-ada6-1877f9edd1cb","year":2023},"citing_paper":{"arxiv_id":"2508.04181","last_updated":"2025-08-06T08:08:04Z","snapshot_observed_at":"2026-08-11T12:54:47.270181Z","submitted_at":"2025-08-06T08:08:04Z","title":"Deeper Inside Deep ViT","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T00:55:19.212858Z"},"links":{"citing_paper":"/paper/2508.04181"},"observation_digest":"sha256:f6797a4ecad030888367c3694a5608ea0c3d646650842534bf3cdfcdc53808d5","observation_id":"5198433f-80c1-47f4-95ca-d5f9a2595d80","resolution":{"observed_at":"2026-08-06T00:55:23.317587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:55:19.276806Z","title":"Image-to-image translation with conditional adversarial networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.04181","last_updated":"2025-08-06T08:08:04Z","snapshot_observed_at":"2026-08-11T12:54:47.270181Z","submitted_at":"2025-08-06T08:08:04Z","title":"Deeper Inside Deep ViT","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T00:55:19.276806Z"},"links":{"citing_paper":"/paper/2508.04181"},"observation_digest":"sha256:0da6ec6878383d2c3cd74bd05b076c21551909f2f31a07cb368f5683b1e99213","observation_id":"8f7ce89c-cd89-4e00-a211-f16bec62d09e","resolution":{"observed_at":"2026-08-06T00:55:19.276806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.07074","last_updated":"2021-12-09T04:30:20Z","snapshot_observed_at":"2026-08-15T00:44:04.033982Z","submitted_at":"2021-02-14T05:24:48Z","title":"TransGAN: Two Pure Transformers Can Make One Strong GAN, and That Can Scale Up","version":4},"cited_work":{"arxiv_id":"2102.07074","doi":null,"metadata_source":"pith","pith_arxiv_id":"2102.07074","snapshot_observed_at":"2026-08-06T00:55:21.558312Z","title":"TransGAN: Two Pure Transformers Can Make One Strong GAN, and That Can Scale Up","venue":"cs.CV","work_id":"baae73c8-78ef-4b5b-b55c-ad6248aceee8","year":2021},"citing_paper":{"arxiv_id":"2508.04181","last_updated":"2025-08-06T08:08:04Z","snapshot_observed_at":"2026-08-11T12:54:47.270181Z","submitted_at":"2025-08-06T08:08:04Z","title":"Deeper Inside Deep ViT","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T00:55:19.349820Z"},"links":{"cited_paper":"/paper/2102.07074","citing_paper":"/paper/2508.04181"},"observation_digest":"sha256:9205cf5829725e08d08f9e8008a057b34d385f09bf2471b232ea824c7d80f479","observation_id":"3e82dea6-48d0-4aef-9c87-6c0f13d4f520","resolution":{"observed_at":"2026-08-06T00:55:21.608433Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:55:19.394156Z","title":"A style-based generator architecture for generative adversarial networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.04181","last_updated":"2025-08-06T08:08:04Z","snapshot_observed_at":"2026-08-11T12:54:47.270181Z","submitted_at":"2025-08-06T08:08:04Z","title":"Deeper Inside Deep ViT","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T00:55:19.394156Z"},"links":{"citing_paper":"/paper/2508.04181"},"observation_digest":"sha256:e1a6184a7cae71401615144140dc96f49f28d6916e29ebf8332bb48b5cc79115","observation_id":"726ddafc-e74b-4468-be06-2de580ab8233","resolution":{"observed_at":"2026-08-06T00:55:19.394156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.04589","last_updated":"2024-05-29T09:41:05Z","snapshot_observed_at":"2026-08-14T11:11:15.880276Z","submitted_at":"2021-07-09T17:59:30Z","title":"ViTGAN: Training GANs with Vision Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.04589","snapshot_observed_at":"2026-08-06T00:55:19.445684Z","title":"Vitgan: Training gans with vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.04181","last_updated":"2025-08-06T08:08:04Z","snapshot_observed_at":"2026-08-11T12:54:47.270181Z","submitted_at":"2025-08-06T08:08:04Z","title":"Deeper Inside Deep ViT","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T00:55:19.445684Z"},"links":{"cited_paper":"/paper/2107.04589","citing_paper":"/paper/2508.04181"},"observation_digest":"sha256:32bb8fdb7465c2e33a53a7cf0b9520b84794326990940154f7aa57d93d16d4f6","observation_id":"169df59b-0623-41ff-bc80-a22425c70811","resolution":{"observed_at":"2026-08-06T00:55:19.445684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:55:23.041647Z","title":"Blendgan: Implicitly gan blending for arbitrary stylized face generation","venue":null,"work_id":"df4ccbdf-7823-4c37-bc93-ca3389fbb23d","year":2021},"citing_paper":{"arxiv_id":"2508.04181","last_updated":"2025-08-06T08:08:04Z","snapshot_observed_at":"2026-08-11T12:54:47.270181Z","submitted_at":"2025-08-06T08:08:04Z","title":"Deeper Inside Deep ViT","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T00:55:19.527041Z"},"links":{"citing_paper":"/paper/2508.04181"},"observation_digest":"sha256:d7af41174442eb2831cff853ced4a0d94636b638889842888cffaef69fb9ae81","observation_id":"beac8d87-91cb-4fa4-9755-d9e8af67c31e","resolution":{"observed_at":"2026-08-06T00:55:23.121610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:55:22.861221Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":"c153650e-4f3f-4b76-9242-9c8065ac34ec","year":2021},"citing_paper":{"arxiv_id":"2508.04181","last_updated":"2025-08-06T08:08:04Z","snapshot_observed_at":"2026-08-11T12:54:47.270181Z","submitted_at":"2025-08-06T08:08:04Z","title":"Deeper Inside Deep ViT","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T00:55:19.604222Z"},"links":{"citing_paper":"/paper/2508.04181"},"observation_digest":"sha256:ed1cbb8cbd7bb5a96b2d85c7c7057993596e4adf6e18a160285b63af477a4c17","observation_id":"ce9e0072-cd6b-4b34-ac2d-fdcc3c05310f","resolution":{"observed_at":"2026-08-06T00:55:22.956431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T00:55:19.692799Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.04181","last_updated":"2025-08-06T08:08:04Z","snapshot_observed_at":"2026-08-11T12:54:47.270181Z","submitted_at":"2025-08-06T08:08:04Z","title":"Deeper Inside Deep ViT","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T00:55:19.692799Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2508.04181"},"observation_digest":"sha256:7d5fe7c32305ed9b6c1d6de3dc70b69602ea1847ada540dbf2ead1d34ffdcd51","observation_id":"7ad5847d-0512-4625-8276-800f621c1cb1","resolution":{"observed_at":"2026-08-06T00:55:19.692799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.02973","last_updated":"2022-05-20T21:17:42Z","snapshot_observed_at":"2026-08-13T22:06:50.124171Z","submitted_at":"2022-05-06T01:22:20Z","title":"Large Scale Transfer Learning for Differentially Private Image Classification","version":2},"cited_work":{"arxiv_id":"2205.02973","doi":null,"metadata_source":"pith","pith_arxiv_id":"2205.02973","snapshot_observed_at":"2026-08-06T00:55:21.392220Z","title":"Large Scale Transfer Learning for Differentially Private Image Classification","venue":"cs.LG","work_id":"dcb6496e-2c2d-4a1e-b059-3c0fe21c3d97","year":2022},"citing_paper":{"arxiv_id":"2508.04181","last_updated":"2025-08-06T08:08:04Z","snapshot_observed_at":"2026-08-11T12:54:47.270181Z","submitted_at":"2025-08-06T08:08:04Z","title":"Deeper Inside Deep ViT","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T00:55:19.827204Z"},"links":{"cited_paper":"/paper/2205.02973","citing_paper":"/paper/2508.04181"},"observation_digest":"sha256:b674e1062f0b98d6179ccf9d8ef3ac1a4e3e6db917dfea6ba2528b3b0448f850","observation_id":"fbbc5d8e-e7ea-42c4-a938-fc6ba77c85c9","resolution":{"observed_at":"2026-08-06T00:55:21.455902Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02178","last_updated":"2022-03-04T17:17:31Z","snapshot_observed_at":"2026-08-15T04:06:58.388670Z","submitted_at":"2021-10-05T17:07:53Z","title":"MobileViT: Light-weight, General-purpose, and Mobile-friendly Vision Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02178","snapshot_observed_at":"2026-08-06T00:55:19.954028Z","title":"Mobilevit: light-weight, general-purpose, and mobile- friendly vision transformer","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.04181","last_updated":"2025-08-06T08:08:04Z","snapshot_observed_at":"2026-08-11T12:54:47.270181Z","submitted_at":"2025-08-06T08:08:04Z","title":"Deeper Inside Deep ViT","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T00:55:19.954028Z"},"links":{"cited_paper":"/paper/2110.02178","citing_paper":"/paper/2508.04181"},"observation_digest":"sha256:283cead8acaca1f8f05a2756d0024e431aebcf6912b4202366c075bf4bd99150","observation_id":"cc19d6e6-265f-4cb9-b6af-4b1e2b37b197","resolution":{"observed_at":"2026-08-06T00:55:19.954028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-08-12T13:00:33.339808Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-06T00:55:20.049340Z","title":"Mixed precision training","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.04181","last_updated":"2025-08-06T08:08:04Z","snapshot_observed_at":"2026-08-11T12:54:47.270181Z","submitted_at":"2025-08-06T08:08:04Z","title":"Deeper Inside Deep ViT","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T00:55:20.049340Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2508.04181"},"observation_digest":"sha256:6d2098144d66ba943773fa5e83262eb41a478231e57002c71050f00870e52538","observation_id":"1a83d089-c7e7-4221-bfd1-2f50f44f79ff","resolution":{"observed_at":"2026-08-06T00:55:20.049340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:55:22.695890Z","title":"Foundation models for generalist medical artificial intelligence","venue":null,"work_id":"76e822b0-2013-4901-b9e3-2c507cd412c8","year":2023},"citing_paper":{"arxiv_id":"2508.04181","last_updated":"2025-08-06T08:08:04Z","snapshot_observed_at":"2026-08-11T12:54:47.270181Z","submitted_at":"2025-08-06T08:08:04Z","title":"Deeper Inside Deep ViT","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T00:55:20.165788Z"},"links":{"citing_paper":"/paper/2508.04181"},"observation_digest":"sha256:a752bf30eb08a978c01b269df232a8e0a44fd6f95d16522c9ded69d92ede384a","observation_id":"0c51c60c-4f8b-4363-b115-da709a5188fb","resolution":{"observed_at":"2026-08-06T00:55:22.769106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:55:22.586875Z","title":"Do vision transformers see like convolutional neural networks? Advances in Neural Information Processing Systems, 34:12116–12128, 2021","venue":null,"work_id":"04a30600-61e4-464e-9f84-7694975dfee0","year":2021},"citing_paper":{"arxiv_id":"2508.04181","last_updated":"2025-08-06T08:08:04Z","snapshot_observed_at":"2026-08-11T12:54:47.270181Z","submitted_at":"2025-08-06T08:08:04Z","title":"Deeper Inside Deep ViT","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T00:55:20.226965Z"},"links":{"citing_paper":"/paper/2508.04181"},"observation_digest":"sha256:aa601dd8dae662bc764d4a7cae7e070d8cf4fa59ed82993050fcf781d26e0335","observation_id":"bb34ee32-9dc7-46d1-88f1-877909059180","resolution":{"observed_at":"2026-08-06T00:55:22.639380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:55:20.320394Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.04181","last_updated":"2025-08-06T08:08:04Z","snapshot_observed_at":"2026-08-11T12:54:47.270181Z","submitted_at":"2025-08-06T08:08:04Z","title":"Deeper Inside Deep ViT","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T00:55:20.320394Z"},"links":{"citing_paper":"/paper/2508.04181"},"observation_digest":"sha256:43c7728206ef4bd3563f230da002896bf64ddcc87340802c41b9474cd97dbb75","observation_id":"2b6bbd18-ad90-4c93-b1aa-46c05470fa30","resolution":{"observed_at":"2026-08-06T00:55:20.320394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:55:20.463427Z","title":"U-net: Convolutional networks for biomedical image segmentation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.04181","last_updated":"2025-08-06T08:08:04Z","snapshot_observed_at":"2026-08-11T12:54:47.270181Z","submitted_at":"2025-08-06T08:08:04Z","title":"Deeper Inside Deep ViT","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T00:55:20.463427Z"},"links":{"citing_paper":"/paper/2508.04181"},"observation_digest":"sha256:c7e38bd1edc96df31fd00011e457a885d029cfcde1463aa2ca9508e512fafafb","observation_id":"4c35ea16-3187-47c9-b043-fd16e546e1b9","resolution":{"observed_at":"2026-08-06T00:55:20.463427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:55:22.470902Z","title":"Revisiting unreasonable effectiveness of data in deep learning era","venue":null,"work_id":"7a7a4365-ea4a-4888-903a-0660d6e37463","year":2017},"citing_paper":{"arxiv_id":"2508.04181","last_updated":"2025-08-06T08:08:04Z","snapshot_observed_at":"2026-08-11T12:54:47.270181Z","submitted_at":"2025-08-06T08:08:04Z","title":"Deeper Inside Deep ViT","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T00:55:20.565510Z"},"links":{"citing_paper":"/paper/2508.04181"},"observation_digest":"sha256:50cbd37e45f248b1bfd384fe2a86233b54676d19f3500a791518304c3cc2289e","observation_id":"b0782635-139e-4750-a0c0-20320b789cdf","resolution":{"observed_at":"2026-08-06T00:55:22.504731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.08239","last_updated":"2022-02-10T16:30:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-20T15:44:37Z","title":"LaMDA: Language Models for Dialog Applications","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.08239","snapshot_observed_at":"2026-08-06T00:55:20.670264Z","title":"Lamda: Language models for dialog applications","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.04181","last_updated":"2025-08-06T08:08:04Z","snapshot_observed_at":"2026-08-11T12:54:47.270181Z","submitted_at":"2025-08-06T08:08:04Z","title":"Deeper Inside Deep ViT","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T00:55:20.670264Z"},"links":{"cited_paper":"/paper/2201.08239","citing_paper":"/paper/2508.04181"},"observation_digest":"sha256:8832f3a3e571edafa21335e5daba505197ca22d0ab33f77697b3413e26908108","observation_id":"a1214035-30c1-4599-bb67-5c1117dd3ba1","resolution":{"observed_at":"2026-08-06T00:55:20.670264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:55:20.791141Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.04181","last_updated":"2025-08-06T08:08:04Z","snapshot_observed_at":"2026-08-11T12:54:47.270181Z","submitted_at":"2025-08-06T08:08:04Z","title":"Deeper Inside Deep ViT","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T00:55:20.791141Z"},"links":{"citing_paper":"/paper/2508.04181"},"observation_digest":"sha256:264ff9b716c98512dd6fd65ee2c83dd39b7084c6aa25424f4ee3203a57c01283","observation_id":"06a9e207-c09c-46d8-b923-d7710f77a39c","resolution":{"observed_at":"2026-08-06T00:55:20.791141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:55:22.351984Z","title":"Internimage: Exploring large-scale vision foundation models with deformable convolutions","venue":null,"work_id":"63ef4490-3b82-4a15-956d-99d16023695c","year":2023},"citing_paper":{"arxiv_id":"2508.04181","last_updated":"2025-08-06T08:08:04Z","snapshot_observed_at":"2026-08-11T12:54:47.270181Z","submitted_at":"2025-08-06T08:08:04Z","title":"Deeper Inside Deep ViT","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T00:55:20.898458Z"},"links":{"citing_paper":"/paper/2508.04181"},"observation_digest":"sha256:22bd4a9e2b8b701e01052569e35f8425c25cc420b96a1a68815fe0bb8806e4fe","observation_id":"1cccc6d1-1277-40ba-b87f-2668fc5630f5","resolution":{"observed_at":"2026-08-06T00:55:22.415097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:55:22.194256Z","title":"Generative adversarial network in medical imaging: A review","venue":null,"work_id":"e3f15469-dc64-49cb-ab0c-fb6f806bbba6","year":2019},"citing_paper":{"arxiv_id":"2508.04181","last_updated":"2025-08-06T08:08:04Z","snapshot_observed_at":"2026-08-11T12:54:47.270181Z","submitted_at":"2025-08-06T08:08:04Z","title":"Deeper Inside Deep ViT","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T00:55:21.015991Z"},"links":{"citing_paper":"/paper/2508.04181"},"observation_digest":"sha256:2138cd2fbecf89a960e9a2b665c691ef18d0cf84d73088f4838e660ecf4c8e86","observation_id":"f2b1d65f-8e30-4f13-a132-e64a23688d9f","resolution":{"observed_at":"2026-08-06T00:55:22.252362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:55:22.012463Z","title":"Scaling vision transform- ers","venue":null,"work_id":"7b69db21-85f0-4d38-9345-eba5987ff8b9","year":2022},"citing_paper":{"arxiv_id":"2508.04181","last_updated":"2025-08-06T08:08:04Z","snapshot_observed_at":"2026-08-11T12:54:47.270181Z","submitted_at":"2025-08-06T08:08:04Z","title":"Deeper Inside Deep ViT","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T00:55:21.149799Z"},"links":{"citing_paper":"/paper/2508.04181"},"observation_digest":"sha256:2b708901cc9c090f8f58c865fa1893dd15ca0549d593fc571895b90a7d0e5bc0","observation_id":"cf77a910-d2e1-4b42-92c6-fc9dc3cfe06d","resolution":{"observed_at":"2026-08-06T00:55:22.106097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:55:21.838127Z","title":"Unpaired image-to-image translation using cycle-consistent adversarial networks","venue":null,"work_id":"3c59ea91-232c-4f71-bbca-7bae2f4ec0e5","year":2017},"citing_paper":{"arxiv_id":"2508.04181","last_updated":"2025-08-06T08:08:04Z","snapshot_observed_at":"2026-08-11T12:54:47.270181Z","submitted_at":"2025-08-06T08:08:04Z","title":"Deeper Inside Deep ViT","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T00:55:21.245290Z"},"links":{"citing_paper":"/paper/2508.04181"},"observation_digest":"sha256:8b73577338ad320dedefffee5c8b57597d8e887f70adfc4b2ec73fccf1c066c8","observation_id":"b8e52cf8-5959-459d-84a8-1ad36ba0e74c","resolution":{"observed_at":"2026-08-06T00:55:21.909012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.04181","last_updated":"2025-08-06T08:08:04Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T12:54:47.270181Z","submitted_at":"2025-08-06T08:08:04Z","title":"Deeper Inside Deep ViT"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":3,"verified_fuzzy":12},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 0 inbound Pith citation observations for arXiv:2508.04181."}