{"as_of":"2026-08-22T22:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e3599564f920e2a378aa6b87e2f0b5ef6c730b5c2819093dc981024700af9dbc","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:53:13.305354Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.20802/citation-record","integrity":"/paper/2505.20802/integrity","json":"/paper/2505.20802/citation-record.json","paper":"/paper/2505.20802"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:19.234630Z","title":"A deep conditioning treatment of neural networks","venue":null,"work_id":"d983e446-a7fd-4fa5-af4d-d6644320f476","year":2021},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-19T18:19:55.773100Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:09.034328Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:0fbad11e6bb61c3b333687ca029173fc20533b3337094d6fc25977f8d9d6e723","observation_id":"aa05ce8e-8208-4cdb-91a9-9f0d85dfee56","resolution":{"observed_at":"2026-08-07T13:53:19.425180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:18.941376Z","title":"Xcit: Cross-covariance image transformers","venue":null,"work_id":"1ca0987e-75eb-4d3e-a3a1-61e82b9abafb","year":2021},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-19T18:19:55.773100Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:09.162406Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:7920540d22a98b4ede7afdebdf89d479394fbfae6121a0edb0d58b914b89918e","observation_id":"01750a21-676d-4050-b7cd-1a2ce70de4ec","resolution":{"observed_at":"2026-08-07T13:53:19.156179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:18.810801Z","title":"On the op- timization of deep networks: Implicit acceleration by over- parameterization","venue":null,"work_id":"5c38f693-c0db-48e3-aa97-4e03860fc9f4","year":2018},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-19T18:19:55.773100Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:09.316954Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:08a8b20658a7a38f72b2b09f7a35e81a46e757ed415d7e62a8c20b94e3f3e3a3","observation_id":"622a335c-181c-42a2-be4b-66791f259c5f","resolution":{"observed_at":"2026-08-07T13:53:18.867260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:09.459325Z","title":"End-to- end object detection with transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-19T18:19:55.773100Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:09.459325Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:b51b95772842a7d26ec75f4e1351d43440efe6f353fb93d3662e93944f50a2e0","observation_id":"3d4441ca-1002-4665-9104-6606be01699b","resolution":{"observed_at":"2026-08-07T13:53:09.459325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:18.615808Z","title":"Rethinking attention with performers","venue":null,"work_id":"2ba90e82-c9bd-4ab2-ad4b-dcfd8f05cf20","year":2021},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-19T18:19:55.773100Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:09.561350Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:3e9bf11dfc6322d6e2120de4adc87e3ba66233d05a87540bf3e445ed0534032e","observation_id":"832261df-1c02-4e3d-9e0e-6dc5476c78b7","resolution":{"observed_at":"2026-08-07T13:53:18.721286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-07T13:53:09.658901Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-19T18:19:55.773100Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:09.658901Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:4ebf45c1b127d5cdb96f88d900a74d4e8bd4e04a2c50a06025a968bfe058ddd8","observation_id":"a1419588-3169-40f8-ad3a-796f240d693b","resolution":{"observed_at":"2026-08-07T13:53:09.658901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:18.445447Z","title":"Davit: Dual attention vision transform- ers","venue":null,"work_id":"0923d357-0455-4ea2-9658-a5368d1e31aa","year":null},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-19T18:19:55.773100Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:09.807743Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:6ced441cdd4f60bfbf7873286b6ee04b52e448887eaab8b0a6aa583a4d4ec04d","observation_id":"980b9ea1-4735-4fe4-986c-45f30d8d05f2","resolution":{"observed_at":"2026-08-07T13:53:18.551570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T13:53:09.946194Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-19T18:19:55.773100Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:09.946194Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:18131cca7fea63ddbe01c1cd21cf307382fa43e20d84208763fb465ae2dac360","observation_id":"93c57150-92b7-43bf-bdaf-4e2adab4804a","resolution":{"observed_at":"2026-08-07T13:53:09.946194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07759","last_updated":"2023-05-24T23:30:43Z","snapshot_observed_at":"2026-08-20T14:47:29.320021Z","submitted_at":"2023-05-12T20:56:48Z","title":"TinyStories: How Small Can Language Models Be and Still Speak Coherent English?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07759","snapshot_observed_at":"2026-08-07T13:53:10.115483Z","title":"Tinystories: How small can language models be and still speak coherent english? arXiv preprint arXiv:2305.07759, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-19T18:19:55.773100Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:10.115483Z"},"links":{"cited_paper":"/paper/2305.07759","citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:9524c8bd9a35462c0e4773afcf5ac70ed8a1c2d9794be4298edd7919741761f1","observation_id":"ef95e9bf-f52e-4ea4-ad23-0d8c634941a0","resolution":{"observed_at":"2026-08-07T13:53:10.115483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:18.250236Z","title":"Drive like a human: Rethinking au- tonomous driving with large language models","venue":null,"work_id":"2c899247-01a7-442c-a84d-a1c8660166e6","year":2024},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-19T18:19:55.773100Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:10.232092Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:2f4aa59d3a90bed6bb11637b213f89a4847a6dc9af32fd3f8da993cc19a7202c","observation_id":"c2f8fbce-d0ed-46bb-ae0b-cc288c2dc65a","resolution":{"observed_at":"2026-08-07T13:53:18.332722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-07T13:53:10.351485Z","title":"The pile: An 800gb dataset of diverse text for language modeling","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-19T18:19:55.773100Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:10.351485Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:5f9719c88f4842388017f2f78bd13be622c58b67bf1ab1fe21239f4ed8ae169e","observation_id":"4076683d-2bb3-46c1-844a-813c4778f542","resolution":{"observed_at":"2026-08-07T13:53:10.351485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:18.112368Z","title":"Cramming","venue":null,"work_id":"f280df47-c519-4786-ae03-a0f5ba55f09c","year":2023},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-19T18:19:55.773100Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:10.468447Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:43ce8f61c9147c3bdb9ea159905ada32015ca96b520091160865f6eab7b542c0","observation_id":"94949c45-019d-4f6a-8097-fccfe740ac80","resolution":{"observed_at":"2026-08-07T13:53:18.181276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:17.898555Z","title":"Cramming: Training a language model on a single gpu in one day","venue":null,"work_id":"47e389e4-b94d-4588-b6ce-fd8d0e435e87","year":2023},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-19T18:19:55.773100Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:10.536029Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:11285ad7ca8d9695737921897e71b841dac84aec2385dbfb5be74a6492d3072a","observation_id":"8122e36f-47df-4a41-b51d-88980b3c09d1","resolution":{"observed_at":"2026-08-07T13:53:18.003646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:10.628588Z","title":"Transformer in transformer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-19T18:19:55.773100Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:10.628588Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:7be9638d571f7a2b28bd555a415282ac33d304e5c8208a05f8c6d43174a63779","observation_id":"d44dec49-3d12-4736-8a91-3f0a003c6f62","resolution":{"observed_at":"2026-08-07T13:53:10.628588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:17.599863Z","title":"Neu- ral tangent kernel: Convergence and generalization in neural networks","venue":null,"work_id":"c73a90c6-ebff-45f7-8192-2b6f71ac9527","year":2018},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-19T18:19:55.773100Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:10.710054Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:33f62d5dd79c1418c4db6ff38facb85355a184de52ae86c3bc45f3aa063cb043","observation_id":"a817ca96-d9b8-4b60-b04e-993a1772915f","resolution":{"observed_at":"2026-08-07T13:53:17.755706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:17.474516Z","title":"On the size of convolutional neural networks and generalization per- formance","venue":null,"work_id":"dc98d1d5-bc2d-4fb0-8c2c-4f3850a5241b","year":2016},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-19T18:19:55.773100Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:10.798388Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:4521b4486d2b4ae455d1b8c55816d804b864b8f087a6de0457d96809d6063b72","observation_id":"d4433458-c758-451a-b672-a7cd124caa67","resolution":{"observed_at":"2026-08-07T13:53:17.540790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:17.244596Z","title":"Re- former: The efficient transformer","venue":null,"work_id":"5840b252-a36a-4d73-9777-a436c50f914f","year":2020},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-19T18:19:55.773100Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:10.880408Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:7a82187aa25aaf1dfe66e5600ca09ac333c16249f92b9990c8d3778615a3c4fa","observation_id":"28f6b77f-0022-4929-9d0e-ccb0d27f4a67","resolution":{"observed_at":"2026-08-07T13:53:17.374388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.12467","last_updated":"2021-01-17T18:17:31Z","snapshot_observed_at":"2026-08-12T00:50:54.021191Z","submitted_at":"2020-06-22T17:47:09Z","title":"The Depth-to-Width Interplay in Self-Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.12467","snapshot_observed_at":"2026-08-07T13:53:10.980819Z","title":"The depth-to-width interplay in self-attention","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-19T18:19:55.773100Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:10.980819Z"},"links":{"cited_paper":"/paper/2006.12467","citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:8691cbb74fe5e21e60057a50c36d184748f8eb50d8e4687cbccdf804e53da7a8","observation_id":"8c440c53-4fd6-4377-88bc-30bded8e3cc9","resolution":{"observed_at":"2026-08-07T13:53:10.980819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:17.075755Z","title":"Limits to depth efficiencies of self-attention","venue":null,"work_id":"fabc809f-5788-4280-bfbf-5cde0264328b","year":2020},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-19T18:19:55.773100Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:11.067802Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:c6b4669fcd6ff9618c52059b27cd9f9653f01820f658196b938a9e94741c5022","observation_id":"a4656912-f2d7-4c95-9724-11c96f5988fe","resolution":{"observed_at":"2026-08-07T13:53:17.164882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.05159","last_updated":"2019-07-03T18:24:09Z","snapshot_observed_at":"2026-08-14T19:04:06.706414Z","submitted_at":"2018-06-13T17:35:55Z","title":"On Tighter Generalization Bound for Deep Neural Networks: CNNs, ResNets, and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.05159","snapshot_observed_at":"2026-08-07T13:53:11.154002Z","title":"On tighter generalization bound for deep neu- ral networks: Cnns, resnets, and beyond","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-19T18:19:55.773100Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:11.154002Z"},"links":{"cited_paper":"/paper/1806.05159","citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:3778bc1aef245ed001608bab75c927ab31cb3c93711c446364985d2b491b225b","observation_id":"8bcb3d35-6155-4a67-adfa-a7f17636c20f","resolution":{"observed_at":"2026-08-07T13:53:11.154002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:16.786416Z","title":"Loss land- scapes and optimization in over-parameterized non-linear systems and neural networks","venue":null,"work_id":"5ecb9e66-6770-43c2-8435-ec7977616196","year":2022},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-19T18:19:55.773100Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:11.267568Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:6d9eb1b2878ec2718a2f1bef1e342a4166ead689f35a8d881e2b28292473929b","observation_id":"424b5107-c515-41ca-ab89-a6e7104cf9e4","resolution":{"observed_at":"2026-08-07T13:53:16.915596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:11.348724Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-19T18:19:55.773100Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:11.348724Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:463d434d682cdba61fe9315c01cb907bbd21fef703bb2e355ad22e849b0b34b2","observation_id":"4b3b603c-76cd-40f3-89ff-27477b4cdb5b","resolution":{"observed_at":"2026-08-07T13:53:11.348724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:16.646067Z","title":"The expressive power of neural networks: A view from the width","venue":null,"work_id":"dc480205-3666-402a-8ef3-dc43cdea7fbc","year":2017},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-19T18:19:55.773100Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:11.438467Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:3e5e9221cf7b19ff5c81d3f43b491785da1101e11a672606d8749b4fb18a8ac9","observation_id":"ed0b4e89-b93e-4d38-b190-339e79bcc449","resolution":{"observed_at":"2026-08-07T13:53:16.716353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:16.491549Z","title":"Transfusion: Multi-modal fusion network for semantic segmentation","venue":null,"work_id":"773d65a5-754f-4597-b08b-87a82b70f209","year":2023},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-19T18:19:55.773100Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:11.544733Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:6246f7c3a8a787097d5bf283fcdef3f93c303b356083c033d83bf2ec9a5ef3ef","observation_id":"721e7453-42f3-4eeb-9e84-7b01e24dea3b","resolution":{"observed_at":"2026-08-07T13:53:16.571609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:16.361037Z","title":"Numerical optimiza- tion","venue":null,"work_id":"1da95a27-df14-4686-8e79-64468ea172ae","year":1999},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-19T18:19:55.773100Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:11.625386Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:6d849acefd65f27687956c998e1060a4c1a95373e42993e0265573e6f4ae181c","observation_id":"8bf7a85e-954d-44b9-934e-6add32e88502","resolution":{"observed_at":"2026-08-07T13:53:16.426135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:16.188455Z","title":"The impact of depth and width on transformer language model generalization","venue":null,"work_id":"50652a9a-f775-4461-bbf7-15ba1d875c08","year":2023},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-19T18:19:55.773100Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:11.758211Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:d153f2f611ba7007ee22827193a5badd64fabf0af163ed7d94ce316c35827b76","observation_id":"afafbf8c-2619-4c9a-be87-d9271319f90d","resolution":{"observed_at":"2026-08-07T13:53:16.267841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:16.031784Z","title":"Exponential expressivity in deep neural networks through transient chaos","venue":null,"work_id":"04dedb0a-053c-4df9-adda-ed900aa2f3be","year":2016},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-19T18:19:55.773100Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:11.859104Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:e737c019de08cfe4339dc897102d2424cda6b506699dd3240eaaa17ce776b733","observation_id":"fc66014d-698a-487f-b293-a4faf56edf7e","resolution":{"observed_at":"2026-08-07T13:53:16.130245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:15.844592Z","title":"Tiny-stories-gpt","venue":null,"work_id":"d5d3d360-7f58-4a1b-bc65-07b50d237a19","year":null},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-19T18:19:55.773100Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:11.950438Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:e50e4f1023621d9c192768bc5792cb9c78e12e6c292493899d1403f094649b9b","observation_id":"adb98fdc-43f3-4d81-bbe6-48334022aafa","resolution":{"observed_at":"2026-08-07T13:53:15.929889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.03093","last_updated":"2021-01-13T18:53:02Z","snapshot_observed_at":"2026-08-20T18:18:41.505139Z","submitted_at":"2020-01-09T16:47:17Z","title":"Trajectron++: Dynamically-Feasible Trajectory Forecasting With Heterogeneous Data","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.03093","snapshot_observed_at":"2026-08-07T13:53:12.040288Z","title":"Trajectron++: Multi-agent generative trajec- 10 tory forecasting with heterogeneous data for control","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-19T18:19:55.773100Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:12.040288Z"},"links":{"cited_paper":"/paper/2001.03093","citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:97a34ea6c04e113497dad1bb390538e161f221b7bad9bf252e7e1d5275b28d4c","observation_id":"4e46a6c6-03c5-4f7f-a075-8794bc32805f","resolution":{"observed_at":"2026-08-07T13:53:12.040288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:15.710639Z","title":"Representational strengths and limitations of transformers","venue":null,"work_id":"4a10ebfd-f9a4-47f9-a2c8-f63ade47ba4d","year":2023},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-19T18:19:55.773100Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:12.116907Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:9bfc94b280e788b39121510f0b9b2a644bf3a85d4cb3d4138f2cfcd55cb1bc17","observation_id":"43510b91-c664-4914-85d7-8c226607df28","resolution":{"observed_at":"2026-08-07T13:53:15.767405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:15.537025Z","title":"Real analysis: measure theory, integration, and Hilbert spaces","venue":null,"work_id":"938b7a30-340d-4a0e-b231-59878ba8e92c","year":2009},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-19T18:19:55.773100Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:12.186595Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:a8339624f21ce5009c9f3b7d1c748ccaa116b80b00d798651813300e1d4ce9af","observation_id":"1985930e-d536-4375-a2b6-5680575faf4e","resolution":{"observed_at":"2026-08-07T13:53:15.626931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.10270","last_updated":"2022-06-23T10:51:04Z","snapshot_observed_at":"2026-08-19T18:18:44.284335Z","submitted_at":"2021-06-18T17:58:20Z","title":"How to train your ViT? Data, Augmentation, and Regularization in Vision Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.10270","snapshot_observed_at":"2026-08-07T13:53:12.281412Z","title":"How to train your vit? data, augmentation, and regularization in vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-19T18:19:55.773100Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:12.281412Z"},"links":{"cited_paper":"/paper/2106.10270","citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:a77135ea02be7dd7b78fe3f9d908f76f89d06d5d28d02ff70159ca2b9d3c8997","observation_id":"764911ee-d831-4bb5-84c0-49aa58cfe182","resolution":{"observed_at":"2026-08-07T13:53:12.281412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.04006","last_updated":"2020-11-08T15:53:56Z","snapshot_observed_at":"2026-08-20T00:13:57.716002Z","submitted_at":"2020-11-08T15:53:56Z","title":"Long Range Arena: A Benchmark for Efficient Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.04006","snapshot_observed_at":"2026-08-07T13:53:12.361815Z","title":"Long range arena: A benchmark for efficient transformers","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-19T18:19:55.773100Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:12.361815Z"},"links":{"cited_paper":"/paper/2011.04006","citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:78a2ea142de91247c823e8298f5eddcb8f0d58d91bd5f23d24ff8d57906551b0","observation_id":"31d27f5e-ddd2-4935-8e67-82d97cfd151a","resolution":{"observed_at":"2026-08-07T13:53:12.361815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:15.255047Z","title":"Training data-efficient image transformers & distillation through at- tention","venue":null,"work_id":"cd8e3f66-19e5-41c5-8f83-9ef3b3f23fe5","year":2021},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-19T18:19:55.773100Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:12.442508Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:3c285e89c316737811695bcbe45afa7a50cc14433fc35d030ce1dddf2c7d43e2","observation_id":"36dc04fe-54e3-4747-b9aa-194264362edc","resolution":{"observed_at":"2026-08-07T13:53:15.394585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:15.045559Z","title":"Width is less important than depth in relu neural networks","venue":null,"work_id":"76014207-14af-4a54-9cb5-ef34deec3b7e","year":2022},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-19T18:19:55.773100Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:12.535662Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:202ab1aa86ad96f142618865625b513bd16a3f4d82da6f6cc10cff96d92e7e43","observation_id":"5849d952-ba2b-4f5b-be49-8e315ee16638","resolution":{"observed_at":"2026-08-07T13:53:15.177550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:14.792122Z","title":"Attention is all you need","venue":null,"work_id":"fc2039df-2ab6-406b-9f95-93af380515b3","year":2017},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-19T18:19:55.773100Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:12.619327Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:1ac88dc64e6f7c183c1c88a0ade2a937421a0e8bd48e8180547bd41dd19be586","observation_id":"4244fd36-db2f-401f-9ad1-5a334b7590c3","resolution":{"observed_at":"2026-08-07T13:53:14.854796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:14.611369Z","title":"High-dimensional probability: An intro- duction with applications in data science","venue":null,"work_id":"be376f72-c2ac-456b-9d21-6409e614538a","year":2018},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-19T18:19:55.773100Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:12.713775Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:ef9e7312232b0e4ccd864d267a1c77392a4415423d0bd5d5530b861f169a58ef","observation_id":"80c06c48-fc80-4a8e-8931-33c6daf085a9","resolution":{"observed_at":"2026-08-07T13:53:14.720110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.07461","last_updated":"2019-02-22T23:53:34Z","snapshot_observed_at":"2026-08-16T09:50:11.319379Z","submitted_at":"2018-04-20T06:35:04Z","title":"GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.07461","snapshot_observed_at":"2026-08-07T13:53:12.781563Z","title":"Glue: A multi-task benchmark and analysis platform for natural language un- derstanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-19T18:19:55.773100Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:12.781563Z"},"links":{"cited_paper":"/paper/1804.07461","citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:721ed2e8a1ddd122fabea3194b4e714fbca2c023893a6db9c5bc0ea1d21afc8c","observation_id":"27206a34-a8a9-450f-aa85-cd59e28c352d","resolution":{"observed_at":"2026-08-07T13:53:12.781563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:14.434946Z","title":"Linformer: Self-attention with linear complex- ity","venue":null,"work_id":"ef51a5c1-adce-4673-bd6f-25dae18d94b9","year":2020},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-19T18:19:55.773100Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:12.836097Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:2b0fb45d8b3c4afbdb476ebd940ddb86d303c2d655b4d727eb9b9ecb9a7c713b","observation_id":"1b162034-64cc-4bd9-bcea-25ad16772ef1","resolution":{"observed_at":"2026-08-07T13:53:14.514716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:14.243349Z","title":"Github repository, 2021","venue":null,"work_id":"f9d1fe96-5d18-4138-9e1a-f39cc8c30312","year":2021},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-19T18:19:55.773100Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:12.907534Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:759ec461b947194c50c79dca4114d4ed649ba77c1fca0fb4dc340b5fac2e586b","observation_id":"d50ddb4e-77f8-4be6-9e21-843ccd74a516","resolution":{"observed_at":"2026-08-07T13:53:14.325590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:14.091400Z","title":"Nystr¨omformer: A nystr¨om-based algorithm for approximat- ing self-attention","venue":null,"work_id":"3ef4c218-8733-452c-9e28-e8e3e1025fef","year":2021},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-19T18:19:55.773100Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:12.982547Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:5f3fd63696597f8250b70bb976f1e8ffdf4af894a875a1db062a25a85e317849","observation_id":"80d8fcc6-bb68-4c83-986a-3ff2466558af","resolution":{"observed_at":"2026-08-07T13:53:14.156866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:13.937034Z","title":"V olo: Vision outlooker for visual recog- nition","venue":null,"work_id":"2641cb60-cb49-44e0-b176-19fd535f47b8","year":2022},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-19T18:19:55.773100Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:13.044588Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:d52eb4dd3cb6237b90ae5fa824d4037c8550a52beafe46e8e7fd76756663ccd7","observation_id":"622798dd-8cab-497c-95d4-262d39936b60","resolution":{"observed_at":"2026-08-07T13:53:14.014039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:13.771630Z","title":"cosformer: rethinking softmax in attention","venue":null,"work_id":"7819dc6b-1b44-4242-9bb8-0c12cd704e93","year":null},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-19T18:19:55.773100Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:13.118002Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:2be93ddf40eeaf289f088371d012c73da451dd2bb4830bc15ba37b7e8b36e619","observation_id":"73f1affc-3c99-4491-a8f3-2d1395b2a604","resolution":{"observed_at":"2026-08-07T13:53:13.848094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:13.608260Z","title":"Understanding generalization and optimization performance of deep cnns","venue":null,"work_id":"0e22456a-9596-41e0-8989-537d1a136507","year":null},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-19T18:19:55.773100Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:13.197390Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:e9e6236b7f436c78538d8edc1c58ffba1146839d8839549ab5c5253087f7e5f4","observation_id":"2d421d34-2722-4ebe-b59a-3ee49888125a","resolution":{"observed_at":"2026-08-07T13:53:13.683260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:13.474085Z","title":"A robustly optimized bert pre-training approach with post-training","venue":null,"work_id":"34bb4927-4958-4676-b20b-52aa13cb3f46","year":2021},"citing_paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","snapshot_observed_at":"2026-08-19T18:19:55.773100Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:13.305354Z"},"links":{"citing_paper":"/paper/2505.20802"},"observation_digest":"sha256:40f1f61b2bc29c42ad5c1a2b2597eb3bf992d9a9e0d2aff804b7d6b71676cc50","observation_id":"edd4c23a-d92b-4435-82b4-51a4a181152e","resolution":{"observed_at":"2026-08-07T13:53:13.523878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.20802","last_updated":"2025-05-27T07:06:54Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-19T18:19:55.773100Z","submitted_at":"2025-05-27T07:06:54Z","title":"Leaner Transformers: More Heads, Less Depth"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":32},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2505.20802."}