{"as_of":"2026-08-17T12:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:10c7f491abd2a9a530f2d104b3024717b0e40ec1693020187e3b7549b459cb7e","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T21:28:35.859983Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T05:08:00.711576Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T16:38:40.636427Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"cited_work":{"arxiv_id":"2602.20555","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2602.20555","snapshot_observed_at":"2026-07-29T02:24:15.834827Z","title":"[46]Lai, Y., and Sun, D.Standard transformers achieve the minimax rate in nonparametric regression withC s,λ targets.arXiv e-prints(2026), arXiv:2602.20555","venue":null,"work_id":"88261e55-9bbf-4309-955e-0d77a7905ca9","year":2025},"citing_paper":{"arxiv_id":"2606.13280","last_updated":"2026-06-11T12:34:47Z","snapshot_observed_at":"2026-08-16T19:59:58.219056Z","submitted_at":"2026-06-11T12:34:47Z","title":"Generalization Bounds for Transformer-Based Next-Token Prediction in a Language Model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T05:08:00.711576Z"},"links":{"cited_paper":"/paper/2602.20555","citing_paper":"/paper/2606.13280"},"observation_digest":"sha256:6a7bc79e1946fb4fc7a94b16e00161a13889a4686d53107e9ca97cbf8383aa7c","observation_id":"68c41094-657e-4173-97e4-2c0684c89151","resolution":{"observed_at":"2026-07-29T02:24:15.834827Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2602.20555/citation-record","integrity":"/paper/2602.20555/integrity","json":"/paper/2602.20555/citation-record.json","paper":"/paper/2602.20555"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:27.605327Z","title":"Pearson, 2 edition, 1974","venue":null,"work_id":null,"year":1974},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:27.605327Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:5bd2eba4803ad854397b89cccfb84f1a3acdcecd01843169e023372d4720b807","observation_id":"2e501e7c-54b3-422f-bb71-a1e2a5cf5896","resolution":{"observed_at":"2026-08-02T21:28:27.605327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:27.662144Z","title":"Low-rank bottleneck in multi-head attention models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:27.662144Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:496bc66e25f3921c2889b458af4cdbf1446093f849370c15e239e204ef27432c","observation_id":"2cb93dd9-59ed-4fef-814b-6c73a60efb61","resolution":{"observed_at":"2026-08-02T21:28:27.662144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:27.738468Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:27.738468Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:fc7d4bd227be10f429a466f2cad131a496fa5826b7aff92abfe6a7dc80b34e63","observation_id":"9dcec2f4-ee2f-438d-8a71-8b2b4c50cf3f","resolution":{"observed_at":"2026-08-02T21:28:27.738468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:27.890674Z","title":"A unified framework for establishing the universal approximation of transformer-type architectures","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:27.890674Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:6d3e5eb33af860f0e57f33e57165feeaebe0ea1ca30b781e220eb0b39874e4ab","observation_id":"3a154508-52de-4dab-b3d7-8c63331d65bd","resolution":{"observed_at":"2026-08-02T21:28:27.890674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.15014","last_updated":"2026-05-19T14:33:39Z","snapshot_observed_at":"2026-07-06T22:42:26.083572Z","submitted_at":"2026-01-21T14:13:38Z","title":"Efficient and Minimax Optimal In-context Nonparametric Regression with Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.15014","snapshot_observed_at":"2026-08-02T21:28:28.002565Z","title":"Efficient and minimax-optimal in-context nonparametric regression with transformers.arXiv preprint arXiv:2601.15014, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:28.002565Z"},"links":{"cited_paper":"/paper/2601.15014","citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:c34643b258ffa49e54d2581cc1d4a559a2d68c6559fdcbfbc4bb78a63a741660","observation_id":"0631de7d-335e-43e3-b836-7243964006c8","resolution":{"observed_at":"2026-08-02T21:28:28.002565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:28.198176Z","title":"Bert: Pre- training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:28.198176Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:795f692b1e420bb2a5207c9de19b7d33bceea962eb5b75028de97f0d25846e27","observation_id":"3015893b-4405-4162-b14b-292db3e5d535","resolution":{"observed_at":"2026-08-02T21:28:28.198176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:28.302711Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:28.302711Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:abb98fa423a4b564d607414aaa332f174cf44141bf78bf72b31e2cb810bc2424","observation_id":"74b568fe-6acc-4a49-a4bd-22c86ff064c3","resolution":{"observed_at":"2026-08-02T21:28:28.302711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:28.421735Z","title":"Inductive biases and variable creation in self-attention mechanisms","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:28.421735Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:8d4bef2b5de0304d812137593b1e8bc98b828c9f69161f47e9480d6e07ad9858","observation_id":"8460b952-662f-4668-992d-b767a01fc7ef","resolution":{"observed_at":"2026-08-02T21:28:28.421735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:28.506109Z","title":"How do noise tails impact on deep relu networks?The Annals of Statistics, 52(4):1845–1871, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:28.506109Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:08a26655e5e116d7e88924f3b5ce63615e6f760c3b519cae0b41977b3bac2cea","observation_id":"c42b2c03-6729-453e-b86e-560979d2eaeb","resolution":{"observed_at":"2026-08-02T21:28:28.506109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:28.660201Z","title":"Deep neural networks for esti- mation and inference.Econometrica, 89(1):181–213, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:28.660201Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:64bae643c3c5a11dcc0c8f28819fa15bdbe76851cebd3832ed6d4506b3d18efd","observation_id":"21fca2ad-42cd-474f-8f6e-442a5c6a24a2","resolution":{"observed_at":"2026-08-02T21:28:28.660201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:28.761626Z","title":"Cambridge university press, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:28.761626Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:de86e46a2e0a5ca5ab2a52051d87c9b1b0df807b3310c2d2083ac8e278e7b118","observation_id":"52cf793c-4063-4ea4-a189-cc84f8b183f8","resolution":{"observed_at":"2026-08-02T21:28:28.761626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:28.870976Z","title":"Approximation rates for neural networks with encodable weights in smoothness spaces.Neural Networks, 134:107–130, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:28.870976Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:0fd27d26f40e5eda4b2638474823eac5dbce5ce7da7ada2f5e7d9057904fb3b0","observation_id":"50bfc956-8029-4e2f-9fa0-23f6530e8275","resolution":{"observed_at":"2026-08-02T21:28:28.870976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:28.932299Z","title":"On the rate of convergence of a classifier based on a transformer encoder.IEEE Transactions on Information Theory, 68(12):8139–8155, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:28.932299Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:9e1a5e49d861f2310aad6edfda4a841e441312810b0b5cdd6c533dd09fafde04","observation_id":"bcfbd33e-b72c-4476-9626-f494cb8692e3","resolution":{"observed_at":"2026-08-02T21:28:28.932299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:29.050031Z","title":"Understanding scaling laws with statisti- cal and approximation theory for transformer neural networks on intrinsically low- dimensional data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:29.050031Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:fda545a7f689b3de7cb1378822979e948c95ed672b9bd9e1f649ab02d88517a0","observation_id":"29a4e6c4-1d11-4e20-8767-9cf148ade33f","resolution":{"observed_at":"2026-08-02T21:28:29.050031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:29.159551Z","title":"Minimal width for universal property of deep rnn.Journal of Machine Learning Research, 24(121):1–41, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:29.159551Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:ba9d93382f42754e9e91208f3a40aefd29deb6ee5d9f86f01532b8282fa8a4cb","observation_id":"84ba33a6-a5b1-478a-a558-35c34085ea7d","resolution":{"observed_at":"2026-08-02T21:28:29.159551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:29.291247Z","title":"Universal approximation with softmax attention.arXiv preprint arXiv:2504.15956, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:29.291247Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:1175efda60b62c5275b221fcebeb071cba5b912ca4b781142da65689c23b8a32","observation_id":"59978333-edd3-4ecd-a1e5-d7b4ee9e32ca","resolution":{"observed_at":"2026-08-02T21:28:29.291247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:29.408007Z","title":"Approximation rate of the transformer architecture for sequence modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:29.408007Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:59b7a239276dda9f9e0a29a2f430d6ee5b8634ffa2851468c2bc3ea892a756cb","observation_id":"a1ac003f-e4f8-457f-a66e-5c90c914d2ce","resolution":{"observed_at":"2026-08-02T21:28:29.408007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12175","last_updated":"2025-04-16T15:25:58Z","snapshot_observed_at":"2026-08-16T12:33:47.169289Z","submitted_at":"2025-04-16T15:25:58Z","title":"Approximation Bounds for Transformer Networks with Application to Regression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12175","snapshot_observed_at":"2026-08-02T21:28:29.502605Z","title":"Approxima- tion bounds for transformer networks with application to regression.arXiv preprint arXiv:2504.12175, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:29.502605Z"},"links":{"cited_paper":"/paper/2504.12175","citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:fb1b73e82eaaf82904152b277f675749060ee9b5ceb8c7da6d267d4d86ff00bf","observation_id":"4ae2c7f0-c677-4dca-b5c1-d7f38b197cb3","resolution":{"observed_at":"2026-08-02T21:28:29.502605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13558","last_updated":"2025-04-18T08:56:53Z","snapshot_observed_at":"2026-08-16T12:03:40.481807Z","submitted_at":"2025-04-18T08:56:53Z","title":"Transformers Can Overcome the Curse of Dimensionality: A Theoretical Study from an Approximation Perspective","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13558","snapshot_observed_at":"2026-08-02T21:28:29.665918Z","title":"Transformers can overcome the curse of dimensionality: A theoretical study from an approximation perspective","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:29.665918Z"},"links":{"cited_paper":"/paper/2504.13558","citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:00525fb6fcdfb9849c83b9ac01ce69bfc10f0d13ccb261069376c25e0c9f05ef","observation_id":"53c04e93-8632-4176-9f9f-cd0403ff7dca","resolution":{"observed_at":"2026-08-02T21:28:29.665918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:29.779421Z","title":"Deep nonparametric regression on approximate manifolds: Nonasymptotic error bounds with polynomial prefactors.The Annals of Statistics, 51(2):691–716, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:29.779421Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:2ccfaf5c30656947c07dd86409b11d536213b96e391d7916bedc3fa58de12ebf","observation_id":"edb1e354-523b-40eb-93c1-43e29e926da5","resolution":{"observed_at":"2026-08-02T21:28:29.779421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:29.879046Z","title":"Approximation bounds for recurrent neural networks with application to regression.arXiv preprint arXiv:2409.05577, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:29.879046Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:d5ea53be2200f1b218dc99a093461c681f43f57533367022d6b6e36564489280","observation_id":"4a49078c-b132-492e-a8b4-c2e8951e1e92","resolution":{"observed_at":"2026-08-02T21:28:29.879046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:30.030422Z","title":"Are transformers with one layer self-attention using low-rank weight matrices universal approximators? InThe Twelfth International Conference on Learning Representations, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:30.030422Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:6d8abdd9b838f4690485210495d45eb8c610bcb1c99d4af9bd2871985a120424","observation_id":"03d88569-eff9-45f2-9fd9-c2b44b11131b","resolution":{"observed_at":"2026-08-02T21:28:30.030422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:30.176620Z","title":"On the optimal memorization capacity of trans- formers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:30.176620Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:bcb78aa6407ac7b144b3e0fb72c887c2a18c42fd7ac949947fb6efd6c5ddcbd8","observation_id":"5781e412-70e1-47c4-9cbf-75993ee51e79","resolution":{"observed_at":"2026-08-02T21:28:30.176620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:30.303270Z","title":"The lipschitz constant of self-attention","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:30.303270Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:f5273ca25dc1dc4078716734ac7c008b0058facf2b9be7d78a4a6af6a15acf59","observation_id":"b82921ca-47a1-4901-b929-5422a6d5df4a","resolution":{"observed_at":"2026-08-02T21:28:30.303270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:30.429646Z","title":"Provable memorization capac- ity of transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:30.429646Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:7f0e3cd8bf89323a98bb851783d20636d2b1b913a777f5ed136e1d408e51358e","observation_id":"650bce6b-9287-4c58-9aca-20b450104f33","resolution":{"observed_at":"2026-08-02T21:28:30.429646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:30.607066Z","title":"Transformers are minimax optimal non- parametric in-context learners","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:30.607066Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:96a05d714299e679cdb364d8b08ca26fb99f72bf3b8ef81ce7943ba5b155d225","observation_id":"3e335400-d249-410d-a1f5-27555456dd6b","resolution":{"observed_at":"2026-08-02T21:28:30.607066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:30.744229Z","title":"On the rate of convergence of fully connected deep neural network regression estimates.The Annals of Statistics, 49(4):2231–2249, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:30.744229Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:0490fea8426f7351bd722e6465bd7cd3bc3d9df1ca1f50d4315c943f0d2e42c9","observation_id":"4f45b3b4-d6e9-4c0e-8bb9-0d60c0de16be","resolution":{"observed_at":"2026-08-02T21:28:30.744229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:30.872899Z","title":"Univer- sal approximation under constraints is possible with transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:30.872899Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:aa22494fb3bb0cfe3cc3d6c5feffac3e29d617056a662d59df33078ad86417de","observation_id":"b668f606-30f5-4b2e-ae07-52c39ce70c3f","resolution":{"observed_at":"2026-08-02T21:28:30.872899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:31.044785Z","title":"Approximation and optimization theory for linear continuous-time recurrent neural networks.Journal of Machine Learning Research, 23(42):1–85, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:31.044785Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:ff2274d2e907f426eea8c7f0d7f0b9a9c4e72e06aa4418b50240917c01986e3a","observation_id":"260ffc38-d2a9-45d3-ae22-ae304c2de87f","resolution":{"observed_at":"2026-08-02T21:28:31.044785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:31.160241Z","title":"Generalization analysis of transformers in distribu- tion regression.Neural Computation, 37(2):260–293, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:31.160241Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:ba100b53903a68ca54a08f05954144b9c696a87b9c3847e1cc51696fa2d9b162","observation_id":"bda47ccb-5703-41b4-b655-844792366c2d","resolution":{"observed_at":"2026-08-02T21:28:31.160241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:31.326706Z","title":"Deep network approxi- mation for smooth functions.SIAM Journal on Mathematical Analysis, 53(5):5465– 5506, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:31.326706Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:f8e8d7fa21c561e3e99e94190ee0a3df06b5a84440ed54a3764f155641225496","observation_id":"108ea5fe-2b55-4c77-9472-2eaa21ea1ebd","resolution":{"observed_at":"2026-08-02T21:28:31.326706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:31.429497Z","title":"Upper and lower memory capacity bounds of transformers for next- token prediction.arXiv preprint arXiv:2405.13718, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:31.429497Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:3cb4cdfb15ba5ed410db7fc2debddd151b673977fcb1edfba37f6f52a05086df","observation_id":"5839742c-0e87-4728-bc4d-4e84d1d4e510","resolution":{"observed_at":"2026-08-02T21:28:31.429497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:31.589919Z","title":"Memorization capacity of multi-head attention in transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:31.589919Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:fcfac4578aa97e66bd18247b4033527cf91472756ec822bde08d52ff5fa9a102","observation_id":"251460d0-5f51-4561-9b09-e150acfe6811","resolution":{"observed_at":"2026-08-02T21:28:31.589919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:31.739676Z","title":"Rates of approximation by relu shallow neural networks.Journal of Complexity, 79:101784, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:31.739676Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:80f04e1bcb1f1c31f0de06d4e28386d6a438fcf8418d8d373af9cd78291ef338","observation_id":"5c1cf47c-8ded-4184-bbb6-c2965444c604","resolution":{"observed_at":"2026-08-02T21:28:31.739676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:31.921512Z","title":"Adaptive approximation and generalization of deep neural network with intrinsic dimensionality.Journal of Machine Learning Research, 21(174):1–38, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:31.921512Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:a60995bc6bcad222a64f63d706a9bd378642ba8f390d7a1866f38a239f98da02","observation_id":"cf525ea2-cadb-48a4-95e8-8298ca2ab187","resolution":{"observed_at":"2026-08-02T21:28:31.921512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:32.126644Z","title":"Provable memorization via deep neural networks using sub-linear parameters","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:32.126644Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:f4cf6cd6f69851d0788cb37b105e475c04dd9a51d84986a3b712f615662fc58b","observation_id":"43b61371-d162-4bca-97b7-97550f2f9e86","resolution":{"observed_at":"2026-08-02T21:28:32.126644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:32.361578Z","title":"Equivalence of approximation by convolu- tional neural networks and fully-connected networks.Proceedings of the American Mathematical Society, 148(4):1567–1581, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:32.361578Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:65f0090d6fa6875fa97a6f39a83edae02a2e79d51159e902b654b085a5953ac4","observation_id":"742af754-03ef-4462-9503-40a2cfa02e69","resolution":{"observed_at":"2026-08-02T21:28:32.361578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:32.551226Z","title":"Representational strengths and limitations of transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:32.551226Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:6e122311ff9d5db80e73eb67dc28f03e30611ab13d1a01946a852a792b9b01ca","observation_id":"d868eeef-7558-442d-b0dc-6b00fee595bd","resolution":{"observed_at":"2026-08-02T21:28:32.551226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:32.650600Z","title":"Nonparametric regression using deep neural net- works with relu activation function.Annals of statistics, 48(4):1875–1897, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:32.650600Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:527f02ccf02e4213c168b2ca459b7b7ed01e9f146c49896f7eeb1590b0fd5d77","observation_id":"7eb5b0ad-7a9a-465e-a2b1-a5decf1adfa0","resolution":{"observed_at":"2026-08-02T21:28:32.650600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:32.770414Z","title":"The kolmogorov–arnold representation theorem revisited","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:32.770414Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:10dc9c0a29a579cd87631f0ebece103b222085df3f0d4e295a7e09aae8a22cc1","observation_id":"dacd7337-14ac-4d67-9a69-ff3c8d659772","resolution":{"observed_at":"2026-08-02T21:28:32.770414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:32.935975Z","title":"Understanding in- context learning on structured manifolds: Bridging attention to kernel methods","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:32.935975Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:e5cc2925b7bc6653e7c228f7efd23e1e470d277c144b1443ed86e4a2c8f7b868","observation_id":"de14478b-5b9a-48a7-8353-971145ea79f6","resolution":{"observed_at":"2026-08-02T21:28:32.935975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:33.054527Z","title":"Deep network approximation char- acterized by number of neurons.Communications in Computational Physics, 28(5), 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:33.054527Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:cfcb01227d3fa048b695dbbfe4588f1aa2a1386373ea1c27b08f1b8ba4e051d3","observation_id":"1bf983f1-d5f5-433a-a9ec-1c0b5da649fa","resolution":{"observed_at":"2026-08-02T21:28:33.054527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:33.200221Z","title":"Optimal approximation rate of relu networks in terms of width and depth.Journal de Math´ ematiques Pures et Appliqu´ ees, 157:101–135, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:33.200221Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:b0327ade5eefb68d29fefdf635b776e364518d96373eae9dff4ca3c26366a732","observation_id":"d17c58a7-8caf-4b31-9793-6dd6a74c6613","resolution":{"observed_at":"2026-08-02T21:28:33.200221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:33.378677Z","title":"Optimal approximation rates for deep relu neural networks on sobolev and besov spaces.Journal of Machine Learning Research, 24(357):1–52, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:33.378677Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:c5c5b0cc53a39bd3a793d1925d0f51b49a4e2747b602efa051a3599ccac61631","observation_id":"e4e39434-fbd4-46d0-a726-e7376d1f7765","resolution":{"observed_at":"2026-08-02T21:28:33.378677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:33.503352Z","title":"Optimal rates of convergence for nonparametric estimators.The annals of Statistics, pages 1348–1360, 1980","venue":null,"work_id":null,"year":1980},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:33.503352Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:f505ea344148c7f5b40cfe208738950a0cf0a8406e102a5faa5d50163ef7fcba","observation_id":"73080394-9a7f-4dec-bd37-0cb148359b01","resolution":{"observed_at":"2026-08-02T21:28:33.503352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:33.641883Z","title":"Adaptivity of deep reLU network for learning in besov and mixed smooth besov spaces: optimal rate and curse of dimensionality","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:33.641883Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:4e1e3aaa49a562d24dd204269756d53267ed440a1e4a9aa0bd26b11574c46e7c","observation_id":"0dcf055d-49fd-40e5-87b4-b8361a039fd6","resolution":{"observed_at":"2026-08-02T21:28:33.641883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:33.794727Z","title":"Approximation and estimation ability of trans- formers for sequence-to-sequence functions with infinite dimensional input","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:33.794727Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:648b57c48385f1a097e137280dfdb818dec0533a4885236a52d33a4c5b6ad189","observation_id":"d7ad0ad1-320c-4f5a-96d9-0591b72e1610","resolution":{"observed_at":"2026-08-02T21:28:33.794727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11467","last_updated":"2025-02-17T05:56:11Z","snapshot_observed_at":"2026-08-16T12:57:52.298500Z","submitted_at":"2025-02-17T05:56:11Z","title":"Approximation of Permutation Invariant Polynomials by Transformers: Efficient Construction in Column-Size","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11467","snapshot_observed_at":"2026-08-02T21:28:33.955158Z","title":"Approximation of permutation invariant polynomials by transformers: Efficient construction in column-size.arXiv preprint arXiv:2502.11467, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:33.955158Z"},"links":{"cited_paper":"/paper/2502.11467","citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:f230a34e028066a83a155114eac5095ec98c31c2d5ba1aaf940ffb5e5944eee9","observation_id":"ec702a1a-f943-401f-8d3b-7efa7b87a55f","resolution":{"observed_at":"2026-08-02T21:28:33.955158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:34.094329Z","title":"Weak convergence","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:34.094329Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:4d33fe0764c771029f4f0b5e300d1609c2a84f39a28ca695591b611bde751ca0","observation_id":"83aa814b-aab6-44a8-9754-a959086b241a","resolution":{"observed_at":"2026-08-02T21:28:34.094329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:34.244520Z","title":"On the optimal memorization power of reLU neural networks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:34.244520Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:6529584c5116ed18cdefceeda4ca9d54783ddd3e8725e9654db997eb309d2e35","observation_id":"99685651-1abc-433d-86a7-2760e342b9b3","resolution":{"observed_at":"2026-08-02T21:28:34.244520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:34.372655Z","title":"Attention is all you need.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:34.372655Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:f203a91e98853c61cbe90ae5189b58237fccc0d018e8d3050bc19db7be76ee29","observation_id":"89b4f471-10f4-4ce3-9e09-92b1fd3deeec","resolution":{"observed_at":"2026-08-02T21:28:34.372655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:34.546484Z","title":"Prompt tuning transformers for data memorization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:34.546484Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:f8de720af3cfb96267d74013d27ab5ac801c0311d81a4d73f248b60df0da6cc3","observation_id":"56d032e3-a846-4c70-a37c-2f027e3cdcb7","resolution":{"observed_at":"2026-08-02T21:28:34.546484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:34.685239Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:34.685239Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:c15cb932fb19a0311dd1683a0c6bb1b88ec816307b91dabb30b6aea163b82492","observation_id":"c22ce1a9-de37-476e-9d5d-3a8213da738f","resolution":{"observed_at":"2026-08-02T21:28:34.685239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:34.856079Z","title":"Statistically meaningful approximation: a case study on approximating turing machines with transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:34.856079Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:3c182dc647c203fdfbe95d564811bd0de321acb04339a664dc29184462f97ee4","observation_id":"f2100755-2050-4fab-b5ba-e3c77e50f39b","resolution":{"observed_at":"2026-08-02T21:28:34.856079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00901","last_updated":"2025-07-18T13:39:44Z","snapshot_observed_at":"2026-08-16T13:22:14.154496Z","submitted_at":"2024-09-02T02:26:01Z","title":"On the optimal approximation of Sobolev and Besov functions using deep ReLU neural networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00901","snapshot_observed_at":"2026-08-02T21:28:34.968470Z","title":"On the optimal approximation of sobolev and besov functions using deep relu neural networks.arXiv preprint arXiv:2409.00901, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:34.968470Z"},"links":{"cited_paper":"/paper/2409.00901","citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:40ad28ee66d15909095ececaf74ebeabbfe92149aa78689aed8222aea3255985","observation_id":"986e253b-7c69-4463-8e21-357e00d1a999","resolution":{"observed_at":"2026-08-02T21:28:34.968470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:35.048382Z","title":"Nonparametric regression using over- parameterized shallow relu neural networks.Journal of Machine Learning Research, 25(165):1–35, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:35.048382Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:3618c4c75c7193b60f8dc1f090d81b3cfcbe18f0a23830132a06540ca02e4512","observation_id":"14739f9b-4530-47ab-b1cb-451be7a90070","resolution":{"observed_at":"2026-08-02T21:28:35.048382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:35.137363Z","title":"Error bounds for approximations with deep relu networks.Neural networks, 94:103–114, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:35.137363Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:ba39f5c134b4b5176ee8ccea0f0826f27ad92eedbda979be1d01bd8c054e6adc","observation_id":"f319b704-d617-4bd8-85bb-28ec3cf8b13d","resolution":{"observed_at":"2026-08-02T21:28:35.137363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:35.306182Z","title":"Optimal approximation of continuous functions by very deep relu networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:35.306182Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:2ce9f18ac3b1991fbcf8c178104547582bc85e55bffe9ad8b68e51993a5aebf1","observation_id":"f64b5c00-4260-436c-9af7-3131b2b60151","resolution":{"observed_at":"2026-08-02T21:28:35.306182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:35.487880Z","title":"Are transformers universal approximators of sequence-to-sequence func- tions? InInternational Conference on Learning Representations, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:35.487880Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:5d499e7df68dc9e7f917c09e43b0b4fcb354c4d3f3ca5909be566a07599b3cbb","observation_id":"e94b9401-45af-4c6b-8d36-f462d85f6de9","resolution":{"observed_at":"2026-08-02T21:28:35.487880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:35.601184Z","title":"O (n) connections are expressive enough: Universal approximability of sparse transformers.Advances in Neural Information Processing Systems, 33:13783–13794, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:35.601184Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:230d32ad20c0901f2bf0b38714b1c9c30b0274906f796606c48c0a48e857e5ac","observation_id":"ce2b942a-2dfd-40b5-8197-b5f2af50374d","resolution":{"observed_at":"2026-08-02T21:28:35.601184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:35.721401Z","title":"Theory of deep convolutional neural networks: Downsampling","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:35.721401Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:b640acbeda2fa9b6a739218c76e0ba68e9ffd46bd1a9aac44d3c9306a017f710","observation_id":"4ac02717-490a-42a6-bc5b-d1643ab170dc","resolution":{"observed_at":"2026-08-02T21:28:35.721401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:28:35.859983Z","title":"Universality of deep convolutional neural networks.Applied and computational harmonic analysis, 48(2):787–794, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-02T21:28:35.859983Z"},"links":{"citing_paper":"/paper/2602.20555"},"observation_digest":"sha256:94270a899eb056b405fe31ed34f802ad4990b0702e8ddeca85b2dbba1e7b8bd1","observation_id":"89d356a7-abf0-415b-bbb9-5f6fefffdbca","resolution":{"observed_at":"2026-08-02T21:28:35.859983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.20555","last_updated":"2026-07-28T04:45:18Z","latest_version":2,"primary_category":"stat.ML","snapshot_observed_at":"2026-08-16T10:54:23.387763Z","submitted_at":"2026-02-24T05:14:01Z","title":"Standard Transformers Achieve the Minimax Rate in Nonparametric Regression with $C^{s,\\lambda}$ Targets"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":62,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 1 inbound Pith citation observation for arXiv:2602.20555."}