{"as_of":"2026-08-09T23:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:65f9f0453d870d64b74584ec647552c9962a7852700e51649d1cb729b8634f04","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T16:39:14.303264Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T10:20:15.278868Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T23:04:16.374748Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06167","snapshot_observed_at":"2026-08-08T10:20:15.278868Z","title":"Universal approximation of visual autoregressive transformers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.08150","last_updated":"2025-02-12T06:30:01Z","snapshot_observed_at":"2026-08-09T01:42:36.516995Z","submitted_at":"2025-02-12T06:30:01Z","title":"Force Matching with Relativistic Constraints: A Physics-Inspired Approach to Stable and Efficient Generative Modeling","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T10:20:15.278868Z"},"links":{"cited_paper":"/paper/2502.06167","citing_paper":"/paper/2502.08150"},"observation_digest":"sha256:b445706208bae587159b77396d5f467ce2f41511c3e96652362abbc5a3b93fff","observation_id":"eb76f657-67b6-45ff-9970-12ae899ad648","resolution":{"observed_at":"2026-08-08T10:20:15.278868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06167","snapshot_observed_at":"2026-08-07T12:06:22.588160Z","title":"Universal approximation of visual autoregressive transformers.arXiv preprint arXiv:2502.06167, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00577","last_updated":"2025-05-31T14:22:40Z","snapshot_observed_at":"2026-08-07T22:33:33.136985Z","submitted_at":"2025-05-31T14:22:40Z","title":"Reasoning Like an Economist: Post-Training on Economic Problems Induces Strategic Generalization in LLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:22.588160Z"},"links":{"cited_paper":"/paper/2502.06167","citing_paper":"/paper/2506.00577"},"observation_digest":"sha256:4a06aa80204ac97bcc7d0b01aa3493c6f3d5ee4393f3a01907192f87929c75c3","observation_id":"23407aeb-deec-4e61-8efd-6ab0c3408842","resolution":{"observed_at":"2026-08-07T12:06:22.588160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"cited_work":{"arxiv_id":"2502.06167","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.06167","snapshot_observed_at":"2026-08-06T23:04:16.374748Z","title":"Universal Approximation of Visual Autoregressive Transformers","venue":"cs.LG","work_id":"e8eab62e-9af7-432d-ac5f-a4fa1541ff12","year":2025},"citing_paper":{"arxiv_id":"2506.19993","last_updated":"2025-06-24T20:27:51Z","snapshot_observed_at":"2026-08-06T22:56:54.915714Z","submitted_at":"2025-06-24T20:27:51Z","title":"CoVE: Compressed Vocabulary Expansion Makes Better LLM-based Recommender Systems","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T23:04:13.934538Z"},"links":{"cited_paper":"/paper/2502.06167","citing_paper":"/paper/2506.19993"},"observation_digest":"sha256:41847abbc0da79e3740bbed33bb12d565e88c028e54e34c56330b0490768c885","observation_id":"eee48c05-6f22-43cb-be7f-df588d52bafb","resolution":{"observed_at":"2026-08-06T23:04:16.383219Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.06167/citation-record","integrity":"/paper/2502.06167/integrity","json":"/paper/2502.06167/citation-record.json","paper":"/paper/2502.06167"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.09982","last_updated":"2025-02-02T23:53:56Z","snapshot_observed_at":"2026-07-06T20:22:19.281265Z","submitted_at":"2025-01-17T06:46:10Z","title":"RichSpace: Enriching Text-to-Video Prompt Space via Text Embedding Interpolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09982","snapshot_observed_at":"2026-08-08T16:39:14.102914Z","title":"Richspace: Enriching text-to-video prompt space via text embedding interpolation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.102914Z"},"links":{"cited_paper":"/paper/2501.09982","citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:681a57cc8177cfa99f3bac1190d7d456e6dc932ac7f323a3d13d8465046fffac","observation_id":"44cc05e8-0514-405d-8d27-d2bd8c75f280","resolution":{"observed_at":"2026-08-08T16:39:14.102914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:39:14.110826Z","title":"Fast gradient computation for rope attention in almost linear time","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.110826Z"},"links":{"citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:60bcf4be1a26450599912cb1d0c3cd2e37b2409fb0678fd8cb3870dc54045b8e","observation_id":"fc652b63-2a36-45fb-b3ca-3b7615ad3b15","resolution":{"observed_at":"2026-08-08T16:39:14.110826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11268","last_updated":"2025-02-28T22:12:33Z","snapshot_observed_at":"2026-07-06T19:33:34.819837Z","submitted_at":"2024-10-15T04:44:23Z","title":"Bypassing the Exponential Dependency: Looped Transformers Efficiently Learn In-context by Multi-step Gradient Descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11268","snapshot_observed_at":"2026-08-08T16:39:14.118607Z","title":"Bypassing the exponential dependency: Looped transformers efficiently learn in-context by multi- step gradient descent","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.118607Z"},"links":{"cited_paper":"/paper/2410.11268","citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:19ba20a1391c46538173f73ff169d2009437b87c5a8e8ad1f718c352eb8da481","observation_id":"476ef222-2196-4878-8eec-db59a372e755","resolution":{"observed_at":"2026-08-08T16:39:14.118607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06148","last_updated":"2025-02-20T18:38:08Z","snapshot_observed_at":"2026-07-06T20:03:38.451641Z","submitted_at":"2024-12-09T02:01:18Z","title":"The Computational Limits of State-Space Models and Mamba via the Lens of Circuit Complexity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06148","snapshot_observed_at":"2026-08-08T16:39:14.122328Z","title":"The compu- tational limits of state-space models and mamba via the lens of circuit complexity","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.122328Z"},"links":{"cited_paper":"/paper/2412.06148","citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:950f09b49bb5cc6da7ef4efe2c6654a5bcf2e6c27f8b33be35c546591d330dd0","observation_id":"0b2ff850-b1c5-4df3-9ceb-d36b54960654","resolution":{"observed_at":"2026-08-08T16:39:14.122328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00690","last_updated":"2025-02-02T06:29:23Z","snapshot_observed_at":"2026-08-09T18:02:28.305584Z","submitted_at":"2025-02-02T06:29:23Z","title":"Dissecting Submission Limit in Desk-Rejections: A Mathematical Analysis of Fairness in AI Conference Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.00690","snapshot_observed_at":"2026-08-08T16:39:14.126215Z","title":"Dissecting submission limit in desk-rejections: A mathematical analysis of fairness in ai conference policies","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.126215Z"},"links":{"cited_paper":"/paper/2502.00690","citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:aafa2d9857e4f0ff5882a9fb486fedf413cf98a183c9b00f1769c5b58ad920da","observation_id":"92b3210b-cac9-4e6d-9844-9e637ef80506","resolution":{"observed_at":"2026-08-08T16:39:14.126215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10165","last_updated":"2025-02-24T08:42:25Z","snapshot_observed_at":"2026-07-06T19:32:51.287674Z","submitted_at":"2024-10-14T05:18:02Z","title":"HSR-Enhanced Sparse Attention Acceleration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10165","snapshot_observed_at":"2026-08-08T16:39:14.129545Z","title":"Hsr-enhanced sparse attention acceleration","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.129545Z"},"links":{"cited_paper":"/paper/2410.10165","citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:9846b888926ce2d8f0cb7e56523a32d410ee1298d4db8c6bbd369e4dac27e1c7","observation_id":"1cd1b651-399a-431f-86d5-f3f0e1ff5463","resolution":{"observed_at":"2026-08-08T16:39:14.129545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:39:15.159400Z","title":"Zero-th order al- gorithm for softmax attention optimization","venue":null,"work_id":"08d49826-71f0-495d-9e72-838601eb2a52","year":2024},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.136527Z"},"links":{"citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:a9fc7fa531c94469e33c47b8ca8723d6bacdd3858348705530182bf2a8b4c150","observation_id":"a70f39a2-f4db-4a78-a1b3-fadf8c156e54","resolution":{"observed_at":"2026-08-08T16:39:15.162810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.04397","last_updated":"2023-04-10T05:52:38Z","snapshot_observed_at":"2026-08-09T20:08:03.600500Z","submitted_at":"2023-04-10T05:52:38Z","title":"Randomized and Deterministic Attention Sparsification Algorithms for Over-parameterized Feature Dimension","version":1},"cited_work":{"arxiv_id":"2304.04397","doi":null,"metadata_source":"pith","pith_arxiv_id":"2304.04397","snapshot_observed_at":"2026-08-08T16:39:14.986902Z","title":"Randomized and Deterministic Attention Sparsification Algorithms for Over-parameterized Feature Dimension","venue":"cs.DS","work_id":"ea10e451-c279-42d6-919c-cd2bf68ad148","year":2023},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.140101Z"},"links":{"cited_paper":"/paper/2304.04397","citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:598c0efa1d2c5765d937898fc1154c0c6be41b5f297da6a7168a5d8a0b33a8ac","observation_id":"33fa3999-0ae4-4d1f-908c-86b291b3d7fe","resolution":{"observed_at":"2026-08-08T16:39:14.990458Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.08361","last_updated":"2022-10-15T19:20:17Z","snapshot_observed_at":"2026-07-06T14:06:05.716505Z","submitted_at":"2022-10-15T19:20:17Z","title":"A Nearly Optimal Size Coreset Algorithm with Nearly Linear Time","version":1},"cited_work":{"arxiv_id":"2210.08361","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.08361","snapshot_observed_at":"2026-08-08T16:39:14.974243Z","title":"A Nearly Optimal Size Coreset Algorithm with Nearly Linear Time","venue":"cs.DS","work_id":"10e2d538-ebfd-45ec-b95c-e7eb5176bf13","year":2022},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.143481Z"},"links":{"cited_paper":"/paper/2210.08361","citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:6c81dc7a7a9fbbfadd6c31546cc9e0c0a2eaf7b2e6f86d18e8dd97363a572825","observation_id":"f829d95a-b79e-4995-9e19-6ef4d4489e0b","resolution":{"observed_at":"2026-08-08T16:39:14.977884Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00406","last_updated":"2023-06-01T07:12:00Z","snapshot_observed_at":"2026-08-05T08:31:53.334547Z","submitted_at":"2023-06-01T07:12:00Z","title":"Faster Robust Tensor Power Method for Arbitrary Order","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00406","snapshot_observed_at":"2026-08-08T16:39:14.146711Z","title":"Faster robust tensor power method for arbitrary order","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.146711Z"},"links":{"cited_paper":"/paper/2306.00406","citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:694954f4404ee3d745926f70814eb7fd5bcba80e9cfab341d09fcbd3206f68d8","observation_id":"45a08f1f-0a95-4241-afe6-76e2d069d4cb","resolution":{"observed_at":"2026-08-08T16:39:14.146711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07418","last_updated":"2023-09-14T04:23:40Z","snapshot_observed_at":"2026-07-06T16:18:17.458740Z","submitted_at":"2023-09-14T04:23:40Z","title":"A Fast Optimization View: Reformulating Single Layer Attention in LLM Based on Tensor and SVM Trick, and Solving It in Matrix Multiplication Time","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07418","snapshot_observed_at":"2026-08-08T16:39:14.153603Z","title":"A fast optimization view: Reformulating single layer attention in llm based on tensor and svm trick, and solving it in matrix multiplication time","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.153603Z"},"links":{"cited_paper":"/paper/2309.07418","citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:766139d5b98b8dfed3caeb77ad7e421e6e3836a79b89a41b370089918da825d4","observation_id":"b608b22e-dbe5-4319-80d7-cc00511d4b8e","resolution":{"observed_at":"2026-08-08T16:39:14.153603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02419","last_updated":"2023-07-05T16:41:01Z","snapshot_observed_at":"2026-07-06T15:50:41.385379Z","submitted_at":"2023-07-05T16:41:01Z","title":"In-Context Learning for Attention Scheme: from Single Softmax Regression to Multiple Softmax Regression via a Tensor Trick","version":1},"cited_work":{"arxiv_id":"2307.02419","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.02419","snapshot_observed_at":"2026-08-08T16:39:14.936638Z","title":"In-Context Learning for Attention Scheme: from Single Softmax Regression to Multiple Softmax Regression via a Tensor Trick","venue":"cs.LG","work_id":"435c0e74-97e9-4871-86a3-a98cb103f1a8","year":2023},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.156738Z"},"links":{"cited_paper":"/paper/2307.02419","citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:3e5fee1f2bc4a750fc1151c9f1cbeabf34d96bd4fd822afbb4027c82a441e567","observation_id":"72cedb37-6c8c-48d4-b318-4d843522144a","resolution":{"observed_at":"2026-08-08T16:39:14.940334Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10502","last_updated":"2023-08-21T06:42:42Z","snapshot_observed_at":"2026-08-03T22:32:54.396932Z","submitted_at":"2023-08-21T06:42:42Z","title":"GradientCoin: A Peer-to-Peer Decentralized Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.10502","snapshot_observed_at":"2026-08-08T16:39:14.160047Z","title":"Gradientcoin: A peer-to-peer decentralized large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.160047Z"},"links":{"cited_paper":"/paper/2308.10502","citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:976c8af35f953e2d527e334337b5122b1d85b8c445081d4f0e31bf5a94ae3bf6","observation_id":"af2b8ea2-78cb-40df-8b10-1c0024be4b05","resolution":{"observed_at":"2026-08-08T16:39:14.160047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.00660","last_updated":"2025-02-17T05:12:27Z","snapshot_observed_at":"2026-07-06T15:21:46.324091Z","submitted_at":"2023-05-01T05:16:07Z","title":"An Iterative Algorithm for Rescaled Hyperbolic Functions Regression","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.00660","snapshot_observed_at":"2026-08-08T16:39:14.163177Z","title":"An iterative algorithm for rescaled hyperbolic functions regression","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.163177Z"},"links":{"cited_paper":"/paper/2305.00660","citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:f098141dc541a8d24a82800f83ef093ce980a7170bcf334741bfa655ee22eef9","observation_id":"0b3a8da4-4b8c-4c64-8347-a1d7e46f6b47","resolution":{"observed_at":"2026-08-08T16:39:14.163177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03136","last_updated":"2025-06-06T05:22:09Z","snapshot_observed_at":"2026-08-09T16:41:02.249057Z","submitted_at":"2024-06-05T10:44:08Z","title":"Computational Limits of Low-Rank Adaptation (LoRA) Fine-Tuning for Transformer Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03136","snapshot_observed_at":"2026-08-08T16:39:14.166379Z","title":"Com- putational limits of low-rank adaptation (lora) for transformer-based models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.166379Z"},"links":{"cited_paper":"/paper/2406.03136","citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:99d8a8d93f87912659b545be3ddce7fd07d23fe6ee42e59c6dabab78c3dbfb34","observation_id":"20ee9adc-18df-482c-818c-d553dd484eb8","resolution":{"observed_at":"2026-08-08T16:39:14.166379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.11877","last_updated":"2024-02-06T03:14:09Z","snapshot_observed_at":"2026-07-06T10:17:17.444191Z","submitted_at":"2020-11-24T03:41:03Z","title":"InstaHide's Sample Complexity When Mixing Two Private Images","version":2},"cited_work":{"arxiv_id":"2011.11877","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.11877","snapshot_observed_at":"2026-08-08T16:39:14.897277Z","title":"InstaHide's Sample Complexity When Mixing Two Private Images","venue":"cs.LG","work_id":"8e57b36f-3416-420e-8b20-a1358288d3e3","year":2020},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.169510Z"},"links":{"cited_paper":"/paper/2011.11877","citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:cd011fc3647f7c7af6aeb703f249b1c55cf00f089b461fa2dccdff9a9ff94bdc","observation_id":"78f10811-1925-4147-a2b8-418f88578697","resolution":{"observed_at":"2026-08-08T16:39:14.901351Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.12329","last_updated":"2024-02-06T03:21:25Z","snapshot_observed_at":"2026-08-09T05:00:40.357108Z","submitted_at":"2022-02-24T19:33:58Z","title":"A Dynamic Low-Rank Fast Gaussian Transform","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.12329","snapshot_observed_at":"2026-08-08T16:39:14.176085Z","title":"A dynamic fast gaussian transform","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.176085Z"},"links":{"cited_paper":"/paper/2202.12329","citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:d18d2876c62867fcf2372ebceef014ffe97fc336d05a480115358129a8cdd50d","observation_id":"b938ae5e-9130-41a7-82ca-138bc0e9be88","resolution":{"observed_at":"2026-08-08T16:39:14.176085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16525","last_updated":"2025-06-05T23:04:39Z","snapshot_observed_at":"2026-07-06T19:56:39.115630Z","submitted_at":"2024-11-25T16:12:17Z","title":"Fundamental Limits of Prompt Tuning Transformers: Universality, Capacity and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16525","snapshot_observed_at":"2026-08-08T16:39:14.179374Z","title":"Fundamental limits of prompt tuning transformers: Universality, capacity and efficiency","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.179374Z"},"links":{"cited_paper":"/paper/2411.16525","citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:d6f6195791a28a0bd3fb9ae8096dc6054c5e85dd6e55cefdd9d56822b61a7ef9","observation_id":"f4b2a72f-3a03-4ee5-b9ed-06a00ebbe1dc","resolution":{"observed_at":"2026-08-08T16:39:14.179374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17522","last_updated":"2024-11-26T15:30:48Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T15:30:48Z","title":"On Statistical Rates of Conditional Diffusion Transformers: Approximation, Estimation and Minimax Optimality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17522","snapshot_observed_at":"2026-08-08T16:39:14.182527Z","title":"On statistical rates of conditional diffusion transformers: Approximation, estimation and minimax optimality","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.182527Z"},"links":{"cited_paper":"/paper/2411.17522","citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:b026bdbe5485697cc7e50aa43bb57747929274c5a933e4be6306ec9524cd459d","observation_id":"0c04f6a3-8bb7-4efe-aefc-5b39dcb53049","resolution":{"observed_at":"2026-08-08T16:39:14.182527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01079","last_updated":"2024-10-31T16:59:13Z","snapshot_observed_at":"2026-08-09T10:17:58.792913Z","submitted_at":"2024-07-01T08:34:40Z","title":"On Statistical Rates and Provably Efficient Criteria of Latent Diffusion Transformers (DiTs)","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01079","snapshot_observed_at":"2026-08-08T16:39:14.185973Z","title":"On statistical rates and provably efficient criteria of latent diffusion transformers (dits)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.185973Z"},"links":{"cited_paper":"/paper/2407.01079","citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:7c4194f011ca35c88903b9a05f026841f94562f33728fa050ccf9d78b430dbd3","observation_id":"6351d552-0607-431c-a452-a21b490704e0","resolution":{"observed_at":"2026-08-08T16:39:14.185973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18475","last_updated":"2025-01-02T05:02:48Z","snapshot_observed_at":"2026-08-08T05:44:48.404466Z","submitted_at":"2023-05-29T10:56:36Z","title":"Approximation Rate of the Transformer Architecture for Sequence Modeling","version":4},"cited_work":{"arxiv_id":"2305.18475","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.18475","snapshot_observed_at":"2026-08-08T16:39:14.837247Z","title":"Approximation Rate of the Transformer Architecture for Sequence Modeling","venue":"cs.LG","work_id":"516cecc4-2cd7-4f8c-9b19-12634e2c7377","year":2023},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.189143Z"},"links":{"cited_paper":"/paper/2305.18475","citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:0dd40bec8f6ce807b7784cf2abd15146ccb6d70b4dc4282c1efc1b09ace43561","observation_id":"b36bf190-766c-49b6-ab38-15d0126110a4","resolution":{"observed_at":"2026-08-08T16:39:14.841073Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04377","last_updated":"2025-02-02T23:48:36Z","snapshot_observed_at":"2026-07-06T20:18:07.618215Z","submitted_at":"2025-01-08T09:34:15Z","title":"On Computational Limits and Provably Efficient Criteria of Visual Autoregressive Models: A Fine-Grained Complexity Analysis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04377","snapshot_observed_at":"2026-08-08T16:39:14.192253Z","title":"On computational limits and provably efficient criteria of visual autoregressive models: A fine grained complexity analysis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.192253Z"},"links":{"cited_paper":"/paper/2501.04377","citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:716e4bddeb31127ba3ab8058fcb2610aed3ea76f3a292de3929bea6e0f639bbe","observation_id":"9bbd61db-9cfe-4124-aedd-fae90abb8a3f","resolution":{"observed_at":"2026-08-08T16:39:14.192253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04299","last_updated":"2025-01-08T06:07:33Z","snapshot_observed_at":"2026-07-06T20:18:03.181364Z","submitted_at":"2025-01-08T06:07:33Z","title":"Circuit Complexity Bounds for Visual Autoregressive Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04299","snapshot_observed_at":"2026-08-08T16:39:14.195490Z","title":"Circuit complexity bounds for visual autoregressive model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.195490Z"},"links":{"cited_paper":"/paper/2501.04299","citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:50a42b5e5041aaf807710838f8cc20ee68714812b6a54c5fc81d38048ced89dc","observation_id":"38e644f0-c408-416f-b060-c5eb52bde7e6","resolution":{"observed_at":"2026-08-08T16:39:14.195490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:39:15.150268Z","title":"Faster sampling algorithms for polytopes with small treewidth","venue":null,"work_id":"a4f93590-e8ff-4f46-84c3-033c272be4f8","year":2024},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.198513Z"},"links":{"citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:5de167336d98203586edb7032a3dbb2e8e074fdcfe0939cf333511ee07fbd85f","observation_id":"7fc97e72-02bc-4130-8811-99e165941d5a","resolution":{"observed_at":"2026-08-08T16:39:15.153607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:39:14.201641Z","title":"Neural algorithmic reasoning for hypergraphs with looped transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.201641Z"},"links":{"citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:7c7c3dbfe621cacab7334d64c1b0a4be4e930fe65c66627eb67c54e11737a76b","observation_id":"2d83a417-b17f-4d5a-aa1f-bd41ac960945","resolution":{"observed_at":"2026-08-08T16:39:14.201641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18040","last_updated":"2024-12-23T23:26:07Z","snapshot_observed_at":"2026-08-07T22:05:08.185583Z","submitted_at":"2024-12-23T23:26:07Z","title":"Theoretical Constraints on the Expressive Power of $\\mathsf{RoPE}$-based Tensor Attention Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18040","snapshot_observed_at":"2026-08-08T16:39:14.204933Z","title":"Theoreti- cal constraints on the expressive power of rope-based tensor attention transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.204933Z"},"links":{"cited_paper":"/paper/2412.18040","citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:ff540a8bc46590d0dc9d9f8a508380518e13364ce14bcfa777dbcadaa5fbbf38","observation_id":"94be64d9-d901-45e9-86a1-a3485c324626","resolution":{"observed_at":"2026-08-08T16:39:14.204933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05219","last_updated":"2024-10-16T06:55:47Z","snapshot_observed_at":"2026-07-06T18:11:38.755996Z","submitted_at":"2024-05-08T17:11:38Z","title":"Conv-Basis: A New Paradigm for Efficient Attention Inference and Gradient Computation in Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05219","snapshot_observed_at":"2026-08-08T16:39:14.208216Z","title":"Conv-basis: A new paradigm for efficient attention inference and gradient computation in trans- formers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.208216Z"},"links":{"cited_paper":"/paper/2405.05219","citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:de7e45dfe52939ca1b2b4ac78b3ed31faeaa6cf1d97eb3ea51a928ac7a5077be","observation_id":"395c5ba0-28fd-4287-8bdf-1e4fdb2c4124","resolution":{"observed_at":"2026-08-08T16:39:14.208216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11261","last_updated":"2025-02-26T18:44:29Z","snapshot_observed_at":"2026-07-06T19:33:34.819837Z","submitted_at":"2024-10-15T04:35:56Z","title":"Beyond Linear Approximations: A Novel Pruning Approach for Attention Matrix","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11261","snapshot_observed_at":"2026-08-08T16:39:14.211419Z","title":"Beyond linear approximations: A novel pruning approach for attention matrix.arXiv preprint arXiv:2410.11261,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.211419Z"},"links":{"cited_paper":"/paper/2410.11261","citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:d4107f158cdb6edc9478e642045c9461eb0a61f1729aa95bd291aabb6fad14df","observation_id":"b202b886-7f38-4158-a517-0a9045b4ddff","resolution":{"observed_at":"2026-08-08T16:39:14.211419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06444","last_updated":"2025-01-11T05:54:10Z","snapshot_observed_at":"2026-07-06T20:19:36.202156Z","submitted_at":"2025-01-11T05:54:10Z","title":"On the Computational Capability of Graph Neural Networks: A Circuit Complexity Bound Perspective","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06444","snapshot_observed_at":"2026-08-08T16:39:14.214668Z","title":"On the computational capability of graph neural networks: A circuit complexity bound perspective","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.214668Z"},"links":{"cited_paper":"/paper/2501.06444","citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:d0e02c1f07a130ff73d64f812a95d3250858f342572feafae548f0c116a62c4d","observation_id":"1ebc143a-4690-4b2d-8d98-764c8624b273","resolution":{"observed_at":"2026-08-08T16:39:14.214668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12151","last_updated":"2024-10-18T03:36:03Z","snapshot_observed_at":"2026-08-09T17:26:15.959147Z","submitted_at":"2024-08-22T06:40:32Z","title":"A Tighter Complexity Analysis of SparseGPT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12151","snapshot_observed_at":"2026-08-08T16:39:14.218063Z","title":"A tighter complexity analysis of sparsegpt","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.218063Z"},"links":{"cited_paper":"/paper/2408.12151","citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:3f80bfa7a127cdbd879299b8f2d93fe6d8757220babf51cd068df710a2aea356","observation_id":"f816a0f7-fdc7-481b-8c16-48e05711d445","resolution":{"observed_at":"2026-08-08T16:39:14.218063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:39:15.140524Z","title":"Fast second-order method for neural networks under small treewidth setting","venue":null,"work_id":"507341dc-5328-4438-b29b-9a2ab2772f1b","year":2024},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.221488Z"},"links":{"citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:d2d7c7e27ab7da43c4eb23f4b315d586e984316a3fee404a2c4b7749332986e6","observation_id":"00fc7b02-0070-4ae4-bb21-d8ddfe46b62f","resolution":{"observed_at":"2026-08-08T16:39:15.144277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12711","last_updated":"2024-10-31T08:13:36Z","snapshot_observed_at":"2026-08-06T00:12:52.926949Z","submitted_at":"2024-02-20T04:21:13Z","title":"Uniform Last-Iterate Guarantee for Bandits and Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2402.12711","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.12711","snapshot_observed_at":"2026-08-08T16:39:14.701274Z","title":"Uniform Last-Iterate Guarantee for Bandits and Reinforcement Learning","venue":"cs.LG","work_id":"7d51d485-b82b-4e07-9e69-cb331e028c37","year":2024},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.224936Z"},"links":{"cited_paper":"/paper/2402.12711","citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:771944da31b9ba8db81f618188bc603b96016f0fc775b33f7fa05fde168d899b","observation_id":"91d679ac-5095-4548-b05a-20f2f411e750","resolution":{"observed_at":"2026-08-08T16:39:14.704978Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.15118","last_updated":"2024-02-13T19:39:48Z","snapshot_observed_at":"2026-07-06T14:23:43.235725Z","submitted_at":"2022-11-28T08:17:12Z","title":"A Faster $k$-means++ Algorithm","version":2},"cited_work":{"arxiv_id":"2211.15118","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.15118","snapshot_observed_at":"2026-08-08T16:39:14.688156Z","title":"A Faster $k$-means++ Algorithm","venue":"cs.DS","work_id":"d84d272d-0e23-43f7-bd3d-e94bd88878e5","year":2022},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.228597Z"},"links":{"cited_paper":"/paper/2211.15118","citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:8298bd2a72d253239e55b63be4749ba5c71eba9e26d9d44eff6fc253adeb23f2","observation_id":"f6fc0e1a-8f9e-4c25-a3ac-c4b8aec322a1","resolution":{"observed_at":"2026-08-08T16:39:14.691586Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09375","last_updated":"2025-02-20T10:24:53Z","snapshot_observed_at":"2026-08-09T18:03:24.702047Z","submitted_at":"2024-10-12T05:54:17Z","title":"Looped ReLU MLPs May Be All You Need as Practical Programmable Computers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09375","snapshot_observed_at":"2026-08-08T16:39:14.232338Z","title":"Looped relu mlps may be all you need as practical programmable computers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.232338Z"},"links":{"cited_paper":"/paper/2410.09375","citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:aaee95b76cd1f1ce9c7632d9a98298134cff8b7e913f18a9514394a2f04b8b26","observation_id":"f6d0ff3a-b7c0-413e-a6ca-65fa0d4c7983","resolution":{"observed_at":"2026-08-08T16:39:14.232338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13233","last_updated":"2024-10-15T04:11:19Z","snapshot_observed_at":"2026-07-06T19:05:14.227812Z","submitted_at":"2024-08-23T17:16:43Z","title":"Multi-Layer Transformers Gradient Can be Approximated in Almost Linear Time","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13233","snapshot_observed_at":"2026-08-08T16:39:14.235842Z","title":"Multi-layer transformers gradient can be approximated in almost linear time","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.235842Z"},"links":{"cited_paper":"/paper/2408.13233","citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:bf066ebb67548cb7ef609f23af66c94ed2dd4a0e7178409451e9584eb0eb9fe3","observation_id":"c3f26e8f-2dc7-4dea-8940-3ad8ebe86040","resolution":{"observed_at":"2026-08-08T16:39:14.235842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13621","last_updated":"2024-11-02T05:30:20Z","snapshot_observed_at":"2026-08-04T10:32:09.349940Z","submitted_at":"2024-07-18T15:57:55Z","title":"Differential Privacy Mechanisms in Neural Tangent Kernel Regression","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13621","snapshot_observed_at":"2026-08-08T16:39:14.238952Z","title":"Differential privacy mech- anisms in neural tangent kernel regression","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.238952Z"},"links":{"cited_paper":"/paper/2407.13621","citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:e02e3604928a2e42b92e93ef07a4f26c6f0dff06cb80136b9336e78cca2c80bf","observation_id":"0591ad0e-f80d-4344-9bee-c587e94d0325","resolution":{"observed_at":"2026-08-08T16:39:14.238952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:39:14.242269Z","title":"Differential privacy of cross-attention with provable guarantee","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.242269Z"},"links":{"citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:d6fa902ecb1bb07c9e9aa24a70109a3353a24efc85ff19dc198f6769afa057cd","observation_id":"17d63df3-3a53-4196-99da-1b614df8fa4f","resolution":{"observed_at":"2026-08-08T16:39:14.242269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:39:14.245220Z","title":"Tensor attention train- ing: Provably efficient learning of higher-order transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.245220Z"},"links":{"citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:24759641e6a9a1c94a567cc84aab5109eeb52452b88dc67bc3e81f64b43d3098","observation_id":"93ab4276-55cf-4701-b536-3559e9989922","resolution":{"observed_at":"2026-08-08T16:39:14.245220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13785","last_updated":"2024-04-21T21:36:42Z","snapshot_observed_at":"2026-07-06T18:03:24.368197Z","submitted_at":"2024-04-21T21:36:42Z","title":"How to Inverting the Leverage Score Distribution?","version":1},"cited_work":{"arxiv_id":"2404.13785","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13785","snapshot_observed_at":"2026-08-08T16:39:14.489879Z","title":"How to Inverting the Leverage Score Distribution?","venue":"cs.LG","work_id":"de8b842a-9dc4-48c4-8a83-86eeefe21e22","year":2024},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.248294Z"},"links":{"cited_paper":"/paper/2404.13785","citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:b77b3353f0086bb84c93bc57a96b90060b0cb7fc35825281cfad871e8ad349fe","observation_id":"f2b659ac-563c-45c4-a7eb-96810065d7f4","resolution":{"observed_at":"2026-08-08T16:39:14.493829Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15390","last_updated":"2023-11-26T19:19:02Z","snapshot_observed_at":"2026-07-06T16:52:31.421394Z","submitted_at":"2023-11-26T19:19:02Z","title":"Local Convergence of Approximate Newton Method for Two Layer Nonlinear Regression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15390","snapshot_observed_at":"2026-08-08T16:39:14.251502Z","title":"Local convergence of ap- proximate newton method for two layer nonlinear regression","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.251502Z"},"links":{"cited_paper":"/paper/2311.15390","citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:3137185e9bcd68f373f9bb3808ddc46ec4fc45d6fcc513234c4d6ee9ce92f899","observation_id":"6a205d56-775d-403d-8332-d050e918d712","resolution":{"observed_at":"2026-08-08T16:39:14.251502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03915","last_updated":"2024-02-13T19:59:56Z","snapshot_observed_at":"2026-08-08T01:46:10.077844Z","submitted_at":"2022-08-08T04:40:20Z","title":"Dynamic Maintenance of Kernel Density Estimation Data Structure: From Practice to Theory","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.03915","snapshot_observed_at":"2026-08-08T16:39:14.254582Z","title":"Dynamic maintenance of kernel density estimation data structure: From practice to theory","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.254582Z"},"links":{"cited_paper":"/paper/2208.03915","citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:eefb62ff9d3b9d44acf3ecec27514fc6ef65d3d26676b45fe3b87f162651032d","observation_id":"c3a82462-f0b9-4846-980c-3da597f3e16e","resolution":{"observed_at":"2026-08-08T16:39:14.254582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11267","last_updated":"2024-08-21T01:39:42Z","snapshot_observed_at":"2026-08-07T09:41:48.400032Z","submitted_at":"2024-08-21T01:39:42Z","title":"Inverting the Leverage Score Gradient: An Efficient Approximate Newton Method","version":1},"cited_work":{"arxiv_id":"2408.11267","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.11267","snapshot_observed_at":"2026-08-08T16:39:14.459670Z","title":"Inverting the Leverage Score Gradient: An Efficient Approximate Newton Method","venue":"cs.LG","work_id":"4e2657a4-415d-47f8-b038-8b8b68b7eb41","year":2024},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.257905Z"},"links":{"cited_paper":"/paper/2408.11267","citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:a7237e9c7bdc8983b63b7f12e54f7c44f67afed2c86748308f83a21b5cbceb23","observation_id":"3a79cbab-815c-45d3-a98f-9c80c3cd9dc6","resolution":{"observed_at":"2026-08-08T16:39:14.463487Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15725","last_updated":"2023-05-11T00:22:34Z","snapshot_observed_at":"2026-08-05T03:58:56.191727Z","submitted_at":"2023-03-28T04:26:51Z","title":"Solving Regularized Exp, Cosh and Sinh Regression Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15725","snapshot_observed_at":"2026-08-08T16:39:14.260932Z","title":"Solving regularized exp, cosh and sinh regression problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.260932Z"},"links":{"cited_paper":"/paper/2303.15725","citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:0439f75e3009754bf89a8506c4b5a08c2991b8c61bd75a5deaa361632e3946e0","observation_id":"3d08ccdf-4a85-4b91-a974-1757f60fef1f","resolution":{"observed_at":"2026-08-08T16:39:14.260932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-08T16:39:14.263916Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.263916Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:3e3beed501bb07757fa53fe622b147280a7b114b9fd76894a944861dd6cf3c5d","observation_id":"8fc0a27c-b845-4752-8c4e-379e131eb54e","resolution":{"observed_at":"2026-08-08T16:39:14.263916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15579","last_updated":"2025-08-27T08:40:47Z","snapshot_observed_at":"2026-07-06T20:10:41.978020Z","submitted_at":"2024-12-20T05:23:45Z","title":"Score-based Generative Diffusion Models for Social Recommendations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15579","snapshot_observed_at":"2026-08-08T16:39:14.267088Z","title":"Score-based gener- ative diffusion models for social recommendations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.267088Z"},"links":{"cited_paper":"/paper/2412.15579","citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:090b3081a9b83d0b7dee483beb85f33667b26b7f5d49150f5cb280f8942c31a3","observation_id":"e00ad71b-d02d-4ac2-86b3-27f6bd874454","resolution":{"observed_at":"2026-08-08T16:39:14.267088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14988","last_updated":"2022-09-29T17:50:40Z","snapshot_observed_at":"2026-07-06T13:57:54.539656Z","submitted_at":"2022-09-29T17:50:40Z","title":"DreamFusion: Text-to-3D using 2D Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14988","snapshot_observed_at":"2026-08-08T16:39:14.270389Z","title":"Dreamfusion: Text- to-3d using 2d diffusion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.270389Z"},"links":{"cited_paper":"/paper/2209.14988","citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:6d818dd1a8471a92a1602a0ab547911212787de3ff65c9c1b11eeb93151abf72","observation_id":"5eb9678b-eb7e-4a4f-9c7e-d03d3765a952","resolution":{"observed_at":"2026-08-08T16:39:14.270389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-08T16:39:14.276665Z","title":"Denoising diffusion implicit mod- els","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.276665Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:bdf50919463a52b3aacd09f236b0b3e227d4b9f1b5ed2a8da96d87487ad63f19","observation_id":"3136b949-8ecb-4a8a-9035-012ed816d3fc","resolution":{"observed_at":"2026-08-08T16:39:14.276665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02295","last_updated":"2023-06-04T08:12:34Z","snapshot_observed_at":"2026-08-08T05:58:56.148393Z","submitted_at":"2023-06-04T08:12:34Z","title":"A Mathematical Abstraction for Balancing the Trade-off Between Creativity and Reality in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02295","snapshot_observed_at":"2026-08-08T16:39:14.280243Z","title":"A mathematical abstraction for balancing the trade-off between creativity and reality in large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.280243Z"},"links":{"cited_paper":"/paper/2306.02295","citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:5434d5e35742781129a56bff22daaff6daf25c3df21637c7f6dc0de47af15964","observation_id":"350fad26-4169-4a9e-8d13-1cf69f8827b5","resolution":{"observed_at":"2026-08-08T16:39:14.280243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.13482","last_updated":"2023-09-23T21:41:01Z","snapshot_observed_at":"2026-07-06T16:22:50.827103Z","submitted_at":"2023-09-23T21:41:01Z","title":"A Unified Scheme of ResNet and Softmax","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.13482","snapshot_observed_at":"2026-08-08T16:39:14.283665Z","title":"A unified scheme of resnet and softmax","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.283665Z"},"links":{"cited_paper":"/paper/2309.13482","citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:cdad4c1ce1ec5c6c1b39d854f434c440ac78ca440c596ab852e688eb94ad75a0","observation_id":"b4417e69-38c9-4a28-8ef7-689cf193663e","resolution":{"observed_at":"2026-08-08T16:39:14.283665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.08353","last_updated":"2025-02-17T21:15:05Z","snapshot_observed_at":"2026-07-06T15:27:06.126421Z","submitted_at":"2023-05-15T05:21:20Z","title":"Fast and Efficient Matching Algorithm with Deadline Instances","version":3},"cited_work":{"arxiv_id":"2305.08353","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.08353","snapshot_observed_at":"2026-08-08T16:39:14.382263Z","title":"Fast and Efficient Matching Algorithm with Deadline Instances","venue":"cs.DS","work_id":"4a4aacbf-599f-4652-96b3-b90e42ca18e1","year":2023},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.287083Z"},"links":{"cited_paper":"/paper/2305.08353","citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:e95846091be2a24a130dc4eb28680975c3abc76dfbf76e5c4720f883a2b1d2d2","observation_id":"073721e7-ef57-4bec-a6f2-be118c6a9ce1","resolution":{"observed_at":"2026-08-08T16:39:14.385805Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20051","last_updated":"2023-10-30T22:16:18Z","snapshot_observed_at":"2026-08-06T13:42:35.253998Z","submitted_at":"2023-10-30T22:16:18Z","title":"The Expressibility of Polynomial based Attention Scheme","version":1},"cited_work":{"arxiv_id":"2310.20051","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.20051","snapshot_observed_at":"2026-08-08T16:39:14.370342Z","title":"The Expressibility of Polynomial based Attention Scheme","venue":"cs.LG","work_id":"19fca528-a07a-4bb2-b851-ee4147f83a14","year":2023},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.290249Z"},"links":{"cited_paper":"/paper/2310.20051","citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:c6ac6419666600ca4eca9e4005f0ba7d27bf3e2b6c1f260954748cd3943d9cfe","observation_id":"fdeb068f-94ae-4a6a-a7b8-6d005e50a9e6","resolution":{"observed_at":"2026-08-08T16:39:14.374137Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11291","last_updated":"2023-10-17T14:15:57Z","snapshot_observed_at":"2026-07-06T16:34:31.299748Z","submitted_at":"2023-10-17T14:15:57Z","title":"An Automatic Learning Rate Schedule Algorithm for Achieving Faster Convergence and Steeper Descent","version":1},"cited_work":{"arxiv_id":"2310.11291","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.11291","snapshot_observed_at":"2026-08-08T16:39:14.355410Z","title":"An Automatic Learning Rate Schedule Algorithm for Achieving Faster Convergence and Steeper Descent","venue":"cs.LG","work_id":"1221aacc-9974-4946-806f-60f545b1ee07","year":2023},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.293545Z"},"links":{"cited_paper":"/paper/2310.11291","citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:21199497f99350457842c03fdb08e958764614bbf6764ef089f5bc30bc8cffa9","observation_id":"c624e87b-2e6c-479e-bb8c-0d3e4fcc3111","resolution":{"observed_at":"2026-08-08T16:39:14.360814Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14823","last_updated":"2023-11-24T19:41:28Z","snapshot_observed_at":"2026-07-06T16:52:07.175998Z","submitted_at":"2023-11-24T19:41:28Z","title":"Revisiting Quantum Algorithms for Linear Regressions: Quadratic Speedups without Data-Dependent Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.14823","snapshot_observed_at":"2026-08-08T16:39:14.296845Z","title":"Revisiting quantum algorithms for linear regressions: Quadratic speedups without data-dependent parameters","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.296845Z"},"links":{"cited_paper":"/paper/2311.14823","citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:f548d26d6e91a45beb61e99225c53de268e2850b5304b0bef3d884913d379032","observation_id":"0a46d974-4bd5-431c-8e67-8287bc123a12","resolution":{"observed_at":"2026-08-08T16:39:14.296845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10129","last_updated":"2023-09-18T20:10:28Z","snapshot_observed_at":"2026-08-09T01:41:47.484002Z","submitted_at":"2023-09-18T20:10:28Z","title":"Adaptive Liquidity Provision in Uniswap V3 with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10129","snapshot_observed_at":"2026-08-08T16:39:14.303264Z","title":"Adaptive liquidity provision in uniswap v3 with deep reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.303264Z"},"links":{"cited_paper":"/paper/2309.10129","citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:7ec14c6614887139a5e99e9029d132960a7f30f59d2fe36854207f5cf2097ba1","observation_id":"c5f58e4d-bc09-41ee-8037-a0e376cf91ac","resolution":{"observed_at":"2026-08-08T16:39:14.303264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16305","last_updated":"2023-10-25T02:26:04Z","snapshot_observed_at":"2026-07-06T16:38:09.978805Z","submitted_at":"2023-10-25T02:26:04Z","title":"Dolfin: Diffusion Layout Transformers without Autoencoder","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16305","snapshot_observed_at":"2026-08-08T16:39:14.300086Z","title":"Dolfin: Diffusion layout transformers without autoencoder","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.300086Z"},"links":{"cited_paper":"/paper/2310.16305","citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:62e10d4f87151244e019317c8c4e880ce8ec8320538f2c832b54d09a5cbf890e","observation_id":"e961d5ce-0da8-4194-af36-ddf9fcd0bf03","resolution":{"observed_at":"2026-08-08T16:39:14.300086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03356","last_updated":"2023-06-06T02:14:20Z","snapshot_observed_at":"2026-08-07T01:26:41.351074Z","submitted_at":"2023-06-06T02:14:20Z","title":"Query Complexity of Active Learning for Function Family With Nearly Orthogonal Basis","version":1},"cited_work":{"arxiv_id":"2306.03356","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.03356","snapshot_observed_at":"2026-08-08T16:39:14.999329Z","title":"Query Complexity of Active Learning for Function Family With Nearly Orthogonal Basis","venue":"cs.LG","work_id":"8660e66b-47f7-4471-9819-fb82b9addbd7","year":2023},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.132931Z"},"links":{"cited_paper":"/paper/2306.03356","citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:1d697e823571a9ef10f74268c7c0edf98519832e9c39223bce5f5383f5ede41f","observation_id":"21dfec4a-04df-418f-9091-1df9e4a3912b","resolution":{"observed_at":"2026-08-08T16:39:15.003298Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15205","last_updated":"2024-12-19T18:59:31Z","snapshot_observed_at":"2026-08-05T21:19:08.972222Z","submitted_at":"2024-12-19T18:59:31Z","title":"FlowAR: Scale-wise Autoregressive Image Generation Meets Flow Matching","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15205","snapshot_observed_at":"2026-08-08T16:39:14.273545Z","title":"Flowar: Scale-wise autoregressive image generation meets flow matching","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.273545Z"},"links":{"cited_paper":"/paper/2412.15205","citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:c8b100589c6032c308494b82b113490efc8f04399141a4d92593ee0e55d6f3f2","observation_id":"721eed07-cbeb-420a-9235-2755d57df207","resolution":{"observed_at":"2026-08-08T16:39:14.273545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03367","last_updated":"2024-02-12T14:20:41Z","snapshot_observed_at":"2026-07-06T13:39:17.572174Z","submitted_at":"2022-08-05T19:22:30Z","title":"Sublinear Time Algorithm for Online Weighted Bipartite Matching","version":2},"cited_work":{"arxiv_id":"2208.03367","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.03367","snapshot_observed_at":"2026-08-08T16:39:14.884700Z","title":"Sublinear Time Algorithm for Online Weighted Bipartite Matching","venue":"cs.DS","work_id":"004d9068-3dd8-4a60-a5fc-a4d6b511dd30","year":2022},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.172975Z"},"links":{"cited_paper":"/paper/2208.03367","citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:f72c7a49627977da9999163ab3fd5c73beb76aaa7d2e5862315d3bd5823788a3","observation_id":"58c054dc-fbba-4548-af90-6d87b228b9ca","resolution":{"observed_at":"2026-08-08T16:39:14.888329Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16504","last_updated":"2023-03-29T07:29:07Z","snapshot_observed_at":"2026-08-06T05:59:13.906664Z","submitted_at":"2023-03-29T07:29:07Z","title":"An Over-parameterized Exponential Regression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16504","snapshot_observed_at":"2026-08-08T16:39:14.150106Z","title":"An over-parameterized exponential regression","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.150106Z"},"links":{"cited_paper":"/paper/2303.16504","citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:64cdf8cad73f1c83f3dee0ea27e38a1a8a5528245ca5d9f7378005e6144b9093","observation_id":"90606bf6-ba39-428e-999f-cdf49bd7a395","resolution":{"observed_at":"2026-08-08T16:39:14.150106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:39:15.168543Z","title":"Sumformer: Univer- sal approximation for efficient transformers","venue":null,"work_id":"f57a296f-4bba-43e7-a5e6-de2fd2645fe3","year":2023},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.094159Z"},"links":{"citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:6afa838c7acaef49d043278523c3000369d5749cdc13ae26cdeb3c2d3e75e040","observation_id":"e7e454eb-6b03-4415-b200-f6dc8214329d","resolution":{"observed_at":"2026-08-08T16:39:15.171700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17482","last_updated":"2023-05-27T14:23:14Z","snapshot_observed_at":"2026-07-06T15:34:21.966171Z","submitted_at":"2023-05-27T14:23:14Z","title":"Federated Empirical Risk Minimization via Second-Order Method","version":1},"cited_work":{"arxiv_id":"2305.17482","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.17482","snapshot_observed_at":"2026-08-08T16:39:15.130495Z","title":"Federated Empirical Risk Minimization via Second-Order Method","venue":"cs.LG","work_id":"6566f06b-4948-4512-a0db-789a65fcc3ed","year":2023},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.098839Z"},"links":{"cited_paper":"/paper/2305.17482","citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:66e43261198d31e95a843d90145875ac5f621e9474dcb879562cb493054530a8","observation_id":"884c3c3b-d416-430b-902c-e11c3c998f2a","resolution":{"observed_at":"2026-08-08T16:39:15.134112Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07602","last_updated":"2024-12-01T06:39:41Z","snapshot_observed_at":"2026-08-07T22:02:40.620185Z","submitted_at":"2024-11-12T07:24:41Z","title":"Circuit Complexity Bounds for RoPE-based Transformer Architecture","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.07602","snapshot_observed_at":"2026-08-08T16:39:14.114625Z","title":"Circuit complexity bounds for rope-based transformer architecture","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.114625Z"},"links":{"cited_paper":"/paper/2411.07602","citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:6f1c4f8d9dbe38e76fd0606c157e82132fd1cc8ae7867b3271a782bea4e1cd7b","observation_id":"423c9e52-f987-4305-b56b-0571d9908fdc","resolution":{"observed_at":"2026-08-08T16:39:14.114625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00688","last_updated":"2025-02-02T06:19:59Z","snapshot_observed_at":"2026-08-09T18:02:58.492461Z","submitted_at":"2025-02-02T06:19:59Z","title":"High-Order Matching for One-Step Shortcut Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.00688","snapshot_observed_at":"2026-08-08T16:39:14.107007Z","title":"High-order matching for one-step shortcut diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-08T16:39:14.107007Z"},"links":{"cited_paper":"/paper/2502.00688","citing_paper":"/paper/2502.06167"},"observation_digest":"sha256:81659aad41b22cbedd9a0a6538dec270e6fe55e546e734b622053e31087694e6","observation_id":"87802fc2-e708-444b-bf09-461ce0a1ea86","resolution":{"observed_at":"2026-08-08T16:39:14.107007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.06167","last_updated":"2025-02-10T05:36:30Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T01:42:08.911908Z","submitted_at":"2025-02-10T05:36:30Z","title":"Universal Approximation of Visual Autoregressive Transformers"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":15,"verified_fuzzy":4},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 3 inbound Pith citation observations for arXiv:2502.06167."}