{"as_of":"2026-08-13T00:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:82fa22e784bfbaac7303154a4404d8187964d688f7b6f6ba378cf5ebb7d5bb61","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:10:59.345403Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T17:05:54.948805Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.03289","last_updated":"2025-02-28T05:35:09Z","snapshot_observed_at":"2026-08-12T18:12:56.346385Z","submitted_at":"2025-01-06T06:34:52Z","title":"Adaptive Pruning of Pretrained Transformer via Differential Inclusions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03289","snapshot_observed_at":"2026-08-04T17:05:54.948805Z","title":"Adaptive pruning of pretrained transformer via differential inclusions, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11155","last_updated":"2025-09-14T08:20:48Z","snapshot_observed_at":"2026-08-04T17:05:50.271239Z","submitted_at":"2025-09-14T08:20:48Z","title":"AQUA: Attention via QUery mAgnitudes for Memory and Compute Efficient Inference in LLMs","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T17:05:54.948805Z"},"links":{"cited_paper":"/paper/2501.03289","citing_paper":"/paper/2509.11155"},"observation_digest":"sha256:6e420618a93826d455bb81c76f1ad5127c8ad26931f2d817fd30def7f0963535","observation_id":"a4b44001-d106-4a33-9d79-225cde32a359","resolution":{"observed_at":"2026-08-04T17:05:54.948805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2501.03289/citation-record","integrity":"/paper/2501.03289/integrity","json":"/paper/2501.03289/citation-record.json","paper":"/paper/2501.03289"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:10:59.944069Z","title":null,"venue":null,"work_id":"190cc3f2-d1be-4731-8918-eae46aff0e1a","year":2021},"citing_paper":{"arxiv_id":"2501.03289","last_updated":"2025-02-28T05:35:09Z","snapshot_observed_at":"2026-08-12T18:12:56.346385Z","submitted_at":"2025-01-06T06:34:52Z","title":"Adaptive Pruning of Pretrained Transformer via Differential Inclusions","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T22:10:59.279826Z"},"links":{"citing_paper":"/paper/2501.03289"},"observation_digest":"sha256:d374007dd292602a24e96dc38adade925b2fd9b09fe232a894b8fd1bfaf22c04","observation_id":"cc3e91d0-24e5-48db-8ac8-b412a1bda76e","resolution":{"observed_at":"2026-08-10T22:10:59.948747Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:10:59.928426Z","title":"(2013) for instance), while Assumption 1 (d) is also mild including all Lipschitz continuous convex function over a compact set","venue":null,"work_id":"32d24eaf-d2cc-4dcb-a7bb-1db957f91a16","year":2013},"citing_paper":{"arxiv_id":"2501.03289","last_updated":"2025-02-28T05:35:09Z","snapshot_observed_at":"2026-08-12T18:12:56.346385Z","submitted_at":"2025-01-06T06:34:52Z","title":"Adaptive Pruning of Pretrained Transformer via Differential Inclusions","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T22:10:59.286001Z"},"links":{"citing_paper":"/paper/2501.03289"},"observation_digest":"sha256:a14c316a8ddceb02ce88d5f24796be7ed0d5de64a03959541b35eaf057a3b488","observation_id":"c715dd70-a24f-4afc-84f4-694f83ed9df5","resolution":{"observed_at":"2026-08-10T22:10:59.933480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:10:59.763238Z","title":"definable","venue":null,"work_id":"7c4b7ae4-707e-4bca-87be-c39df961ce94","year":2025},"citing_paper":{"arxiv_id":"2501.03289","last_updated":"2025-02-28T05:35:09Z","snapshot_observed_at":"2026-08-12T18:12:56.346385Z","submitted_at":"2025-01-06T06:34:52Z","title":"Adaptive Pruning of Pretrained Transformer via Differential Inclusions","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T22:10:59.335095Z"},"links":{"citing_paper":"/paper/2501.03289"},"observation_digest":"sha256:fcf132bc5a91e52a2f77e9d75a8686d522e4b7f996ab076a0f165a6757ea64b4","observation_id":"18dbb9c9-0989-4e53-9ffe-baa0b46337e8","resolution":{"observed_at":"2026-08-10T22:10:59.768056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:10:59.747305Z","title":"According to van den Dries & Miller (1996); Bolte et al","venue":null,"work_id":"faf9a981-4084-4719-a306-b26ee3a0c9b1","year":1996},"citing_paper":{"arxiv_id":"2501.03289","last_updated":"2025-02-28T05:35:09Z","snapshot_observed_at":"2026-08-12T18:12:56.346385Z","submitted_at":"2025-01-06T06:34:52Z","title":"Adaptive Pruning of Pretrained Transformer via Differential Inclusions","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T22:10:59.339875Z"},"links":{"citing_paper":"/paper/2501.03289"},"observation_digest":"sha256:d997d97b53797b6eb1a657a16aeabcdd72922dedbc18aa36b0ce1d1b10f01bcc","observation_id":"7fb8bc14-58d4-4049-8780-cf907c0f3f6b","resolution":{"observed_at":"2026-08-10T22:10:59.752009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6115","last_updated":"2014-12-18T21:09:01Z","snapshot_observed_at":"2026-07-06T04:04:07.039401Z","submitted_at":"2014-12-18T21:09:01Z","title":"Compressing Deep Convolutional Networks using Vector Quantization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6115","snapshot_observed_at":"2026-08-10T22:10:59.196491Z","title":"Compressing deep convolutional networks using vector quantization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.03289","last_updated":"2025-02-28T05:35:09Z","snapshot_observed_at":"2026-08-12T18:12:56.346385Z","submitted_at":"2025-01-06T06:34:52Z","title":"Adaptive Pruning of Pretrained Transformer via Differential Inclusions","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T22:10:59.196491Z"},"links":{"cited_paper":"/paper/1412.6115","citing_paper":"/paper/2501.03289"},"observation_digest":"sha256:a44077c155f681ef22831fbfe7648d28ef3c992392f18f9c39ee0378e3e11169","observation_id":"0b4e4cd8-a8b6-4ab5-a658-bd0ffe18783c","resolution":{"observed_at":"2026-08-10T22:10:59.196491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:11:00.015397Z","title":"Problem complexity and method efficiency in optimization","venue":null,"work_id":"de3a6929-e859-42fc-807d-328d34ae2c64","year":2025},"citing_paper":{"arxiv_id":"2501.03289","last_updated":"2025-02-28T05:35:09Z","snapshot_observed_at":"2026-08-12T18:12:56.346385Z","submitted_at":"2025-01-06T06:34:52Z","title":"Adaptive Pruning of Pretrained Transformer via Differential Inclusions","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T22:10:59.225921Z"},"links":{"citing_paper":"/paper/2501.03289"},"observation_digest":"sha256:7faf68de00a043569b3ca3277e5d2aeb405b34d207fa5606081b62625a3b38b2","observation_id":"69a5b0d3-29d6-4429-90ff-5236a52a722f","resolution":{"observed_at":"2026-08-10T22:11:00.030247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13741","last_updated":"2023-06-30T03:25:27Z","snapshot_observed_at":"2026-08-12T18:14:02.108538Z","submitted_at":"2023-01-31T16:18:52Z","title":"UPop: Unified and Progressive Pruning for Compressing Vision-Language Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.13741","snapshot_observed_at":"2026-08-10T22:10:59.242964Z","title":"Upop: Uni- fied and progressive pruning for compressing vision-language transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.03289","last_updated":"2025-02-28T05:35:09Z","snapshot_observed_at":"2026-08-12T18:12:56.346385Z","submitted_at":"2025-01-06T06:34:52Z","title":"Adaptive Pruning of Pretrained Transformer via Differential Inclusions","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T22:10:59.242964Z"},"links":{"cited_paper":"/paper/2301.13741","citing_paper":"/paper/2501.03289"},"observation_digest":"sha256:28dab071ec081459d9ef2ce2245404518bc60c370fa0638823e602fb987e3d21","observation_id":"ac8142a6-7d8f-4393-b1b4-a72da9e2dc3e","resolution":{"observed_at":"2026-08-10T22:10:59.242964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10705","last_updated":"2022-07-16T07:09:25Z","snapshot_observed_at":"2026-08-12T18:13:24.989486Z","submitted_at":"2022-03-21T02:11:35Z","title":"Compression of Generative Pre-trained Language Models via Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10705","snapshot_observed_at":"2026-08-10T22:10:59.253760Z","title":"Compression of generative pre-trained language models via quantization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.03289","last_updated":"2025-02-28T05:35:09Z","snapshot_observed_at":"2026-08-12T18:12:56.346385Z","submitted_at":"2025-01-06T06:34:52Z","title":"Adaptive Pruning of Pretrained Transformer via Differential Inclusions","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T22:10:59.253760Z"},"links":{"cited_paper":"/paper/2203.10705","citing_paper":"/paper/2501.03289"},"observation_digest":"sha256:59a2e8bc5d222db27ac23efea26ca3a7bee981309c74c0c39cbdcec06c4c854d","observation_id":"9c52fbd8-bfe6-4f07-b9ce-382d0097ad25","resolution":{"observed_at":"2026-08-10T22:10:59.253760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:10:59.997356Z","title":"Training data-efficient image transformers &amp; distillation through attention","venue":null,"work_id":"a8c5cf12-b829-4946-aba3-1e9d00d1ab76","year":2025},"citing_paper":{"arxiv_id":"2501.03289","last_updated":"2025-02-28T05:35:09Z","snapshot_observed_at":"2026-08-12T18:12:56.346385Z","submitted_at":"2025-01-06T06:34:52Z","title":"Adaptive Pruning of Pretrained Transformer via Differential Inclusions","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T22:10:59.259510Z"},"links":{"citing_paper":"/paper/2501.03289"},"observation_digest":"sha256:cf3246e7ad8f93da036278a41983024ae9514de2381c58bd5388d3d496ca9ea7","observation_id":"4e1a879a-e6ab-4467-bff0-e4a20f51ed17","resolution":{"observed_at":"2026-08-10T22:11:00.003585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:10:59.959659Z","title":null,"venue":null,"work_id":"aa72d44d-c50e-4b8c-99fe-434e51062d44","year":2024},"citing_paper":{"arxiv_id":"2501.03289","last_updated":"2025-02-28T05:35:09Z","snapshot_observed_at":"2026-08-12T18:12:56.346385Z","submitted_at":"2025-01-06T06:34:52Z","title":"Adaptive Pruning of Pretrained Transformer via Differential Inclusions","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T22:10:59.274954Z"},"links":{"citing_paper":"/paper/2501.03289"},"observation_digest":"sha256:fd80f56ce4a91597f353d9dbb2897fb6b8ae8c65a881e838d103283a6bfc3d58","observation_id":"e674d731-893e-42a6-9d23-e4ebdd20f778","resolution":{"observed_at":"2026-08-10T22:10:59.964408Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:10:59.911736Z","title":"In the following, we present the sufficient descent property of Qk along the Lyapunov function F","venue":null,"work_id":"6af941b7-aed2-438a-8a68-ea9b0f890b91","year":2025},"citing_paper":{"arxiv_id":"2501.03289","last_updated":"2025-02-28T05:35:09Z","snapshot_observed_at":"2026-08-12T18:12:56.346385Z","submitted_at":"2025-01-06T06:34:52Z","title":"Adaptive Pruning of Pretrained Transformer via Differential Inclusions","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T22:10:59.291387Z"},"links":{"citing_paper":"/paper/2501.03289"},"observation_digest":"sha256:37e84e47accb9415d7651bd06d8d588a33e7df9b6780b4a99aaca740b2fa81d4","observation_id":"e1f982b3-1081-481f-b28c-4c898ab20223","resolution":{"observed_at":"2026-08-10T22:10:59.917200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:10:59.894180Z","title":"By the lower boundedness assumption of L(W ), both ¯L(P ) and F (Q) are lower bounded by their definitions, i.e., (9) and (15), respectively","venue":null,"work_id":"a664443f-d795-443a-8b79-bffe1db79dd1","year":2025},"citing_paper":{"arxiv_id":"2501.03289","last_updated":"2025-02-28T05:35:09Z","snapshot_observed_at":"2026-08-12T18:12:56.346385Z","submitted_at":"2025-01-06T06:34:52Z","title":"Adaptive Pruning of Pretrained Transformer via Differential Inclusions","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T22:10:59.295932Z"},"links":{"citing_paper":"/paper/2501.03289"},"observation_digest":"sha256:fa266e67a231fc4202faa8e538276467b0285c4ef88e558f8690718a63c418e4","observation_id":"d0e65f2d-9ed6-487c-91c2-c958d25748bf","resolution":{"observed_at":"2026-08-10T22:10:59.899501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:10:59.878996Z","title":"B.2 R ELATIVE ERROR PROPERTY In this subsection, we provide the bound of subgradient by the discrepancy of two successive iterates","venue":null,"work_id":"2514871b-c5be-49ea-a643-fb7ef1a51b82","year":1998},"citing_paper":{"arxiv_id":"2501.03289","last_updated":"2025-02-28T05:35:09Z","snapshot_observed_at":"2026-08-12T18:12:56.346385Z","submitted_at":"2025-01-06T06:34:52Z","title":"Adaptive Pruning of Pretrained Transformer via Differential Inclusions","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T22:10:59.300772Z"},"links":{"citing_paper":"/paper/2501.03289"},"observation_digest":"sha256:e6b64a458b3a2017aa624f957ef66373ae9406d16d31b5490499c3fc5db387da","observation_id":"4307ff66-632f-4ba0-a0cc-58e00cc805d5","resolution":{"observed_at":"2026-08-10T22:10:59.883969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:10:59.861747Z","title":null,"venue":null,"work_id":"4a341aa4-dbef-475a-ab98-0db5d7fe5222","year":2006},"citing_paper":{"arxiv_id":"2501.03289","last_updated":"2025-02-28T05:35:09Z","snapshot_observed_at":"2026-08-12T18:12:56.346385Z","submitted_at":"2025-01-06T06:34:52Z","title":"Adaptive Pruning of Pretrained Transformer via Differential Inclusions","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T22:10:59.306221Z"},"links":{"citing_paper":"/paper/2501.03289"},"observation_digest":"sha256:685e95b8c49ec895d34d18090a5c7c5048b124c83c1952d2b3d2c933a203a58d","observation_id":"d17d3b0e-0c52-4776-9d88-2ca9ee1710a6","resolution":{"observed_at":"2026-08-10T22:10:59.866657Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:10:59.844870Z","title":null,"venue":null,"work_id":"d7afee14-fe1f-410f-b3df-8ea005e6c464","year":1998},"citing_paper":{"arxiv_id":"2501.03289","last_updated":"2025-02-28T05:35:09Z","snapshot_observed_at":"2026-08-12T18:12:56.346385Z","submitted_at":"2025-01-06T06:34:52Z","title":"Adaptive Pruning of Pretrained Transformer via Differential Inclusions","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T22:10:59.311923Z"},"links":{"citing_paper":"/paper/2501.03289"},"observation_digest":"sha256:aa431264badaf4a3cbc658fb23ee2f27e878f162d743cd984cd5a30c0087940e","observation_id":"381d0647-fd3a-4c9f-9580-ed0f84af4696","resolution":{"observed_at":"2026-08-10T22:10:59.850522Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:10:59.828931Z","title":"According to (Łojasiewicz, 1965; Bochnak et al.,","venue":null,"work_id":"169fcc5d-3814-417c-8ed6-09563d2981eb","year":1965},"citing_paper":{"arxiv_id":"2501.03289","last_updated":"2025-02-28T05:35:09Z","snapshot_observed_at":"2026-08-12T18:12:56.346385Z","submitted_at":"2025-01-06T06:34:52Z","title":"Adaptive Pruning of Pretrained Transformer via Differential Inclusions","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T22:10:59.316426Z"},"links":{"citing_paper":"/paper/2501.03289"},"observation_digest":"sha256:1f15afac1847f5a50b73100a53130443145a7505c0d14adc2f8ccef0fec251e9","observation_id":"690ce869-d02f-40a9-9b94-78b26f776411","resolution":{"observed_at":"2026-08-10T22:10:59.833909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:10:59.813625Z","title":"Some typical examples include polynomial functions, the indicator function of a semialgebraic set, and the Euclidean norm (Bochnak et al., 1998, page 26)","venue":null,"work_id":"554501f0-b526-47c2-b2a5-d3d5e081d913","year":1997},"citing_paper":{"arxiv_id":"2501.03289","last_updated":"2025-02-28T05:35:09Z","snapshot_observed_at":"2026-08-12T18:12:56.346385Z","submitted_at":"2025-01-06T06:34:52Z","title":"Adaptive Pruning of Pretrained Transformer via Differential Inclusions","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T22:10:59.321123Z"},"links":{"citing_paper":"/paper/2501.03289"},"observation_digest":"sha256:d365ee60a91c93e0b674cb8d90c76b8039705e19c8d0983cc1232ffc9298d764","observation_id":"a705bf66-f967-45f7-8d3e-9d8b01b1046a","resolution":{"observed_at":"2026-08-10T22:10:59.818628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:10:59.795802Z","title":"The function is said to be real analytic on V ⊂ U if it is real analytic at each u ∈ V (Krantz & Parks, 2002, Definition 1.1.5)","venue":null,"work_id":"f1ee8864-0c20-4d9e-be69-6d7799333226","year":2002},"citing_paper":{"arxiv_id":"2501.03289","last_updated":"2025-02-28T05:35:09Z","snapshot_observed_at":"2026-08-12T18:12:56.346385Z","submitted_at":"2025-01-06T06:34:52Z","title":"Adaptive Pruning of Pretrained Transformer via Differential Inclusions","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T22:10:59.325603Z"},"links":{"citing_paper":"/paper/2501.03289"},"observation_digest":"sha256:c6ec01a5e3a9648a491df677876d0cc9086a3eb13da47ca096ea38de97de758f","observation_id":"c20dcac2-77e5-4b48-95aa-ba2ab674c051","resolution":{"observed_at":"2026-08-10T22:10:59.801722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:10:59.779135Z","title":"Let W i ∈ Rdi×di−1 be the weight matrix between the (i − 1)-th layer and the i-th layer for any i = 1,","venue":null,"work_id":"c386d07e-337e-4583-b831-8e640737130e","year":1999},"citing_paper":{"arxiv_id":"2501.03289","last_updated":"2025-02-28T05:35:09Z","snapshot_observed_at":"2026-08-12T18:12:56.346385Z","submitted_at":"2025-01-06T06:34:52Z","title":"Adaptive Pruning of Pretrained Transformer via Differential Inclusions","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T22:10:59.330313Z"},"links":{"citing_paper":"/paper/2501.03289"},"observation_digest":"sha256:f6c64c016e9e5a93e5ab2a250aa7c88afb24e3a79618832578542fde011cb531","observation_id":"ba4dac57-e0d5-48f3-8352-62931ae7249a","resolution":{"observed_at":"2026-08-10T22:10:59.785259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:10:59.730938Z","title":"[Proof of Corollary 1] To justify this corollary, we only need to verify the associated Lyapunov function F satisfies Kurdyka-Łojasiewicz inequality","venue":null,"work_id":"ec1c6714-02e4-4234-84bc-a31a5c88da36","year":2002},"citing_paper":{"arxiv_id":"2501.03289","last_updated":"2025-02-28T05:35:09Z","snapshot_observed_at":"2026-08-12T18:12:56.346385Z","submitted_at":"2025-01-06T06:34:52Z","title":"Adaptive Pruning of Pretrained Transformer via Differential Inclusions","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T22:10:59.345403Z"},"links":{"citing_paper":"/paper/2501.03289"},"observation_digest":"sha256:48998741c27941a9b54ba08326f62ff309ab9d6d17c83f648bc2aca3122874a2","observation_id":"75727953-7db9-470a-8f89-b564d32dcb1c","resolution":{"observed_at":"2026-08-10T22:10:59.736140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1406.7728","last_updated":"2016-01-21T18:27:34Z","snapshot_observed_at":"2026-08-06T04:40:09.464400Z","submitted_at":"2014-06-30T13:30:15Z","title":"Sparse Recovery via Differential Inclusions","version":5},"cited_work":{"arxiv_id":"1406.7728","doi":null,"metadata_source":"pith","pith_arxiv_id":"1406.7728","snapshot_observed_at":"2026-08-10T22:10:59.471484Z","title":"Sparse Recovery via Differential Inclusions","venue":"math.ST","work_id":"ddb34dc4-b5a3-430c-b0ce-1307448ecbaf","year":2014},"citing_paper":{"arxiv_id":"2501.03289","last_updated":"2025-02-28T05:35:09Z","snapshot_observed_at":"2026-08-12T18:12:56.346385Z","submitted_at":"2025-01-06T06:34:52Z","title":"Adaptive Pruning of Pretrained Transformer via Differential Inclusions","version":2},"reference_index":1983,"source":"pdf_text","source_observed_at":"2026-08-10T22:10:59.231716Z"},"links":{"cited_paper":"/paper/1406.7728","citing_paper":"/paper/2501.03289"},"observation_digest":"sha256:ccdeb595f95eb7fa0b718b7375557a23c46136becfd18f8a513457335277d57c","observation_id":"d764f9c8-dec9-4e0a-b8f2-4de6a92fb9f2","resolution":{"observed_at":"2026-08-10T22:10:59.477709Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11942","last_updated":"2020-02-09T03:00:18Z","snapshot_observed_at":"2026-07-06T08:24:44.631342Z","submitted_at":"2019-09-26T07:06:13Z","title":"ALBERT: A Lite BERT for Self-supervised Learning of Language Representations","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.11942","snapshot_observed_at":"2026-08-10T22:10:59.213255Z","title":"Albert: A lite bert for self-supervised learning of language representations","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2501.03289","last_updated":"2025-02-28T05:35:09Z","snapshot_observed_at":"2026-08-12T18:12:56.346385Z","submitted_at":"2025-01-06T06:34:52Z","title":"Adaptive Pruning of Pretrained Transformer via Differential Inclusions","version":2},"reference_index":1998,"source":"pdf_text","source_observed_at":"2026-08-10T22:10:59.213255Z"},"links":{"cited_paper":"/paper/1909.11942","citing_paper":"/paper/2501.03289"},"observation_digest":"sha256:407b71211bd9fa4c11f960eb813f4769635403ffa573d4a156a3ae8ffe177949","observation_id":"8abfe9e0-6fc1-4d17-ac31-bd13632028a7","resolution":{"observed_at":"2026-08-10T22:10:59.213255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:10:59.185488Z","title":"Imagenet: A large-scale hier- archical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2501.03289","last_updated":"2025-02-28T05:35:09Z","snapshot_observed_at":"2026-08-12T18:12:56.346385Z","submitted_at":"2025-01-06T06:34:52Z","title":"Adaptive Pruning of Pretrained Transformer via Differential Inclusions","version":2},"reference_index":1999,"source":"pdf_text","source_observed_at":"2026-08-10T22:10:59.185488Z"},"links":{"citing_paper":"/paper/2501.03289"},"observation_digest":"sha256:06b414176f36816da8883b975ed3e0108d928735895e880a0d603d71e98b5ea6","observation_id":"a43706f7-7408-4eff-a065-a05bd3d18b8f","resolution":{"observed_at":"2026-08-10T22:10:59.185488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.04045","last_updated":"2021-05-25T09:50:23Z","snapshot_observed_at":"2026-08-12T21:08:09.091240Z","submitted_at":"2017-12-11T21:48:39Z","title":"Choose your path wisely: gradient descent in a Bregman distance framework","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.04045","snapshot_observed_at":"2026-08-10T22:10:59.174195Z","title":"Betcke, Matthias J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.03289","last_updated":"2025-02-28T05:35:09Z","snapshot_observed_at":"2026-08-12T18:12:56.346385Z","submitted_at":"2025-01-06T06:34:52Z","title":"Adaptive Pruning of Pretrained Transformer via Differential Inclusions","version":2},"reference_index":2003,"source":"pdf_text","source_observed_at":"2026-08-10T22:10:59.174195Z"},"links":{"cited_paper":"/paper/1712.04045","citing_paper":"/paper/2501.03289"},"observation_digest":"sha256:dddd3e33417cf7c086b26b94f990dfea8a0de05a85425ec300be55f9e1514e06","observation_id":"17b47be0-adfe-455d-86f9-0ed94064bbfa","resolution":{"observed_at":"2026-08-10T22:10:59.174195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.09791","last_updated":"2020-04-29T20:49:05Z","snapshot_observed_at":"2026-08-11T01:59:17.823546Z","submitted_at":"2019-08-26T16:46:23Z","title":"Once-for-All: Train One Network and Specialize it for Efficient Deployment","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.09791","snapshot_observed_at":"2026-08-10T22:10:59.179453Z","title":"Once-for-all: Train one network and specialize it for efficient deployment","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2501.03289","last_updated":"2025-02-28T05:35:09Z","snapshot_observed_at":"2026-08-12T18:12:56.346385Z","submitted_at":"2025-01-06T06:34:52Z","title":"Adaptive Pruning of Pretrained Transformer via Differential Inclusions","version":2},"reference_index":2006,"source":"pdf_text","source_observed_at":"2026-08-10T22:10:59.179453Z"},"links":{"cited_paper":"/paper/1908.09791","citing_paper":"/paper/2501.03289"},"observation_digest":"sha256:f12292f5543de07213e12bce744d4eb41911cea1bbbdbfd5a609af551ac5fd2f","observation_id":"c5a4704d-a28f-44a8-b9de-6175aa5b35fe","resolution":{"observed_at":"2026-08-10T22:10:59.179453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:10:59.191076Z","title":"11 Published as a conference paper at ICLR 2025 Yanwei Fu, Chen Liu, Donghao Li, Xinwei Sun, Jinshan Zeng, and Yuan Yao","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2501.03289","last_updated":"2025-02-28T05:35:09Z","snapshot_observed_at":"2026-08-12T18:12:56.346385Z","submitted_at":"2025-01-06T06:34:52Z","title":"Adaptive Pruning of Pretrained Transformer via Differential Inclusions","version":2},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-10T22:10:59.191076Z"},"links":{"citing_paper":"/paper/2501.03289"},"observation_digest":"sha256:b0f43eb6b8322673127fbdc1eeeb8601ca01630bd3b0ac529082595f9f764c70","observation_id":"d5ba5a33-b477-4cae-9389-e0c8063c6456","resolution":{"observed_at":"2026-08-10T22:10:59.191076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.03830","last_updated":"2019-06-10T08:01:27Z","snapshot_observed_at":"2026-08-12T18:14:01.436205Z","submitted_at":"2019-06-10T08:01:27Z","title":"Stochastic Mirror Descent on Overparameterized Nonlinear Models: Convergence, Implicit Regularization, and Generalization","version":1},"cited_work":{"arxiv_id":"1906.03830","doi":null,"metadata_source":"pith","pith_arxiv_id":"1906.03830","snapshot_observed_at":"2026-08-10T22:10:59.713260Z","title":"Stochastic Mirror Descent on Overparameterized Nonlinear Models: Convergence, Implicit Regularization, and Generalization","venue":"cs.LG","work_id":"311dfc8a-5385-43c6-bd6d-bfd5dca23f46","year":2019},"citing_paper":{"arxiv_id":"2501.03289","last_updated":"2025-02-28T05:35:09Z","snapshot_observed_at":"2026-08-12T18:12:56.346385Z","submitted_at":"2025-01-06T06:34:52Z","title":"Adaptive Pruning of Pretrained Transformer via Differential Inclusions","version":2},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-10T22:10:59.164628Z"},"links":{"cited_paper":"/paper/1906.03830","citing_paper":"/paper/2501.03289"},"observation_digest":"sha256:9801e21dfbe909de1290a918e9f3369e0297b4f3cd02c836a51306f80632ff35","observation_id":"c8e3a748-c201-412a-aeaa-e66bacdae694","resolution":{"observed_at":"2026-08-10T22:10:59.718723Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17921","last_updated":"2024-03-26T17:55:58Z","snapshot_observed_at":"2026-08-12T18:13:49.022471Z","submitted_at":"2024-03-26T17:55:58Z","title":"The Need for Speed: Pruning Transformers with One Recipe","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17921","snapshot_observed_at":"2026-08-10T22:10:59.208018Z","title":"The need for speed: Pruning transformers with one recipe","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.03289","last_updated":"2025-02-28T05:35:09Z","snapshot_observed_at":"2026-08-12T18:12:56.346385Z","submitted_at":"2025-01-06T06:34:52Z","title":"Adaptive Pruning of Pretrained Transformer via Differential Inclusions","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-10T22:10:59.208018Z"},"links":{"cited_paper":"/paper/2403.17921","citing_paper":"/paper/2501.03289"},"observation_digest":"sha256:8ce6a5ee50ca8565f16da89575f191204b271f8300f13139b453843bfde0f00c","observation_id":"ba3a39de-a9d0-432e-a9fa-a4b9ad6e7596","resolution":{"observed_at":"2026-08-10T22:10:59.208018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:11:00.042577Z","title":"Metadistiller: Network self- boosting via meta-learned top-down distillation","venue":null,"work_id":"6e87c32a-5bed-4176-8919-edeed87c66d2","year":2020},"citing_paper":{"arxiv_id":"2501.03289","last_updated":"2025-02-28T05:35:09Z","snapshot_observed_at":"2026-08-12T18:12:56.346385Z","submitted_at":"2025-01-06T06:34:52Z","title":"Adaptive Pruning of Pretrained Transformer via Differential Inclusions","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-10T22:10:59.219563Z"},"links":{"citing_paper":"/paper/2501.03289"},"observation_digest":"sha256:82f0eb6d7254aa04777a53fa83df52b07dcb571b510fca6e737d66876e022a0a","observation_id":"c71325b3-4b33-41e6-8984-5a6ebf5e48fa","resolution":{"observed_at":"2026-08-10T22:11:00.048453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-10T22:10:59.202773Z","title":"Distilling the knowledge in a neural network","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.03289","last_updated":"2025-02-28T05:35:09Z","snapshot_observed_at":"2026-08-12T18:12:56.346385Z","submitted_at":"2025-01-06T06:34:52Z","title":"Adaptive Pruning of Pretrained Transformer via Differential Inclusions","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-10T22:10:59.202773Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2501.03289"},"observation_digest":"sha256:236fe80751f04d3e91cb95e3614f17b5480d358e72870ff182b5318b394ec042","observation_id":"4a26e3f5-a931-4d7c-961c-90a0e53ffb03","resolution":{"observed_at":"2026-08-10T22:10:59.202773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.05668","last_updated":"2018-02-15T17:18:49Z","snapshot_observed_at":"2026-07-06T06:23:42.900306Z","submitted_at":"2018-02-15T17:18:49Z","title":"Model compression via distillation and quantization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.05668","snapshot_observed_at":"2026-08-10T22:10:59.237256Z","title":"Model compression via distillation and quantiza- tion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.03289","last_updated":"2025-02-28T05:35:09Z","snapshot_observed_at":"2026-08-12T18:12:56.346385Z","submitted_at":"2025-01-06T06:34:52Z","title":"Adaptive Pruning of Pretrained Transformer via Differential Inclusions","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-10T22:10:59.237256Z"},"links":{"cited_paper":"/paper/1802.05668","citing_paper":"/paper/2501.03289"},"observation_digest":"sha256:e4eb353832f7ff7156d658619c459cd2d698c6c06196313d628609ebe6cec869","observation_id":"262d0261-78a1-4138-89a3-b14c718bc4e3","resolution":{"observed_at":"2026-08-10T22:10:59.237256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11695","last_updated":"2024-05-06T17:47:01Z","snapshot_observed_at":"2026-07-06T15:44:42.776459Z","submitted_at":"2023-06-20T17:18:20Z","title":"A Simple and Effective Pruning Approach for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11695","snapshot_observed_at":"2026-08-10T22:10:59.248680Z","title":"A simple and effective pruning approach for large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.03289","last_updated":"2025-02-28T05:35:09Z","snapshot_observed_at":"2026-08-12T18:12:56.346385Z","submitted_at":"2025-01-06T06:34:52Z","title":"Adaptive Pruning of Pretrained Transformer via Differential Inclusions","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-10T22:10:59.248680Z"},"links":{"cited_paper":"/paper/2306.11695","citing_paper":"/paper/2501.03289"},"observation_digest":"sha256:7b24ec3295f0f3b5f32eac5a4834466c7bf7a24be187ab33414705d13d8199e1","observation_id":"84b643ac-92d3-497e-880d-5dc5aeb491e2","resolution":{"observed_at":"2026-08-10T22:10:59.248680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.05345","last_updated":"2023-02-07T00:30:36Z","snapshot_observed_at":"2026-08-12T18:13:52.616575Z","submitted_at":"2023-01-13T00:40:24Z","title":"GOHSP: A Unified Framework of Graph and Optimization-based Heterogeneous Structured Pruning for Vision Transformer","version":2},"cited_work":{"arxiv_id":"2301.05345","doi":null,"metadata_source":"pith","pith_arxiv_id":"2301.05345","snapshot_observed_at":"2026-08-10T22:10:59.382624Z","title":"GOHSP: A Unified Framework of Graph and Optimization-based Heterogeneous Structured Pruning for Vision Transformer","venue":"cs.AI","work_id":"fc848e5f-6ba7-4f88-b8fc-8f11d5f9dddf","year":2023},"citing_paper":{"arxiv_id":"2501.03289","last_updated":"2025-02-28T05:35:09Z","snapshot_observed_at":"2026-08-12T18:12:56.346385Z","submitted_at":"2025-01-06T06:34:52Z","title":"Adaptive Pruning of Pretrained Transformer via Differential Inclusions","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-10T22:10:59.264251Z"},"links":{"cited_paper":"/paper/2301.05345","citing_paper":"/paper/2501.03289"},"observation_digest":"sha256:9da3aaa535a338d345564b4cbe72156aad1d8224a4df993ae4ba97ea2da8791a","observation_id":"4f03a8dd-dbe9-4e41-ac13-0f0d3eb8b613","resolution":{"observed_at":"2026-08-10T22:10:59.390588Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:10:59.981196Z","title":"(2024) pruning method","venue":null,"work_id":"3fb7c68a-584a-49d8-a9ff-dcd01f8ee124","year":2024},"citing_paper":{"arxiv_id":"2501.03289","last_updated":"2025-02-28T05:35:09Z","snapshot_observed_at":"2026-08-12T18:12:56.346385Z","submitted_at":"2025-01-06T06:34:52Z","title":"Adaptive Pruning of Pretrained Transformer via Differential Inclusions","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-10T22:10:59.269435Z"},"links":{"citing_paper":"/paper/2501.03289"},"observation_digest":"sha256:4ee9a87dec9fb5bd990e2d2d63820ed4521dfa28879673a368e7914fccfcf356","observation_id":"17994d1a-6f7b-49f9-a90e-7d79e1e020df","resolution":{"observed_at":"2026-08-10T22:10:59.985914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.03289","last_updated":"2025-02-28T05:35:09Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T18:12:56.346385Z","submitted_at":"2025-01-06T06:34:52Z","title":"Adaptive Pruning of Pretrained Transformer via Differential Inclusions"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":3,"verified_fuzzy":15},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 1 inbound Pith citation observation for arXiv:2501.03289."}