{"as_of":"2026-08-24T01:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2ba86c933280771da74297d6f3954399df2153af951ff46ff4979a2a3b88d02a","coverage":[{"denominator":98,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":98,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T13:44:00.720633Z","state":"measured"},{"denominator":98,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":98,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.07832/citation-record","integrity":"/paper/2502.07832/integrity","json":"/paper/2502.07832/citation-record.json","paper":"/paper/2502.07832"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-17T03:25:04.404839Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-08T13:44:00.394550Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.394550Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:4b139bb6f8412c32f23da5986cc19befbf8d83e6d51d5da820ba57b5e24a4c70","observation_id":"609a0388-61f5-4d4f-8bab-334ba9f061f7","resolution":{"observed_at":"2026-08-08T13:44:00.394550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.399688Z","title":"Deepspeed-inference: enabling efficient inference of transformer models at unprecedented scale","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.399688Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:3a2885c7f688f1abd33f65a526300ccaf7faa1131a8f79a1217a5b409b2fa3a0","observation_id":"f78eda28-a31b-4362-9066-1676b007fe72","resolution":{"observed_at":"2026-08-08T13:44:00.399688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.403441Z","title":"Mathqa: Towards interpretable math word problem solving with operation-based formalisms, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.403441Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:6452551865f5634e5c98c85a758a724f99037ac40bba9b16d568f7c8aec1d39f","observation_id":"ad89bf29-a54e-4554-993e-c2a38d02cae8","resolution":{"observed_at":"2026-08-08T13:44:00.403441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-20T15:31:01.041088Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-08T13:44:00.407280Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.407280Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:8e0b2f23654f2766a05174d8acaef703a31804b102e2713722c5ccfffdaefd32","observation_id":"4c65fb43-6d32-422b-b5f5-f7e98e5c1f8b","resolution":{"observed_at":"2026-08-08T13:44:00.407280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.411395Z","title":"Pythia: A suite for analyzing large language models across training and scaling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.411395Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:81cf75640ae1e9fc38007877146c0cd2a9c87bc77db30c74798d4d834cdb71b1","observation_id":"5219e199-9660-4a5e-ba13-6eda36712582","resolution":{"observed_at":"2026-08-08T13:44:00.411395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.415307Z","title":"Piqa: Reasoning about physical commonsense in natural language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.415307Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:7594e3ecc8a2de016edbb2994b9b73b737369d813e980ec5fa1b59d4429e2bc3","observation_id":"adf91926-3d4f-4a60-a854-f1f9a93f7d7b","resolution":{"observed_at":"2026-08-08T13:44:00.415307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06745","last_updated":"2022-04-14T04:00:27Z","snapshot_observed_at":"2026-08-13T14:54:27.001192Z","submitted_at":"2022-04-14T04:00:27Z","title":"GPT-NeoX-20B: An Open-Source Autoregressive Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06745","snapshot_observed_at":"2026-08-08T13:44:00.419177Z","title":"Gpt-neox-20b: An open-source autoregressive language model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.419177Z"},"links":{"cited_paper":"/paper/2204.06745","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:7f4d34c349daa990b51a7a22163d7afd58a07763d0c5db6f694200a76e895011","observation_id":"cc9c7778-8471-48d6-ac99-e2e7b0a8d294","resolution":{"observed_at":"2026-08-08T13:44:00.419177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-08T13:44:00.422737Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.422737Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:6a7011b86656d21c6e7a03a545397781ffd251923d4d2b7801ee2ad745f4d422","observation_id":"2fa7b9b5-d346-44e6-a89f-9ac1bcf1e561","resolution":{"observed_at":"2026-08-08T13:44:00.422737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.12712","last_updated":"2023-04-13T20:41:31Z","snapshot_observed_at":"2026-08-18T22:17:47.865607Z","submitted_at":"2023-03-22T16:51:28Z","title":"Sparks of Artificial General Intelligence: Early experiments with GPT-4","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.12712","snapshot_observed_at":"2026-08-08T13:44:00.426468Z","title":"Sparks of artificial general intelligence: Early experiments with gpt-4","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.426468Z"},"links":{"cited_paper":"/paper/2303.12712","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:3c0ef8984152540b0bd9eabd1207027b072a1b47c69a641752619bf4108f8553","observation_id":"33217203-abf2-4e99-9754-d8f3a24df587","resolution":{"observed_at":"2026-08-08T13:44:00.426468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.429889Z","title":"Code alpaca: An instruction-following llama model for code generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.429889Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:07fb0d31a5f907ca8c7df1f8e1239e68ab3dee98472fe28c9f4a8bb06018da5d","observation_id":"99af52a5-86ed-477c-97da-3b0ec35d1cdc","resolution":{"observed_at":"2026-08-08T13:44:00.429889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.433149Z","title":"Learning to maximize mutual information for chain-of-thought distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.433149Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:7a4e52dd9d2e59f6a91aa634c696c9552db38e5c2777a81ba2ac51eded3bed39","observation_id":"ac8a45f6-28b3-4949-b2bd-0700b1623bde","resolution":{"observed_at":"2026-08-08T13:44:00.433149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.12307","last_updated":"2024-03-08T15:26:38Z","snapshot_observed_at":"2026-08-21T20:26:05.918210Z","submitted_at":"2023-09-21T17:59:11Z","title":"LongLoRA: Efficient Fine-tuning of Long-Context Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.12307","snapshot_observed_at":"2026-08-08T13:44:00.436326Z","title":"Longlora: Efficient fine-tuning of long-context large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.436326Z"},"links":{"cited_paper":"/paper/2309.12307","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:c5c739ed93b59028cf836a3886c76bf4cbd0dd0b01035a91d9da45be296bf70f","observation_id":"e4d976e9-10fa-47c7-b95f-0791502939b2","resolution":{"observed_at":"2026-08-08T13:44:00.436326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.439774Z","title":"D ialog S um: A real-life scenario dialogue summarization dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.439774Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:66829b28ce404d030c7e5fd4e02a14a81a3d086bb642801a260d19433b735525","observation_id":"0dda9464-5803-46e1-828d-e2c8405ddf5c","resolution":{"observed_at":"2026-08-08T13:44:00.439774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.442950Z","title":"Palm: Scaling language modeling with pathways","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.442950Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:9f4cf7c971254d0f5a170a8ea12b4e32482a22eea476739a33e0afbe4ae2ed95","observation_id":"dca0e07c-86e1-4425-bf77-755de8711dbe","resolution":{"observed_at":"2026-08-08T13:44:00.442950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.445935Z","title":"Boolq: Exploring the surprising difficulty of natural yes/no questions","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.445935Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:b522e7d4f81b2d6b0cc9dfb4b574d4ca795e412855a613baf944a6d6b1ac5b48","observation_id":"af5fd9e9-6e76-4b30-9820-56d76ac01d54","resolution":{"observed_at":"2026-08-08T13:44:00.445935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-08T13:44:00.448983Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.448983Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:c5938f623d18ad78169388ea73b6f34247f2a31a3ffefe18a53647b0f46b66f1","observation_id":"76976001-ca3e-4cc4-8e76-993290329eff","resolution":{"observed_at":"2026-08-08T13:44:00.448983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-08T13:44:00.452482Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.452482Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:de746b4e74bdac1887c35a76f78540d2fee6baf82b793354edae52c85157ae0c","observation_id":"384bbdd8-c598-4cc6-8732-558b9d69691f","resolution":{"observed_at":"2026-08-08T13:44:00.452482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.456036Z","title":"Free dolly: Introducing the world's first truly open instruction-tuned llm, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.456036Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:534bed946ba63de1cb175d5aa6d44a7ca0bbe13fdf71f39c7edd35b98e43de9d","observation_id":"55dcea1e-fcb7-4a65-85bc-ba36521e10a9","resolution":{"observed_at":"2026-08-08T13:44:00.456036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.459132Z","title":"Mutual: A dataset for multi-turn dialogue reasoning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.459132Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:4c9e03761288c7ead3ee957202fdead6f6fbb3c968d3a848147ce53c14460882","observation_id":"5144d1d7-b9ea-43d0-b3b9-ac95b4ea587f","resolution":{"observed_at":"2026-08-08T13:44:00.459132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-08T13:44:00.462157Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.462157Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:40d490573a0e0fe12693e1e8d4d70fbc9adbe165433e851dad78eaceff16f0c0","observation_id":"f4f976b7-223a-4a05-98af-bec7aced9cd8","resolution":{"observed_at":"2026-08-08T13:44:00.462157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.465407Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.465407Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:f9d8d62eeba2128a31d47b7c97aa845ddaaa11a272310c3f35ec14676bf8ed8d","observation_id":"cd351f96-3ef2-4134-8c23-5cb350db3938","resolution":{"observed_at":"2026-08-08T13:44:00.465407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.468388Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.468388Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:16190968a8673f280e83cb396012eb297b45b512e5a92295ca9cadf32dff8b37","observation_id":"d2947059-ec14-420b-b640-69bc0a070c9d","resolution":{"observed_at":"2026-08-08T13:44:00.468388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.471354Z","title":"Qlora: Efficient finetuning of quantized llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.471354Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:7c3a616fc45a3e8b40d1c57a4d14581f86a18656305c4ce6d4afda3c3d9ab31f","observation_id":"f04ece8a-781a-4cf6-981a-a8cf6b514c72","resolution":{"observed_at":"2026-08-08T13:44:00.471354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03208","last_updated":"2023-04-06T16:43:16Z","snapshot_observed_at":"2026-08-18T04:17:03.903884Z","submitted_at":"2023-04-06T16:43:16Z","title":"Cerebras-GPT: Open Compute-Optimal Language Models Trained on the Cerebras Wafer-Scale Cluster","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03208","snapshot_observed_at":"2026-08-08T13:44:00.474327Z","title":"Cerebras-gpt: Open compute-optimal language models trained on the cerebras wafer-scale cluster","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.474327Z"},"links":{"cited_paper":"/paper/2304.03208","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:766591b8aaf0ba6a801a8e36a6782c81ea28e287e2632b131369047aa7bb871e","observation_id":"8d69a650-a8bd-4bfe-bada-f1598e01d261","resolution":{"observed_at":"2026-08-08T13:44:00.474327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.477757Z","title":"Blockwise compression of transformer-based models without retraining","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.477757Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:d046f3cdd087c8bb542e38ebfcd9488cffd9e64cfb7bbeff3e2ec2bc45bee178","observation_id":"9bb8c23d-e8c0-4e2b-bae4-dbe1d46a9d9a","resolution":{"observed_at":"2026-08-08T13:44:00.477757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-08T13:44:00.480714Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.480714Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:ea2995db165037a2589a3ef55a1255ce56e7fd00adaaa41a049f5fd77a3ff1ef","observation_id":"6d9b0a07-1127-4b4f-8b2b-b5fab7e721f3","resolution":{"observed_at":"2026-08-08T13:44:00.480714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.483877Z","title":"Sparsegpt: Massive language models can be accurately pruned in one-shot","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.483877Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:3df5d63e89f18eb2a314458ec1659be4d2fb91c122aefb124af9a67fa4d849c8","observation_id":"d1547bb2-eb02-4cf9-ad61-c92ecfa99937","resolution":{"observed_at":"2026-08-08T13:44:00.483877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-16T07:57:19.216626Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-08T13:44:00.486906Z","title":"Gptq: Accurate post-training quantization for generative pre-trained transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.486906Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:333c3693889d7bde768fd7022af84d1674f7040dba67893858cb91e78d8a69df","observation_id":"9373bec1-19a2-4e7b-855b-716f523cf8a0","resolution":{"observed_at":"2026-08-08T13:44:00.486906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.489949Z","title":"Learn-to-share: A hardware-friendly transfer learning framework exploiting computation and parameter sharing","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.489949Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:f133e57a0e3640fa7fca33ffd727e0d7849432f95da810678e8c61dd873b40b9","observation_id":"d554e6de-e130-4979-a77b-ffaab0f0b5f7","resolution":{"observed_at":"2026-08-08T13:44:00.489949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.492841Z","title":"A framework for few-shot language model evaluation, 07 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.492841Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:c657e7f1eb7fc5c129e044fa0c67297d6a35315d35e92033df6f93c008d065c2","observation_id":"f77d0b6a-ef8e-45b7-aa1e-c0768c072392","resolution":{"observed_at":"2026-08-08T13:44:00.492841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17887","last_updated":"2025-03-03T17:02:05Z","snapshot_observed_at":"2026-08-16T14:06:10.494270Z","submitted_at":"2024-03-26T17:20:04Z","title":"The Unreasonable Ineffectiveness of the Deeper Layers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17887","snapshot_observed_at":"2026-08-08T13:44:00.495709Z","title":"The unreasonable ineffectiveness of the deeper layers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.495709Z"},"links":{"cited_paper":"/paper/2403.17887","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:e77f37c11971d191064e22078dc614e8707da865f2270862688c07a45b213082","observation_id":"a2a0077f-9906-4d40-a7c2-332cf89e403b","resolution":{"observed_at":"2026-08-08T13:44:00.495709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11644","last_updated":"2023-10-02T06:12:30Z","snapshot_observed_at":"2026-08-13T11:19:55.436754Z","submitted_at":"2023-06-20T16:14:25Z","title":"Textbooks Are All You Need","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11644","snapshot_observed_at":"2026-08-08T13:44:00.498897Z","title":"Textbooks are all you need","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.498897Z"},"links":{"cited_paper":"/paper/2306.11644","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:b6ed0ba2c851f50137eafaf6dc156c0a6842fcc4e96e5587870992351df9fc81","observation_id":"990270c8-cd96-4223-a541-89660cfc90ba","resolution":{"observed_at":"2026-08-08T13:44:00.498897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.502449Z","title":"Compressing pre-trained language models using progressive low rank decomposition","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.502449Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:7558f5e6236f73a035c9c1f86eecc4cd8f647a1c8cf6f8d13a34726719e8737c","observation_id":"126127a4-5cba-4546-9584-de4734c56e1e","resolution":{"observed_at":"2026-08-08T13:44:00.502449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-08-16T18:00:58.008096Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-08T13:44:00.505557Z","title":"Distilling the knowledge in a neural network","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.505557Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:9a7fbc4461e37a75939bc2186e0bcbda2e91bea7f3edfdc6f00e2e2eec171261","observation_id":"1bdf172f-4dc9-4564-81cb-d56f9a209242","resolution":{"observed_at":"2026-08-08T13:44:00.505557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-21T02:12:10.329412Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-08T13:44:00.508785Z","title":"Training compute-optimal large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.508785Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:524183b493fd8a6c5ff742ae099c29c5983acd90c8f59f2acbdfc91be0822479","observation_id":"b740735b-53ed-46ac-8c77-911256352e1a","resolution":{"observed_at":"2026-08-08T13:44:00.508785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00112","last_updated":"2022-06-30T21:57:07Z","snapshot_observed_at":"2026-08-18T15:54:54.765131Z","submitted_at":"2022-06-30T21:57:07Z","title":"Language model compression with weighted low-rank factorization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.00112","snapshot_observed_at":"2026-08-08T13:44:00.512142Z","title":"Language model compression with weighted low-rank factorization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.512142Z"},"links":{"cited_paper":"/paper/2207.00112","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:470cbc15b74b497a0452ab8218a0e1b0ae6d08fafd0b09af726ac6e59e5cd65a","observation_id":"24872e0f-5eed-430f-a35c-01ad60f58d30","resolution":{"observed_at":"2026-08-08T13:44:00.512142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-20T11:47:17.477107Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-08T13:44:00.515423Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.515423Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:ccc7bdde9b8a00b472a02cf6dbfc37b8a997193c13b9bb65dfa8783b1822fe84","observation_id":"2eae92fb-3812-48f7-b5b7-4b9ef31c70f8","resolution":{"observed_at":"2026-08-08T13:44:00.515423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-08-12T13:10:06.472493Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-08T13:44:00.518499Z","title":"Minicpm: Unveiling the potential of small language models with scalable training strategies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.518499Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:8f27ca9dba4c2d574a74833181ea55f131a097b76e08b81ea28dd58395ed2b00","observation_id":"ec55e8c8-09c2-491b-bdac-9477daf7f5fe","resolution":{"observed_at":"2026-08-08T13:44:00.518499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.521757Z","title":"safetensors","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.521757Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:2627249fb0e513ca0aa7af32fc2bca1fab53acba8f237d2adb76bab1c82dc972","observation_id":"d397db10-374b-451a-a7ef-ff47182143d8","resolution":{"observed_at":"2026-08-08T13:44:00.521757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10702","last_updated":"2023-11-20T02:01:33Z","snapshot_observed_at":"2026-08-18T15:11:49.913463Z","submitted_at":"2023-11-17T18:45:45Z","title":"Camels in a Changing Climate: Enhancing LM Adaptation with Tulu 2","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10702","snapshot_observed_at":"2026-08-08T13:44:00.524776Z","title":"Camels in a changing climate: Enhancing lm adaptation with tulu 2","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.524776Z"},"links":{"cited_paper":"/paper/2311.10702","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:3c048bd30697ba2245f1dd3155ad7b62db314d184930f60edea7605ef6f8caa5","observation_id":"9bebc7d0-9c82-473a-8ad4-c3ac6329add6","resolution":{"observed_at":"2026-08-08T13:44:00.524776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T20:30:34.016254Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-08T13:44:00.528254Z","title":"Mistral 7b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.528254Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:762c0f0e93df2b534b4193c03c0bfbb2cea159a6207434d8294266f2fef1885f","observation_id":"dbea67cc-d6dc-4143-8b6c-4fdf9f4d9c7c","resolution":{"observed_at":"2026-08-08T13:44:00.528254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02692","last_updated":"2021-02-12T07:30:17Z","snapshot_observed_at":"2026-08-18T09:36:48.841470Z","submitted_at":"2019-11-07T00:54:06Z","title":"Multi-Domain Neural Machine Translation with Word-Level Adaptive Layer-wise Domain Mixing","version":3},"cited_work":{"arxiv_id":"1911.02692","doi":null,"metadata_source":"pith","pith_arxiv_id":"1911.02692","snapshot_observed_at":"2026-08-08T13:44:01.004246Z","title":"Multi-Domain Neural Machine Translation with Word-Level Adaptive Layer-wise Domain Mixing","venue":"cs.CL","work_id":"6f3cfe1d-f104-4bb1-94f7-c449e94c6a22","year":2019},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.531798Z"},"links":{"cited_paper":"/paper/1911.02692","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:3941c0fcb64220617922267ef161e0c5f64d58e2d27a5cd3c1f60ea44efe370b","observation_id":"1146dde1-570b-456e-b301-574fa10fb48e","resolution":{"observed_at":"2026-08-08T13:44:01.008160Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.535267Z","title":"Weld, and Luke Zettlemoyer","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.535267Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:eae92b30fcdcc9dc2cc7686cd0b3a8b2e58179ffdc2ddf1d4288390128c447b2","observation_id":"d05d8b5b-34a8-4366-8d4e-c58a586a8720","resolution":{"observed_at":"2026-08-08T13:44:00.535267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-19T23:26:45.859034Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-08-08T13:44:00.538291Z","title":"Gear: An efficient kv cache compression recipefor near-lossless generative inference of llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.538291Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:3d5d05247330f62c8161c5b53a7c9102a83faef738ed16b316341db51e3a6cbf","observation_id":"0872bdf5-f05e-4ce2-b24d-f984a37244e5","resolution":{"observed_at":"2026-08-08T13:44:00.538291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:01.566062Z","title":"arxiv-math-instruct-50","venue":null,"work_id":"5128a17f-e1cd-4925-9db9-41bda8d12a14","year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.541523Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:91f264fbc81c3572a4c0e955f10263fd079a8ea2b3d55df2182dfca0ba2e82a1","observation_id":"df2d3abd-ca64-4747-977d-7f5f91b1e126","resolution":{"observed_at":"2026-08-08T13:44:01.569680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-21T17:11:42.153668Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-08-08T13:44:00.544467Z","title":"Squeezellm: Dense-and-sparse quantization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.544467Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:bfb896d10beaeb867f661d5a359226aa7490f0b1ea4b88e6fb2a4ea381065963","observation_id":"82fa24fe-d6f5-4e80-a3b1-bf4e25e3196a","resolution":{"observed_at":"2026-08-08T13:44:00.544467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.14017","last_updated":"2023-02-27T18:18:13Z","snapshot_observed_at":"2026-08-19T14:54:56.848158Z","submitted_at":"2023-02-27T18:18:13Z","title":"Full Stack Optimization of Transformer Inference: a Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.14017","snapshot_observed_at":"2026-08-08T13:44:00.547913Z","title":"Full stack optimization of transformer inference: a survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.547913Z"},"links":{"cited_paper":"/paper/2302.14017","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:fb4345219b1e1bfda18c9de3f9dbc741e62c3100719aa2412db6ee0fa5c7bdbe","observation_id":"1dce0f8e-e1f0-4d76-84ba-eaf82b5e4aa3","resolution":{"observed_at":"2026-08-08T13:44:00.547913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:01.556150Z","title":"Speculative decoding with big little decoder","venue":null,"work_id":"43363411-4688-4fb4-896d-7abad303b69b","year":2024},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.551373Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:43a15678fa792567e4a1d6d05fa49254014f8acf62c923f7a162879855862721","observation_id":"bbe9f86d-16ac-4127-8751-b4fb6bcc56f5","resolution":{"observed_at":"2026-08-08T13:44:01.559923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.04451","last_updated":"2020-02-18T16:01:18Z","snapshot_observed_at":"2026-07-06T08:50:12.690900Z","submitted_at":"2020-01-13T18:38:28Z","title":"Reformer: The Efficient Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.04451","snapshot_observed_at":"2026-08-08T13:44:00.554454Z","title":"Reformer: The efficient transformer","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.554454Z"},"links":{"cited_paper":"/paper/2001.04451","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:55b33c84ccd5b3e98c0adba4a654d58e52e0c3a6afeab52f1359ad4da1b3a695","observation_id":"99319401-96ec-478c-95e5-3543a552728b","resolution":{"observed_at":"2026-08-08T13:44:00.554454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:01.547127Z","title":"o pf, Yannic Kilcher, Dimitri von R \\","venue":null,"work_id":"2195ed43-beb9-440b-bdd2-ecebe5fe3d02","year":2024},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.557832Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:c0793bcea5fdda9f72ddc8a0193b382ff077ea6f17e13f946752b4fbb9601084","observation_id":"5605fd54-6203-4d08-841f-2d13198d77bf","resolution":{"observed_at":"2026-08-08T13:44:01.550621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08659","last_updated":"2023-11-28T16:06:59Z","snapshot_observed_at":"2026-08-16T21:20:07.431044Z","submitted_at":"2023-10-12T18:34:08Z","title":"LoftQ: LoRA-Fine-Tuning-Aware Quantization for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08659","snapshot_observed_at":"2026-08-08T13:44:00.560727Z","title":"Loftq: Lora-fine-tuning-aware quantization for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.560727Z"},"links":{"cited_paper":"/paper/2310.08659","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:da435909e19f836d9a5bdd1ad084dabaf85fbe060cc670886eb9ab7cabe04f0c","observation_id":"448f8bc4-5c02-4654-a90c-a552d35cd2f8","resolution":{"observed_at":"2026-08-08T13:44:00.560727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:01.538219Z","title":"Losparse: Structured compression of large language models based on low-rank and sparse approximation","venue":null,"work_id":"d7666125-da5a-40b4-a509-30e09ea85bbf","year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.564027Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:ddb010886094d961c1b7068976d561bc48036728b8706169e19050c72a12c5f1","observation_id":"1ce2381e-10f6-46c4-8bc8-c2e94232da5f","resolution":{"observed_at":"2026-08-08T13:44:01.541682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.07972","last_updated":"2020-05-15T21:47:31Z","snapshot_observed_at":"2026-08-13T23:29:00.689140Z","submitted_at":"2020-02-19T03:05:28Z","title":"The Microsoft Toolkit of Multi-Task Deep Neural Networks for Natural Language Understanding","version":2},"cited_work":{"arxiv_id":"2002.07972","doi":null,"metadata_source":"pith","pith_arxiv_id":"2002.07972","snapshot_observed_at":"2026-08-08T13:44:00.951844Z","title":"The Microsoft Toolkit of Multi-Task Deep Neural Networks for Natural Language Understanding","venue":"cs.CL","work_id":"0f81d7e5-b48f-446f-973a-6c7860cb2db1","year":2020},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.567152Z"},"links":{"cited_paper":"/paper/2002.07972","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:53420ed9f3eb6481881b0355d2996214d65ce6d361df7796562ad687f20779b3","observation_id":"08840d56-194c-45a0-9a03-329bef4349d9","resolution":{"observed_at":"2026-08-08T13:44:00.955687Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17888","last_updated":"2023-05-29T05:22:11Z","snapshot_observed_at":"2026-08-21T22:58:47.983191Z","submitted_at":"2023-05-29T05:22:11Z","title":"LLM-QAT: Data-Free Quantization Aware Training for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17888","snapshot_observed_at":"2026-08-08T13:44:00.570594Z","title":"Llm-qat: Data-free quantization aware training for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.570594Z"},"links":{"cited_paper":"/paper/2305.17888","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:1587e4f200fd5b52c60d080b892efa1eaa0f61d547257d88b7767ea725a75952","observation_id":"9bbb9f5b-f553-4d78-9461-5702cce38c02","resolution":{"observed_at":"2026-08-08T13:44:00.570594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14905","last_updated":"2024-06-27T03:53:46Z","snapshot_observed_at":"2026-08-16T14:16:07.202427Z","submitted_at":"2024-02-22T18:58:55Z","title":"MobileLLM: Optimizing Sub-billion Parameter Language Models for On-Device Use Cases","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14905","snapshot_observed_at":"2026-08-08T13:44:00.574242Z","title":"Mobilellm: Optimizing sub-billion parameter language models for on-device use cases","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.574242Z"},"links":{"cited_paper":"/paper/2402.14905","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:919ae2d50ba447631160b46b176d160720519c41b06ac2954d1b8d3fcd3f96d6","observation_id":"a1aac243-d292-44e6-8a38-1538e7bab617","resolution":{"observed_at":"2026-08-08T13:44:00.574242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:01.528698Z","title":"Deja vu: Contextual sparsity for efficient llms at inference time","venue":null,"work_id":"761df17b-9411-49f0-97b5-ecfece5e8111","year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.577593Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:cb6d362e1e42526f6288e3616e51650b1adc600237241f3e5235a9052215927e","observation_id":"c7c1be55-0710-45b8-8297-1609f64d69ef","resolution":{"observed_at":"2026-08-08T13:44:01.532044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.580675Z","title":"The flan collection: Designing data and methods for effective instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.580675Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:b068e657967e6de024a7d82946a4f6a3929727232d2181d9adc4c2426c40bd05","observation_id":"d63f4650-1139-4eed-848c-01ff37af7fe7","resolution":{"observed_at":"2026-08-08T13:44:00.580675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:01.514301Z","title":"Fineweb-edu, May 2024","venue":null,"work_id":"8ddac780-1595-41fd-9de8-efd1df029618","year":2024},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.583970Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:408dd371304c5751b3241d6d37ad1fbf3338cca1c65c29e23ed4f6f019fb95d9","observation_id":"f1f98760-770e-4885-b5f7-eb28ddd2e9b4","resolution":{"observed_at":"2026-08-08T13:44:01.518017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.587134Z","title":"Llm-pruner: On the structural pruning of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.587134Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:5769d743a59212fa18f01fe921d4b9f6bb36d6c0d66cedbaa7210fcd909c93ad","observation_id":"029c6bc1-782e-44a0-aa33-f43bad5966ed","resolution":{"observed_at":"2026-08-08T13:44:00.587134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.590146Z","title":"Peft: State-of-the-art parameter-efficient fine-tuning methods","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.590146Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:78649b63f94cfb621491aa21a72f2c32663a90ad9af54a8d4bfe0b65d8ffcb44","observation_id":"4357665d-8a38-4c5f-ac05-eba6b630ff83","resolution":{"observed_at":"2026-08-08T13:44:00.590146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04564","last_updated":"2023-10-06T20:01:33Z","snapshot_observed_at":"2026-08-21T08:23:35.014784Z","submitted_at":"2023-10-06T20:01:33Z","title":"ReLU Strikes Back: Exploiting Activation Sparsity in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04564","snapshot_observed_at":"2026-08-08T13:44:00.593433Z","title":"Relu strikes back: Exploiting activation sparsity in large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.593433Z"},"links":{"cited_paper":"/paper/2310.04564","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:7d0778a3e0cbd5351fcf1b816ad56378518538952e9aa289f27f46f8d5d5112d","observation_id":"b1b78aea-63f9-44a5-ac99-833b591b03f4","resolution":{"observed_at":"2026-08-08T13:44:00.593433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02707","last_updated":"2023-06-05T08:58:39Z","snapshot_observed_at":"2026-08-09T03:29:22.849759Z","submitted_at":"2023-06-05T08:58:39Z","title":"Orca: Progressive Learning from Complex Explanation Traces of GPT-4","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02707","snapshot_observed_at":"2026-08-08T13:44:00.598069Z","title":"Orca: Progressive learning from complex explanation traces of gpt-4","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.598069Z"},"links":{"cited_paper":"/paper/2306.02707","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:f9a448ab2f640f38a95e55dd97b710bb89711a84e37163fdc6de9b982d857bb2","observation_id":"8c46f36c-57ce-453b-8ee9-57271195c5ea","resolution":{"observed_at":"2026-08-08T13:44:00.598069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:01.494638Z","title":"Medmcqa: A large-scale multi-subject multi-choice dataset for medical domain question answering","venue":null,"work_id":"356bc09a-cc9c-488c-b441-1f61ee1327de","year":2022},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.601574Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:5d0b56798c78e1727f5771aea250266c15f94036aea49735c2d124dba86baf7e","observation_id":"2c0e37d9-602e-4b4e-b89a-2eae112783c5","resolution":{"observed_at":"2026-08-08T13:44:01.498518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.604742Z","title":"The lambada dataset, Aug 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.604742Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:977fb5a54d640fa21fcdb2dee7346a13d3fda3a44cd92fda139935cc3ab696d2","observation_id":"cd3188e7-a885-4cf6-adbb-99ab332cd029","resolution":{"observed_at":"2026-08-08T13:44:00.604742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:01.478781Z","title":"Hovy, Pamela Forner, \\'A lvaro Rodrigo, Richard F","venue":null,"work_id":"89046871-b885-4f43-b693-b913809f4547","year":2011},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.608043Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:88546ed64ed16bf2b419c47113bcfa872a1fccb8b9931c59d78c21b8e1315463","observation_id":"73e2852b-3fd7-438a-bbd9-86f2ff6cf807","resolution":{"observed_at":"2026-08-08T13:44:01.482413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17557","last_updated":"2024-10-31T11:37:49Z","snapshot_observed_at":"2026-08-20T16:41:47.138179Z","submitted_at":"2024-06-25T13:50:56Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17557","snapshot_observed_at":"2026-08-08T13:44:00.610889Z","title":"The fineweb datasets: Decanting the web for the finest text data at scale, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.610889Z"},"links":{"cited_paper":"/paper/2406.17557","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:077ba85950f7e9a21e88f36552bc77fea29fdf6309b50b1117ffae6cbd48ce03","observation_id":"94a895b8-0d03-49ae-a33b-828a0dc37633","resolution":{"observed_at":"2026-08-08T13:44:00.610889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03277","last_updated":"2023-04-06T17:58:09Z","snapshot_observed_at":"2026-08-16T13:26:40.822276Z","submitted_at":"2023-04-06T17:58:09Z","title":"Instruction Tuning with GPT-4","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03277","snapshot_observed_at":"2026-08-08T13:44:00.614144Z","title":"Instruction tuning with gpt-4","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.614144Z"},"links":{"cited_paper":"/paper/2304.03277","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:a059593f699fb0e40b6b2f6a8cbfa8c97fa4716e32997407070123d1c4bc6792","observation_id":"9ae97c1d-32cb-4a28-bd85-2fe2b0b93c53","resolution":{"observed_at":"2026-08-08T13:44:00.614144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.617414Z","title":"Efficiently scaling transformer inference","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.617414Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:cb54a306d4ea61c710ec8b26f9a38ea9c86db65cb6be873a6fb837da4eaf280b","observation_id":"9f48c874-de2e-4c5d-af16-d8b5f722c1f3","resolution":{"observed_at":"2026-08-08T13:44:00.617414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.10641","last_updated":"2019-11-21T19:01:32Z","snapshot_observed_at":"2026-08-16T10:42:13.725165Z","submitted_at":"2019-07-24T18:11:59Z","title":"WinoGrande: An Adversarial Winograd Schema Challenge at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.10641","snapshot_observed_at":"2026-08-08T13:44:00.620603Z","title":"Winogrande: An adversarial winograd schema challenge at scale","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.620603Z"},"links":{"cited_paper":"/paper/1907.10641","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:a5073345d345ee7b7f3edb16dea1f3c03a4f487447fc78eaa64be3e0971a4905","observation_id":"05bb520b-de63-45e1-ac97-2cefe282825b","resolution":{"observed_at":"2026-08-08T13:44:00.620603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08608","last_updated":"2024-07-12T22:15:02Z","snapshot_observed_at":"2026-08-21T17:06:41.051723Z","submitted_at":"2024-07-11T15:44:48Z","title":"FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08608","snapshot_observed_at":"2026-08-08T13:44:00.623850Z","title":"Flashattention-3: Fast and accurate attention with asynchrony and low-precision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.623850Z"},"links":{"cited_paper":"/paper/2407.08608","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:8733e9bf084c5b24ae15c4f9e160b2f8687d9555191761e912eee2a65619f519","observation_id":"7d118554-e8be-428f-b59f-ac40539283d7","resolution":{"observed_at":"2026-08-08T13:44:00.623850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03285","last_updated":"2024-06-05T06:06:43Z","snapshot_observed_at":"2026-08-16T14:45:35.195361Z","submitted_at":"2023-11-06T17:26:17Z","title":"S-LoRA: Serving Thousands of Concurrent LoRA Adapters","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03285","snapshot_observed_at":"2026-08-08T13:44:00.627303Z","title":"S-lora: Serving thousands of concurrent lora adapters","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.627303Z"},"links":{"cited_paper":"/paper/2311.03285","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:583a5178c896ec9db16af87df026dc0c69f92a1775c0562dda156720188f16f8","observation_id":"2bc13ed9-f377-440b-89eb-7d0e1d2795b8","resolution":{"observed_at":"2026-08-08T13:44:00.627303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05955","last_updated":"2024-06-11T02:15:47Z","snapshot_observed_at":"2026-08-18T15:22:06.823821Z","submitted_at":"2024-06-10T01:21:59Z","title":"Turbo Sparse: Achieving LLM SOTA Performance with Minimal Activated Parameters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05955","snapshot_observed_at":"2026-08-08T13:44:00.630570Z","title":"Turbo sparse: Achieving llm sota performance with minimal activated parameters","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.630570Z"},"links":{"cited_paper":"/paper/2406.05955","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:e409c280571700c0c29aa4236d2229b8bca2741f7346bb96a609102d10c5e280","observation_id":"4429da89-7e1a-4f88-8de7-731eb9f950dc","resolution":{"observed_at":"2026-08-08T13:44:00.630570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:01.463197Z","title":"Brown, Adam Santoro, Aditya Gupta, Adrià Garriga-Alonso, Agnieszka Kluska, Aitor Lewkowycz, Akshat Agarwal, Alethea Power, Alex Ray, Alex Warstadt, Alexander W","venue":null,"work_id":"745cbe92-db82-4a2c-ac2f-e0ba745b83f1","year":2022},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.634440Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:9252a620fb4e9a6e7b7ebb620c35eb3da39abd27972410eddbe0e3beeb1b59c1","observation_id":"79f7021f-7e3c-4f95-ad0f-c03563279973","resolution":{"observed_at":"2026-08-08T13:44:01.467507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11695","last_updated":"2024-05-06T17:47:01Z","snapshot_observed_at":"2026-08-20T04:15:03.506960Z","submitted_at":"2023-06-20T17:18:20Z","title":"A Simple and Effective Pruning Approach for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11695","snapshot_observed_at":"2026-08-08T13:44:00.638205Z","title":"A simple and effective pruning approach for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.638205Z"},"links":{"cited_paper":"/paper/2306.11695","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:4e5a2193a1a91ae9c67365cacea73f031cadfb837fa624b3afcfc8fb923dc5c7","observation_id":"d0863e9f-5c08-4595-a736-0465ac3e2d42","resolution":{"observed_at":"2026-08-08T13:44:00.638205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09261","last_updated":"2022-10-17T17:08:26Z","snapshot_observed_at":"2026-08-21T02:25:44.454471Z","submitted_at":"2022-10-17T17:08:26Z","title":"Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09261","snapshot_observed_at":"2026-08-08T13:44:00.641561Z","title":"Challenging big-bench tasks and whether chain-of-thought can solve them","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.641561Z"},"links":{"cited_paper":"/paper/2210.09261","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:2a66da02f75a1136356c11896a71cba85439592579eeedb68ba978ec283bb09a","observation_id":"83636a88-52f1-4891-b66d-98e554e2fb56","resolution":{"observed_at":"2026-08-08T13:44:00.641561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.06243","last_updated":"2021-09-13T18:19:30Z","snapshot_observed_at":"2026-08-16T17:56:54.225410Z","submitted_at":"2021-09-13T18:19:30Z","title":"KroneckerBERT: Learning Kronecker Decomposition for Pre-trained Language Models via Knowledge Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.06243","snapshot_observed_at":"2026-08-08T13:44:00.645377Z","title":"Kroneckerbert: Learning kronecker decomposition for pre-trained language models via knowledge distillation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.645377Z"},"links":{"cited_paper":"/paper/2109.06243","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:b721c3ad0b3868e40ae43b59fbd7cb5cc49adbf3fd27283203b4884ecc0479fa","observation_id":"aa25504b-1c32-4c06-8ab1-ac8be1fea274","resolution":{"observed_at":"2026-08-08T13:44:00.645377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.648906Z","title":"C ommonsense QA : A question answering challenge targeting commonsense knowledge","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.648906Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:fbbaa3cd02fe5282a25547b8fe63cff3bf345f330e483c476d964833ed876989","observation_id":"ba86a792-cd7d-4434-8f78-c84ca18c9055","resolution":{"observed_at":"2026-08-08T13:44:00.648906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.02282","last_updated":"2018-05-06T22:14:47Z","snapshot_observed_at":"2026-08-14T19:18:16.435494Z","submitted_at":"2018-05-06T22:14:47Z","title":"Multi-Domain Neural Machine Translation","version":1},"cited_work":{"arxiv_id":"1805.02282","doi":null,"metadata_source":"pith","pith_arxiv_id":"1805.02282","snapshot_observed_at":"2026-08-08T13:44:00.832042Z","title":"Multi-Domain Neural Machine Translation","venue":"cs.CL","work_id":"743fadbf-5c79-4216-8e28-b1d3e8ed710b","year":2018},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.652312Z"},"links":{"cited_paper":"/paper/1805.02282","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:ba94793d1e706d50fcc21178add91e1be10e246df81d8c6bbe2bfaefc46ccc9c","observation_id":"4414b662-01c4-436b-a618-9f0b6af1aae3","resolution":{"observed_at":"2026-08-08T13:44:00.837719Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-08-20T18:27:04.837880Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-08T13:44:00.655703Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.655703Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:17f9026bac6e11ed07595a2d3c51984350e3094c75392c6ea78cb65af7042035","observation_id":"6025f9a1-8fe8-4a9d-88e3-8abc8d210e5f","resolution":{"observed_at":"2026-08-08T13:44:00.655703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02019","last_updated":"2023-10-24T17:58:42Z","snapshot_observed_at":"2026-08-19T11:16:08.250298Z","submitted_at":"2023-08-03T20:20:01Z","title":"Baby Llama: knowledge distillation from an ensemble of teachers trained on a small dataset with no performance penalty","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02019","snapshot_observed_at":"2026-08-08T13:44:00.659142Z","title":"Baby llama: knowledge distillation from an ensemble of teachers trained on a small dataset with no performance penalty","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.659142Z"},"links":{"cited_paper":"/paper/2308.02019","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:55cf541498794fe355c1d535657979b1399801f3696da7aa32c397bbf1e1d650","observation_id":"878a148a-0bcb-4fc8-86d7-4e755cb41522","resolution":{"observed_at":"2026-08-08T13:44:00.659142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-08T13:44:00.662881Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.662881Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:50f76b5304a89e147bf2670aa68514717bf668b2a50333ac786ce7b0d568d00a","observation_id":"f3aa82dc-5707-4ac0-a5d0-6748380455f8","resolution":{"observed_at":"2026-08-08T13:44:00.662881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.666585Z","title":"Smith, Iz Beltagy, and Hannaneh Hajishirzi","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.666585Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:90c5907e0dadeeccc6db1fe62bccd4ddf5515df7a3fd252e181f66f9803a6480","observation_id":"a189eff1-a16f-4fbc-9d37-3025366e41d4","resolution":{"observed_at":"2026-08-08T13:44:00.666585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:01.449067Z","title":"Liu, and Matt Gardner","venue":null,"work_id":"90edf375-c736-4693-9c21-167a7b539be2","year":2017},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.669764Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:77d013816a981f4ba968afd36593a2873fe1571ad39e0609bfb5a655746ba062","observation_id":"6090a7a2-414f-4013-9fd5-43057ea2c880","resolution":{"observed_at":"2026-08-08T13:44:01.452340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10285","last_updated":"2023-09-19T03:20:02Z","snapshot_observed_at":"2026-08-18T05:11:23.560462Z","submitted_at":"2023-09-19T03:20:02Z","title":"Flash-LLM: Enabling Cost-Effective and Highly-Efficient Large Generative Model Inference with Unstructured Sparsity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10285","snapshot_observed_at":"2026-08-08T13:44:00.672927Z","title":"Flash-llm: Enabling cost-effective and highly-efficient large generative model inference with unstructured sparsity","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.672927Z"},"links":{"cited_paper":"/paper/2309.10285","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:9bce97119ad9a3fd5a82f8f71f5c3a53e3e18803b98c3dcd5a10494bf78f5241","observation_id":"72d3a5b1-ca63-4a16-bac2-3fb80da30ac2","resolution":{"observed_at":"2026-08-08T13:44:00.672927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06694","last_updated":"2024-04-11T01:18:06Z","snapshot_observed_at":"2026-08-16T14:53:24.619970Z","submitted_at":"2023-10-10T15:13:30Z","title":"Sheared LLaMA: Accelerating Language Model Pre-training via Structured Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06694","snapshot_observed_at":"2026-08-08T13:44:00.676353Z","title":"Sheared llama: Accelerating language model pre-training via structured pruning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.676353Z"},"links":{"cited_paper":"/paper/2310.06694","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:063da2bdca44c46c80a1d4b31e052c776a70f047109a4611802d021964ae7dc1","observation_id":"197c667f-0f91-4cb0-9932-05469fef679c","resolution":{"observed_at":"2026-08-08T13:44:00.676353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.680017Z","title":"Smoothquant: Accurate and efficient post-training quantization for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.680017Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:3bb3e1d892851823c4a4851653b18d9d81b375641bc7464249c3d011f27505e5","observation_id":"398d67a9-e006-4337-9adf-55117488af82","resolution":{"observed_at":"2026-08-08T13:44:00.680017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.683256Z","title":"Wizard LM : Empowering large pre-trained language models to follow complex instructions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.683256Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:9b048b9292689f51478ab31dce84381471686930b06037d691fc24716655b109","observation_id":"006da0f2-6bb7-4c61-bd0d-254ff8a5779e","resolution":{"observed_at":"2026-08-08T13:44:00.683256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:01.428976Z","title":"Zeroquant: Efficient and affordable post-training quantization for large-scale transformers","venue":null,"work_id":"422e8e63-05e8-429b-ba84-db391e0e9c44","year":2022},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.686408Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:d4bc91bedb6b2f1f74e7080339d2e01e01816f36d8e862cbbf19a3b90b6e2b4d","observation_id":"a40591c7-eb13-4dae-9979-8ad86ed6550b","resolution":{"observed_at":"2026-08-08T13:44:01.432369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02385","last_updated":"2024-06-04T02:05:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-04T17:54:59Z","title":"TinyLlama: An Open-Source Small Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02385","snapshot_observed_at":"2026-08-08T13:44:00.689555Z","title":"Tinyllama: An open-source small language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.689555Z"},"links":{"cited_paper":"/paper/2401.02385","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:773555987bfc167dec81494b85f09b36f3d6078e3c60c3aa90364263a01d0b1a","observation_id":"d552fbc1-bcdd-4087-80e6-6d7e01384118","resolution":{"observed_at":"2026-08-08T13:44:00.689555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.10512","last_updated":"2023-12-20T20:56:14Z","snapshot_observed_at":"2026-08-20T10:56:35.795189Z","submitted_at":"2023-03-18T22:36:25Z","title":"AdaLoRA: Adaptive Budget Allocation for Parameter-Efficient Fine-Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.10512","snapshot_observed_at":"2026-08-08T13:44:00.692882Z","title":"Adalora: Adaptive budget allocation for parameter-efficient fine-tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.692882Z"},"links":{"cited_paper":"/paper/2303.10512","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:d91b52f05b0cde10306df9bc8918bda83b532c4d960f17db4677534e45ce4731","observation_id":"e2ada6c8-054c-4cf5-b556-dffa5ae0fd7f","resolution":{"observed_at":"2026-08-08T13:44:00.692882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-08T13:44:00.696184Z","title":"Opt: Open pre-trained transformer language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.696184Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:e6c8086a73607180eedb9d715717784e13b1333e5b344b9d024e35f5479ace55","observation_id":"6a0cda3f-0f67-4f00-b8db-30140497589f","resolution":{"observed_at":"2026-08-08T13:44:00.696184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:01.419597Z","title":"Adaptive-precision framework for sgd using deep q-learning","venue":null,"work_id":"e0c7f1ff-48f7-47ae-a9ad-8cdf7cfcbd45","year":2018},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.699834Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:3b5e8a1c6a75d0bcdfa51492bebb68cadb3c4829505420ea3ff647ded6858d31","observation_id":"788b02db-186b-4043-aaa4-f3b04a13b843","resolution":{"observed_at":"2026-08-08T13:44:01.423105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:01.410268Z","title":"H2o: Heavy-hitter oracle for efficient generative inference of large language models","venue":null,"work_id":"64a9ae9c-5168-4d53-837f-f7b335466291","year":2024},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.702933Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:ba71eecc352dbd6ea7dd5c05856d7075c9db013290c48abcd85a4b54a96bb5e3","observation_id":"f457a825-98a0-48cd-883c-08043957a28e","resolution":{"observed_at":"2026-08-08T13:44:01.413628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.705824Z","title":"Lima: Less is more for alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.705824Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:6aa9e923b1380074cca9b031bc6a3769ea74971f9db4f88c29eefa1039b0530e","observation_id":"77948001-69c7-4cd3-8931-ccdf9ca04e35","resolution":{"observed_at":"2026-08-08T13:44:00.705824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.708804Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.708804Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:07b53fe945729de8fc60bd64b3469656be1ff69e97806039591018e531d3965b","observation_id":"1e7fd59a-1c84-4197-b6b6-2ef9c4a72fd9","resolution":{"observed_at":"2026-08-08T13:44:00.708804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.712425Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.712425Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:09e0e0704a734c672f63d9911f0b6359a4f12b8983f8f4357b6d3270e6976560","observation_id":"f32fecc0-8bc8-4ca4-ab83-82106412c486","resolution":{"observed_at":"2026-08-08T13:44:00.712425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.717308Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.717308Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:915c370f038df5f5454b96c6e2b8f31997ee7d9933a6b7ea4e7a0f070130e372","observation_id":"669dfaa8-092f-47d8-970c-c4cf8d21571f","resolution":{"observed_at":"2026-08-08T13:44:00.717308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:44:00.720633Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.720633Z"},"links":{"citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:cecd5e1ac6a8038f35b9e972793b85ca28ade8a704ae387e44ecebd1d47b6499","observation_id":"555edb9b-f77f-4b11-a6a6-97964e650b49","resolution":{"observed_at":"2026-08-08T13:44:00.720633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-18T02:42:48.248967Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters"},"reference_resolution":{"displayed":98,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":82,"verified_exact":3,"verified_fuzzy":13},"total_outbound_references":98},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 24 August 2026, this Paper Citation Record lists 98 of 98 outbound references and 0 inbound Pith citation observations for arXiv:2502.07832."}