{"as_of":"2026-08-18T07:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4d2eadff979583a02a0182f74f356ee64a23612419fa28dcada77499d898591b","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T23:19:23.112017Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:59:42.128875Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-16T00:59:42.230640Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-18T02:48:14.491629Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"cited_work":{"arxiv_id":"2412.20677","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.20677","snapshot_observed_at":"2026-08-16T00:59:42.230640Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","venue":"cs.CL","work_id":"b15243ac-8b10-43ac-9ad2-380ad546fa68","year":2024},"citing_paper":{"arxiv_id":"2505.02351","last_updated":"2025-07-10T07:04:02Z","snapshot_observed_at":"2026-08-17T19:44:46.934741Z","submitted_at":"2025-05-05T04:20:40Z","title":"Opt-GPTQ: An Optimized GPTQ Combining Sparse Attention and Quantization Techniques","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:42.128875Z"},"links":{"cited_paper":"/paper/2412.20677","citing_paper":"/paper/2505.02351"},"observation_digest":"sha256:4f22284d118fbc04d544318f5ab1bcd997ea11e5dd386b735e4f04e7ff437565","observation_id":"6ad80293-41fd-4ec1-b430-229b314136f0","resolution":{"observed_at":"2026-08-16T00:59:42.239517Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.20677/citation-record","integrity":"/paper/2412.20677/integrity","json":"/paper/2412.20677/citation-record.json","paper":"/paper/2412.20677"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1905.10044","last_updated":"2019-05-24T05:48:49Z","snapshot_observed_at":"2026-08-17T14:44:42.060038Z","submitted_at":"2019-05-24T05:48:49Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.10044","snapshot_observed_at":"2026-08-10T23:19:22.995212Z","title":"Boolq: Exploring the surprising diffi- culty of natural yes/no questions","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-18T02:48:14.491629Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:22.995212Z"},"links":{"cited_paper":"/paper/1905.10044","citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:33a1dfe25823e5a5fcf1913d26d0352d2ec8db070bf8e0173759d6a3b25ed062","observation_id":"7151ea51-0361-4590-87fa-d8dec4883b12","resolution":{"observed_at":"2026-08-10T23:19:22.995212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:23.520907Z","title":null,"venue":null,"work_id":"cc228a2b-d525-48db-a8b4-037e453f8131","year":1954},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-18T02:48:14.491629Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:23.107616Z"},"links":{"citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:d675d42a1762fa0dd2a0879da9740eb753da57f00fc4812c1c5b30375ba6b523","observation_id":"7fbde293-76e1-4a51-b55a-3fe3ccb88c84","resolution":{"observed_at":"2026-08-10T23:19:23.525027Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-17T18:04:53.578114Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-10T23:19:23.014442Z","title":"Edward J Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-18T02:48:14.491629Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:23.014442Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:07e2955acef3626b1d5861b474df20dcd1296c72da9533b719e56ea5bfe9b39e","observation_id":"7fe3f08a-d2e1-4909-a378-f717391ae2a3","resolution":{"observed_at":"2026-08-10T23:19:23.014442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T20:30:34.016254Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-10T23:19:23.019925Z","title":"Mistral 7b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-18T02:48:14.491629Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:23.019925Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:5005f055cbfc02d26019cf313b0a1297d8e662910c4e1912d253ccb34cb52e7e","observation_id":"343c113a-3b63-4898-b0d8-2cb8df6d0ffa","resolution":{"observed_at":"2026-08-10T23:19:23.019925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13555","last_updated":"2025-02-18T00:14:57Z","snapshot_observed_at":"2026-08-16T13:41:26.708487Z","submitted_at":"2024-06-19T13:44:56Z","title":"BiLD: Bi-directional Logits Difference Loss for Large Language Model Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13555","snapshot_observed_at":"2026-08-10T23:19:23.024524Z","title":"Bild: Bi- directional logits difference loss for large language model distillation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-18T02:48:14.491629Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:23.024524Z"},"links":{"cited_paper":"/paper/2406.13555","citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:b93fa65a6718c20506819e0d33019a5181556003119ac73f086118daaeb45a84","observation_id":"acebbc93-a900-4ccf-87e8-8f88b18c52f5","resolution":{"observed_at":"2026-08-10T23:19:23.024524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-10T23:19:23.028493Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-18T02:48:14.491629Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:23.028493Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:cab8a397e409167bec1afd0424de8e3e0047678fa6d266cb88e5569a85c21136","observation_id":"a489ebb9-8328-4c56-8ea7-5a33c9091de7","resolution":{"observed_at":"2026-08-10T23:19:23.028493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01312","last_updated":"2018-06-22T14:54:59Z","snapshot_observed_at":"2026-08-14T20:07:02.711956Z","submitted_at":"2017-12-04T19:20:27Z","title":"Learning Sparse Neural Networks through $L_0$ Regularization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.01312","snapshot_observed_at":"2026-08-10T23:19:23.032946Z","title":"Learning sparse neural networks through l_0 regular- ization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-18T02:48:14.491629Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:23.032946Z"},"links":{"cited_paper":"/paper/1712.01312","citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:ca541778846d05120a18e7180e60661ae534254c9566b7e17742ed0ee66ba9eb","observation_id":"3b049843-b8fb-466d-a225-3f858b14dfa8","resolution":{"observed_at":"2026-08-10T23:19:23.032946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09728","last_updated":"2019-09-09T17:29:55Z","snapshot_observed_at":"2026-08-12T21:45:41.485479Z","submitted_at":"2019-04-22T05:36:37Z","title":"SocialIQA: Commonsense Reasoning about Social Interactions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09728","snapshot_observed_at":"2026-08-10T23:19:23.040939Z","title":"Socialiqa: Commonsense reasoning about social interactions","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-18T02:48:14.491629Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:23.040939Z"},"links":{"cited_paper":"/paper/1904.09728","citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:61c07acf8ecb08602223e1d34d87b4a3d4ba1d1291f29a0501f4b884929936ad","observation_id":"b7705666-0266-47cd-b997-559697d8ccb8","resolution":{"observed_at":"2026-08-10T23:19:23.040939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:23.548020Z","title":"Recursive deep models for se- mantic compositionality over a sentiment treebank","venue":null,"work_id":"7cb60c1c-0018-405f-8dd2-1a9f77cf5c08","year":2013},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-18T02:48:14.491629Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:23.049613Z"},"links":{"citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:92091d8f5d6948f3450ab198109290d1eec86f8bc1746c8ac0830478fee989e9","observation_id":"3f5afc6e-3c90-4e81-97b4-c96794f439e1","resolution":{"observed_at":"2026-08-10T23:19:23.552556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11695","last_updated":"2024-05-06T17:47:01Z","snapshot_observed_at":"2026-08-13T04:32:33.562415Z","submitted_at":"2023-06-20T17:18:20Z","title":"A Simple and Effective Pruning Approach for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11695","snapshot_observed_at":"2026-08-10T23:19:23.053957Z","title":"A simple and effective pruning approach for large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-18T02:48:14.491629Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:23.053957Z"},"links":{"cited_paper":"/paper/2306.11695","citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:e131722339890a9566ec9bb1460741d46a60cc929458726e74d0aa08bd8101a8","observation_id":"45404514-2a8d-4b1b-9869-eafcc5300f46","resolution":{"observed_at":"2026-08-10T23:19:23.053957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15891","last_updated":"2024-07-22T01:12:23Z","snapshot_observed_at":"2026-08-16T13:32:18.250431Z","submitted_at":"2024-07-22T01:12:23Z","title":"RazorAttention: Efficient KV Cache Compression Through Retrieval Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15891","snapshot_observed_at":"2026-08-10T23:19:23.058774Z","title":"Razoratten- tion: Efficient kv cache compression through retrieval heads","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-18T02:48:14.491629Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:23.058774Z"},"links":{"cited_paper":"/paper/2407.15891","citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:9b4966c9b7a36b44d8e481574a64d496e466192804365f99c9209274907d1eb3","observation_id":"d7f1e43b-321b-4635-a518-8a98c59e813f","resolution":{"observed_at":"2026-08-10T23:19:23.058774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-10T23:19:23.063117Z","title":"Llama 2: Open foundation and fine- tuned chat models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-18T02:48:14.491629Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:23.063117Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:9022cc3087d78a2f7ac2459640cb7fc22a12fccb9be696efd01fa3209875602d","observation_id":"b62e7200-aa4a-4488-a2bc-c7cbe7f77dd2","resolution":{"observed_at":"2026-08-10T23:19:23.063117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.04732","last_updated":"2021-03-28T19:04:25Z","snapshot_observed_at":"2026-08-14T00:39:23.744952Z","submitted_at":"2019-10-10T17:44:18Z","title":"Structured Pruning of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.04732","snapshot_observed_at":"2026-08-10T23:19:23.067137Z","title":"neurips.cc/paper_files/paper/2017/file/ 3f5ee243547dee91fbd053c1c4a845aa-Paper","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-18T02:48:14.491629Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:23.067137Z"},"links":{"cited_paper":"/paper/1910.04732","citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:113d65baf8a054d8d0f3d40a0326d4f49df2fa49fea04ac904c86d27264bf39b","observation_id":"a5f7f156-3956-4295-bb7e-95440dce08e5","resolution":{"observed_at":"2026-08-10T23:19:23.067137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06694","last_updated":"2024-04-11T01:18:06Z","snapshot_observed_at":"2026-08-16T14:53:24.619970Z","submitted_at":"2023-10-10T15:13:30Z","title":"Sheared LLaMA: Accelerating Language Model Pre-training via Structured Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06694","snapshot_observed_at":"2026-08-10T23:19:23.075700Z","title":"Sheared llama: Accelerating language model pre-training via structured pruning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-18T02:48:14.491629Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:23.075700Z"},"links":{"cited_paper":"/paper/2310.06694","citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:564e9582b1638714f9465e2ae98475df5949208d91f822bd9c0591a32f612594","observation_id":"62655e4c-e53d-406b-8e09-a916ae36eb06","resolution":{"observed_at":"2026-08-10T23:19:23.075700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-17T11:08:48.802438Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-10T23:19:23.080312Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-18T02:48:14.491629Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:23.080312Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:25112165739910883c99f7b3f5d13d6681a42095aa9d488f584c6ecf8150231f","observation_id":"948d91bc-580f-4a81-9f94-579e967b72e8","resolution":{"observed_at":"2026-08-10T23:19:23.080312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07056","last_updated":"2024-06-11T08:37:33Z","snapshot_observed_at":"2026-08-16T13:44:16.024792Z","submitted_at":"2024-06-11T08:37:33Z","title":"Effectively Compress KV Heads for LLM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07056","snapshot_observed_at":"2026-08-10T23:19:23.084595Z","title":"Effectively compress kv heads for llm","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-18T02:48:14.491629Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:23.084595Z"},"links":{"cited_paper":"/paper/2406.07056","citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:12478075a58abfd79f9f9354fa37c9b98c8e690280b2eab2a91913c256725f0b","observation_id":"e49414fa-1196-4d67-903c-894eef64356b","resolution":{"observed_at":"2026-08-10T23:19:23.084595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12065","last_updated":"2024-02-20T08:48:24Z","snapshot_observed_at":"2026-08-17T06:09:40.445654Z","submitted_at":"2024-02-19T11:33:21Z","title":"WKVQuant: Quantizing Weight and Key/Value Cache for Large Language Models Gains More","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12065","snapshot_observed_at":"2026-08-10T23:19:23.089199Z","title":"Wkvquant: Quantizing weight and key/value cache for large language models gains more","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-18T02:48:14.491629Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:23.089199Z"},"links":{"cited_paper":"/paper/2402.12065","citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:9dc905ba0cd320bf99d5f89594a6f5f7af954360a7464067284746ed2cd29705","observation_id":"674a44b1-e114-4054-9095-f3990fc287f5","resolution":{"observed_at":"2026-08-10T23:19:23.089199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-08-15T09:37:44.321271Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-10T23:19:23.093364Z","title":"Hellaswag: Can a ma- chine really finish your sentence? arXiv preprint arXiv:1905.07830,","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-18T02:48:14.491629Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:23.093364Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:ecbccdce6960a832e75b635c6adc54bd89043a993301b0c1f8cfe8a585bd8a99","observation_id":"831db064-129f-4930-bd18-0ab67374e58c","resolution":{"observed_at":"2026-08-10T23:19:23.093364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02385","last_updated":"2024-06-04T02:05:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-04T17:54:59Z","title":"TinyLlama: An Open-Source Small Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02385","snapshot_observed_at":"2026-08-10T23:19:23.097981Z","title":"Tinyllama: An open-source small language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-18T02:48:14.491629Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:23.097981Z"},"links":{"cited_paper":"/paper/2401.02385","citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:d3bfedbc97e14596018120e6a9144ee4f04d85e658e7dd77a569749465c5a746","observation_id":"780554e5-c090-4460-85f1-7df43cb64211","resolution":{"observed_at":"2026-08-10T23:19:23.097981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:23.533787Z","title":"During the pruning training process, the sparsity warm-up steps account for 30% of the total steps, during which the target size of the L0 masks decreases linearly to zero","venue":null,"work_id":"f21b9cb2-343d-4fcc-bf2c-06294f75036b","year":2024},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-18T02:48:14.491629Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:23.102598Z"},"links":{"citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:a9008a18d023abd493d831b752833fd4de1638cbb79e18a48aaa00e6a40298d3","observation_id":"61840526-4f67-4146-bf65-83deef55c602","resolution":{"observed_at":"2026-08-10T23:19:23.539292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:23.505567Z","title":null,"venue":null,"work_id":"36306514-7e0f-4ffc-be5a-349978e78eb1","year":2017},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-18T02:48:14.491629Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:23.112017Z"},"links":{"citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:d7a825ab2e312c0550951240539229f26f35afbe0a609f229b8c3e0ead59b774","observation_id":"eac5dce5-d74b-4b33-85f6-e1199cb4fd14","resolution":{"observed_at":"2026-08-10T23:19:23.511078Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02150","last_updated":"2019-11-06T00:19:05Z","snapshot_observed_at":"2026-07-06T08:35:01.386074Z","submitted_at":"2019-11-06T00:19:05Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.02150","snapshot_observed_at":"2026-08-10T23:19:23.045321Z","title":"Fast transformer decoding: One write-head is all you need","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-18T02:48:14.491629Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":1966,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:23.045321Z"},"links":{"cited_paper":"/paper/1911.02150","citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:acbd7e3ae3cb8bca102b61553f3109b77aa117bdf19e6d48ad438710e51fb2a8","observation_id":"ab5f951b-3fd8-45ef-87d6-b0e6d373263d","resolution":{"observed_at":"2026-08-10T23:19:23.045321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06567","last_updated":"2024-12-07T13:23:39Z","snapshot_observed_at":"2026-08-16T13:46:44.414844Z","submitted_at":"2024-06-03T13:28:43Z","title":"DHA: Learning Decoupled-Head Attention from Transformer Checkpoints via Adaptive Heads Fusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06567","snapshot_observed_at":"2026-08-10T23:19:22.990805Z","title":"Dha: Learning decoupled-head attention from trans- former checkpoints via adaptive heads fusion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-18T02:48:14.491629Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:22.990805Z"},"links":{"cited_paper":"/paper/2406.06567","citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:8e25479de743eb1dc5af671a6dbf137709cbbff02aa775881ca6085640f96998","observation_id":"b3067072-352b-47bb-8ca1-7faa285b5a07","resolution":{"observed_at":"2026-08-10T23:19:22.990805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.02789","last_updated":"2018-09-08T11:47:16Z","snapshot_observed_at":"2026-08-14T07:00:02.529732Z","submitted_at":"2018-09-08T11:47:16Z","title":"Can a Suit of Armor Conduct Electricity? A New Dataset for Open Book Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.02789","snapshot_observed_at":"2026-08-10T23:19:23.037009Z","title":"Can a suit of armor conduct electricity? a new dataset for open book question answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-18T02:48:14.491629Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:23.037009Z"},"links":{"cited_paper":"/paper/1809.02789","citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:579bad36a7d86587669590bf0a9073b232312ff805d49e7d42eb50eefa090878","observation_id":"9b327448-53b0-48e8-b877-aeb244b96897","resolution":{"observed_at":"2026-08-10T23:19:23.037009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-10T23:19:23.004497Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-18T02:48:14.491629Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:23.004497Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:4e0f1fb9993a370e396a5db4f70b68499349262aaef1357842ff874106ea008a","observation_id":"d5bbf37a-8162-4973-9119-fb744a724811","resolution":{"observed_at":"2026-08-10T23:19:23.004497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-10T23:19:22.999949Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-18T02:48:14.491629Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:22.999949Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:35e587a8ed1448ba69c59d40ba2df2afdddc4b61d6099054ad29d416f9187016","observation_id":"2f2fc995-ba2a-41ca-8213-8f1f88cd251e","resolution":{"observed_at":"2026-08-10T23:19:22.999949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:23.561640Z","title":"Lan- guage models are few-shot learners","venue":null,"work_id":"df7a9d24-b598-4621-942f-665edff24cf4","year":1901},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-18T02:48:14.491629Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:22.986705Z"},"links":{"citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:43109342c4fd0269395932fdb5275c1660508899a8f6e0c6ba397c747ff0daaa","observation_id":"cf5d0739-4783-4149-ab55-ad05197b6b36","resolution":{"observed_at":"2026-08-10T23:19:23.566901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-10T23:19:23.009235Z","title":"Measuring massive multitask language understand- ing","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-18T02:48:14.491629Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:23.009235Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:6263e2bf954e90d416ca2f42bf5c6dedd4f0d2d6fd62617f3e9a0a52c64ec1c1","observation_id":"ad30bf8b-f329-46cd-9743-077854a87204","resolution":{"observed_at":"2026-08-10T23:19:23.009235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.00408","last_updated":"2022-05-02T19:21:13Z","snapshot_observed_at":"2026-08-16T17:09:58.195739Z","submitted_at":"2022-04-01T13:09:56Z","title":"Structured Pruning Learns Compact and Accurate Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.00408","snapshot_observed_at":"2026-08-10T23:19:23.071189Z","title":"[Online; accessed 24-October-2024]","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-18T02:48:14.491629Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:23.071189Z"},"links":{"cited_paper":"/paper/2204.00408","citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:4f8b4457169854a86b22a389cfb0602acf76bbc86d164b7ad0d2d0b4760b35e9","observation_id":"6aaea453-9a7a-4c1b-810d-ebbda686b8bd","resolution":{"observed_at":"2026-08-10T23:19:23.071189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15024","last_updated":"2024-02-09T17:59:40Z","snapshot_observed_at":"2026-08-16T14:24:10.346445Z","submitted_at":"2024-01-26T17:35:45Z","title":"SliceGPT: Compress Large Language Models by Deleting Rows and Columns","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15024","snapshot_observed_at":"2026-08-10T23:19:22.982078Z","title":"Slicegpt: Compress large language mod- els by deleting rows and columns","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-18T02:48:14.491629Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:22.982078Z"},"links":{"cited_paper":"/paper/2401.15024","citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:08f56cc5a479c5cc48a09e7367be91bead457ab6d407ee1ce0216f6b5650fa2f","observation_id":"a5f98dbc-0d0f-4192-a531-e065ae2d4a72","resolution":{"observed_at":"2026-08-10T23:19:22.982078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-08-15T06:28:09.529747Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-10T23:19:22.976195Z","title":"Gqa: Training generalized multi-query transformer models from multi-head checkpoints","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-18T02:48:14.491629Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:22.976195Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:8c414307824f0967c96ca8efc0c86cf22ed0401ea9771e2c64f2e17e8f1f07e9","observation_id":"2aca0bbe-26d1-4b46-a4b5-fbdb433eec82","resolution":{"observed_at":"2026-08-10T23:19:22.976195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-18T02:48:14.491629Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 1 inbound Pith citation observation for arXiv:2412.20677."}