{"as_of":"2026-08-11T11:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fcf2f67e64017e652ce07222c41dc5668b3c7f44db89813d001b94b807bdbf08","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T15:50:22.077513Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:32:31.119922Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-19T03:37:00.945663Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","snapshot_observed_at":"2026-08-11T11:09:19.365931Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13629","snapshot_observed_at":"2026-08-07T13:32:31.119922Z","title":"Sigma: Differential rescaling of query, key and value for efficient language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:31.119922Z"},"links":{"cited_paper":"/paper/2501.13629","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:99379f41a89241f2af68167b29af8d824462a34b0a5d79eb2beeac82ab5ea0f8","observation_id":"8e4c7db0-b686-4cbb-8373-b9af37adc193","resolution":{"observed_at":"2026-08-07T13:32:31.119922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","snapshot_observed_at":"2026-08-11T11:09:19.365931Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models","version":2},"cited_work":{"arxiv_id":"2501.13629","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.13629","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2501.13629 (2025)","venue":null,"work_id":"66f50064-271f-4fc5-be2d-b74e00e6543c","year":2025},"citing_paper":{"arxiv_id":"2507.15640","last_updated":"2026-04-12T09:28:58Z","snapshot_observed_at":"2026-08-09T03:59:56.664513Z","submitted_at":"2025-07-21T14:01:54Z","title":"Data Mixing Agent: Learning to Re-weight Domains for Continual Pre-training","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-19T03:36:50.366757Z"},"links":{"cited_paper":"/paper/2501.13629","citing_paper":"/paper/2507.15640"},"observation_digest":"sha256:9b91edcab6343c69bfa64ebb7517a4d137e1c378e774b975401e8c350de7cbcc","observation_id":"52228e1e-b7f4-4c6d-8b9c-bc7f199c4f61","resolution":{"observed_at":"2026-05-19T03:37:00.948390Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.13629/citation-record","integrity":"/paper/2501.13629/integrity","json":"/paper/2501.13629/citation-record.json","paper":"/paper/2501.13629"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-10T14:07:02.234322Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-10T15:50:21.815849Z","title":"A., Awan, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","snapshot_observed_at":"2026-08-11T11:09:19.365931Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T15:50:21.815849Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2501.13629"},"observation_digest":"sha256:ded4b4ec4ee17a0401d68d2f1a874ae9707f894670958161582c0a94ba4dc984","observation_id":"5c94ecbd-862a-4fe4-ab6c-55395bb102d1","resolution":{"observed_at":"2026-08-10T15:50:21.815849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:50:22.861630Z","title":null,"venue":null,"work_id":"ac6a160c-52db-42be-9485-562cf0b11df9","year":2024},"citing_paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","snapshot_observed_at":"2026-08-11T11:09:19.365931Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T15:50:22.064477Z"},"links":{"citing_paper":"/paper/2501.13629"},"observation_digest":"sha256:840368d2582b9679646000634251f5f5bd7b605416a426f9e07b41cd33be1f8b","observation_id":"f15bdfe8-a257-4a2b-99f6-332d94dff2e6","resolution":{"observed_at":"2026-08-10T15:50:22.867008Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17834","last_updated":"2024-02-27T19:00:07Z","snapshot_observed_at":"2026-07-06T17:36:27.931373Z","submitted_at":"2024-02-27T19:00:07Z","title":"Stable LM 2 1.6B Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17834","snapshot_observed_at":"2026-08-10T15:50:21.836712Z","title":"Stable lm 2 1.6 b technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","snapshot_observed_at":"2026-08-11T11:09:19.365931Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T15:50:21.836712Z"},"links":{"cited_paper":"/paper/2402.17834","citing_paper":"/paper/2501.13629"},"observation_digest":"sha256:0350b6a5af4e782b30fda63bb27ba774b93d219639bb4a1f2ce8e7d844ed36a2","observation_id":"975c55ac-f182-4b34-9ee7-74e2f95ebfab","resolution":{"observed_at":"2026-08-10T15:50:21.836712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-10T15:50:21.841537Z","title":"E., and Cohan, A","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","snapshot_observed_at":"2026-08-11T11:09:19.365931Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T15:50:21.841537Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2501.13629"},"observation_digest":"sha256:b5c52546e156ec7e8eb4255db6259b3d4ca86cd542ec5104ebdbfded47ab4bfc","observation_id":"278f5b85-2afd-4c40-b38b-280b2bcc6710","resolution":{"observed_at":"2026-08-10T15:50:21.841537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-10T15:50:21.851361Z","title":"V ., R´e, C., and Mirhoseini, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","snapshot_observed_at":"2026-08-11T11:09:19.365931Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T15:50:21.851361Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2501.13629"},"observation_digest":"sha256:d626649f365c9082484a5719d120753901e5e3420546ce2308e94c56279a01e5","observation_id":"def6a48e-8f04-4e46-a548-266286d98b33","resolution":{"observed_at":"2026-08-10T15:50:21.851361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.12712","last_updated":"2023-04-13T20:41:31Z","snapshot_observed_at":"2026-08-03T04:49:15.195814Z","submitted_at":"2023-03-22T16:51:28Z","title":"Sparks of Artificial General Intelligence: Early experiments with GPT-4","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.12712","snapshot_observed_at":"2026-08-10T15:50:21.856599Z","title":"T., Li, Y ., Lundberg, S., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","snapshot_observed_at":"2026-08-11T11:09:19.365931Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T15:50:21.856599Z"},"links":{"cited_paper":"/paper/2303.12712","citing_paper":"/paper/2501.13629"},"observation_digest":"sha256:c86321cb24260ae369a06dcdf528c01d7ae636365b3e9e3f35800dbce423819d","observation_id":"5fc5cdeb-a7c1-4b39-9625-dbc7b46180be","resolution":{"observed_at":"2026-08-10T15:50:21.856599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-10T15:50:21.861854Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","snapshot_observed_at":"2026-08-11T11:09:19.365931Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T15:50:21.861854Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2501.13629"},"observation_digest":"sha256:566a7125c5d6ce36639ea22a1261d1aa542b75bc9fe84a353af24cfeed572298","observation_id":"035c2ef5-0855-4056-8ba5-6fac47e83ee7","resolution":{"observed_at":"2026-08-10T15:50:21.861854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.10044","last_updated":"2019-05-24T05:48:49Z","snapshot_observed_at":"2026-07-06T07:55:12.121264Z","submitted_at":"2019-05-24T05:48:49Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.10044","snapshot_observed_at":"2026-08-10T15:50:21.866755Z","title":"Boolq: Exploring the surprising difficulty of natural yes/no questions","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","snapshot_observed_at":"2026-08-11T11:09:19.365931Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T15:50:21.866755Z"},"links":{"cited_paper":"/paper/1905.10044","citing_paper":"/paper/2501.13629"},"observation_digest":"sha256:5c83e6f7d5c0999321e3a839a54877afafe31824813ff406f222806a4e8278f7","observation_id":"295a5ccb-bbeb-4423-8888-ce02474df9ff","resolution":{"observed_at":"2026-08-10T15:50:21.866755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06066","last_updated":"2024-01-11T17:31:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-11T17:31:42Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06066","snapshot_observed_at":"2026-08-10T15:50:21.880969Z","title":"DeepSeekMoE: Towards ultimate expert specialization in mixture-of-experts lan- guage models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","snapshot_observed_at":"2026-08-11T11:09:19.365931Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T15:50:21.880969Z"},"links":{"cited_paper":"/paper/2401.06066","citing_paper":"/paper/2501.13629"},"observation_digest":"sha256:c591bc8920a261b93397089ec9428f2f9cf245c00a4562dfc915e78a27f351fc","observation_id":"062b003f-1df7-44e2-8f13-5c5db5248b25","resolution":{"observed_at":"2026-08-10T15:50:21.880969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03208","last_updated":"2023-04-06T16:43:16Z","snapshot_observed_at":"2026-07-06T15:13:02.077291Z","submitted_at":"2023-04-06T16:43:16Z","title":"Cerebras-GPT: Open Compute-Optimal Language Models Trained on the Cerebras Wafer-Scale Cluster","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03208","snapshot_observed_at":"2026-08-10T15:50:21.885970Z","title":"Cerebras-gpt: Open compute- optimal language models trained on the cerebras wafer- scale cluster","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","snapshot_observed_at":"2026-08-11T11:09:19.365931Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T15:50:21.885970Z"},"links":{"cited_paper":"/paper/2304.03208","citing_paper":"/paper/2501.13629"},"observation_digest":"sha256:c7b90a4654a4681d321ab598c19b2620dcf1448f992f640c96778314fc3b1e76","observation_id":"439cc4b4-6d82-4bad-9ff3-74072317e416","resolution":{"observed_at":"2026-08-10T15:50:21.885970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-10T15:50:21.891051Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","snapshot_observed_at":"2026-08-11T11:09:19.365931Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T15:50:21.891051Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2501.13629"},"observation_digest":"sha256:db449d4695aef23a44ea67daa37cc32bc5aa7e3ee1ba0d330131b656e4fc27a2","observation_id":"829f0445-1862-4a57-9094-7be4c354c2ad","resolution":{"observed_at":"2026-08-10T15:50:21.891051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-08-07T13:56:34.167869Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12793","snapshot_observed_at":"2026-08-10T15:50:21.895633Z","title":"ChatGLM: A family of large language models from GLM-130B to GLM-4 all tools","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","snapshot_observed_at":"2026-08-11T11:09:19.365931Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T15:50:21.895633Z"},"links":{"cited_paper":"/paper/2406.12793","citing_paper":"/paper/2501.13629"},"observation_digest":"sha256:d91642c5daba2780780c8f1ee6851c9f6c194c360a11f86a3e0d7c2c66c3b1fc","observation_id":"24c2ab63-4ef5-482e-a2b8-e449b945103d","resolution":{"observed_at":"2026-08-10T15:50:21.895633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00838","last_updated":"2024-06-07T21:59:52Z","snapshot_observed_at":"2026-07-06T17:23:51.547578Z","submitted_at":"2024-02-01T18:28:55Z","title":"OLMo: Accelerating the Science of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00838","snapshot_observed_at":"2026-08-10T15:50:21.900910Z","title":"H., Ivison, H., Magnusson, I., Wang, Y ., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","snapshot_observed_at":"2026-08-11T11:09:19.365931Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T15:50:21.900910Z"},"links":{"cited_paper":"/paper/2402.00838","citing_paper":"/paper/2501.13629"},"observation_digest":"sha256:7c3c7fbcc05ab657f6e16f789a06bbf82a1a25d3960fef62b79c8c632591f03f","observation_id":"3ee3c350-8471-4513-b338-7772702138d9","resolution":{"observed_at":"2026-08-10T15:50:21.900910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11644","last_updated":"2023-10-02T06:12:30Z","snapshot_observed_at":"2026-08-10T21:55:43.802039Z","submitted_at":"2023-06-20T16:14:25Z","title":"Textbooks Are All You Need","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11644","snapshot_observed_at":"2026-08-10T15:50:21.905868Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","snapshot_observed_at":"2026-08-11T11:09:19.365931Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T15:50:21.905868Z"},"links":{"cited_paper":"/paper/2306.11644","citing_paper":"/paper/2501.13629"},"observation_digest":"sha256:809f8126d9b85b38f34ac0be24fb367657d5608e0847ce98346164ef8cb8f9d5","observation_id":"1d893888-6a44-44b9-84fd-15ad4464c20f","resolution":{"observed_at":"2026-08-10T15:50:21.905868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06899","last_updated":"2021-06-13T02:30:23Z","snapshot_observed_at":"2026-08-08T01:15:11.346221Z","submitted_at":"2021-06-13T02:30:23Z","title":"Memory-efficient Transformers via Top-$k$ Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06899","snapshot_observed_at":"2026-08-10T15:50:21.911004Z","title":"Memory-efficient transformers via top-k attention","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","snapshot_observed_at":"2026-08-11T11:09:19.365931Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T15:50:21.911004Z"},"links":{"cited_paper":"/paper/2106.06899","citing_paper":"/paper/2501.13629"},"observation_digest":"sha256:670b91c20cbe617dd7eefdf523ac3e81889065f3ee5bfc092b94c4de7ee8734e","observation_id":"61e915ce-4f28-43bb-8fb5-cc32721a0b38","resolution":{"observed_at":"2026-08-10T15:50:21.911004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:50:22.992513Z","title":"LM-infinite: Zero-shot extreme length generalization for large language models","venue":null,"work_id":"fc03602b-7a09-4191-a038-5e4eb7a1e1fd","year":2024},"citing_paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","snapshot_observed_at":"2026-08-11T11:09:19.365931Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T15:50:21.915897Z"},"links":{"citing_paper":"/paper/2501.13629"},"observation_digest":"sha256:3edd43b4157077ef68cb1b8d11d10a8c38a889bc1c942f37ba1bbf8596125f1d","observation_id":"5691c93a-99ce-47cf-8d30-535656870aea","resolution":{"observed_at":"2026-08-10T15:50:22.998026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11421","last_updated":"2024-03-18T02:30:23Z","snapshot_observed_at":"2026-08-09T07:19:27.126976Z","submitted_at":"2024-03-18T02:30:23Z","title":"FastDecode: High-Throughput GPU-Efficient LLM Serving using Heterogeneous Pipelines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11421","snapshot_observed_at":"2026-08-10T15:50:21.920956Z","title":"and Zhai, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","snapshot_observed_at":"2026-08-11T11:09:19.365931Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T15:50:21.920956Z"},"links":{"cited_paper":"/paper/2403.11421","citing_paper":"/paper/2501.13629"},"observation_digest":"sha256:29cc376f3cf3be3c62b5c56afa67b7872e0f6335dba4be7c235e815215f5780c","observation_id":"274c669d-aec4-49be-8811-1b201ef457fe","resolution":{"observed_at":"2026-08-10T15:50:21.920956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-10T12:35:09.020030Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-10T15:50:21.925987Z","title":"Measuring mas- sive multitask language understanding","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","snapshot_observed_at":"2026-08-11T11:09:19.365931Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T15:50:21.925987Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2501.13629"},"observation_digest":"sha256:bfa700bfc2b1827017b9cbbccee57695384d43bf8b4ef986c350455328a6d338","observation_id":"635abfae-34d2-4df7-bd5b-1490ff86acbe","resolution":{"observed_at":"2026-08-10T15:50:21.925987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-10T15:50:21.931406Z","title":"MiniCPM: Unveiling the potential of small language models with scalable train- ing strategies","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","snapshot_observed_at":"2026-08-11T11:09:19.365931Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T15:50:21.931406Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2501.13629"},"observation_digest":"sha256:678343914572f4e9665ea72a5cd39491b102c3878a5c45c4d416aa6c569c120b","observation_id":"b8535ed5-d8a8-4581-8a44-f55c0c1ba4f5","resolution":{"observed_at":"2026-08-10T15:50:21.931406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-10T15:50:21.936172Z","title":"B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J., and Amodei, D","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","snapshot_observed_at":"2026-08-11T11:09:19.365931Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T15:50:21.936172Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2501.13629"},"observation_digest":"sha256:3ea1bc7e7195054052b0a2f02f9172845597cfae930370542d238d5e51b606e6","observation_id":"46a89846-debf-453c-b16b-631f7528a2b8","resolution":{"observed_at":"2026-08-10T15:50:21.936172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11794","last_updated":"2025-04-21T17:48:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T17:42:57Z","title":"DataComp-LM: In search of the next generation of training sets for language models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11794","snapshot_observed_at":"2026-08-10T15:50:21.942092Z","title":"Datacomp- lm: In search of the next generation of training sets for lan- guage models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","snapshot_observed_at":"2026-08-11T11:09:19.365931Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T15:50:21.942092Z"},"links":{"cited_paper":"/paper/2406.11794","citing_paper":"/paper/2501.13629"},"observation_digest":"sha256:74cf22efb71f1724b774fb1e78f9d28143cfcf4c4402b61a0389227e96c4b0df","observation_id":"9594843b-cf1a-45de-9518-f2d03e9cac62","resolution":{"observed_at":"2026-08-10T15:50:21.942092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.08124","last_updated":"2020-07-16T05:52:16Z","snapshot_observed_at":"2026-08-10T13:06:17.421919Z","submitted_at":"2020-07-16T05:52:16Z","title":"LogiQA: A Challenge Dataset for Machine Reading Comprehension with Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.08124","snapshot_observed_at":"2026-08-10T15:50:21.946677Z","title":"Logiqa: A challenge dataset for machine reading comprehension with logical reasoning","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","snapshot_observed_at":"2026-08-11T11:09:19.365931Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T15:50:21.946677Z"},"links":{"cited_paper":"/paper/2007.08124","citing_paper":"/paper/2501.13629"},"observation_digest":"sha256:f60d96175d032ebacddc00e9c3fb3724de4ef6ecaacb6d360c2e43f6aa7c3d35","observation_id":"50ebd4a3-c042-4000-9574-e7d66d5ddbf4","resolution":{"observed_at":"2026-08-10T15:50:21.946677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14905","last_updated":"2024-06-27T03:53:46Z","snapshot_observed_at":"2026-08-07T05:13:11.135540Z","submitted_at":"2024-02-22T18:58:55Z","title":"MobileLLM: Optimizing Sub-billion Parameter Language Models for On-Device Use Cases","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14905","snapshot_observed_at":"2026-08-10T15:50:21.951455Z","title":"Scissorhands: Exploit- ing the persistence of importance hypothesis for LLM KV cache compression at test time","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","snapshot_observed_at":"2026-08-11T11:09:19.365931Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T15:50:21.951455Z"},"links":{"cited_paper":"/paper/2402.14905","citing_paper":"/paper/2501.13629"},"observation_digest":"sha256:c28208b4b6676dca6813f4abe4b2b9122e09d17d247b792d8128c50c691ac588","observation_id":"cbffae5e-3259-40a6-8775-7bd309d8af21","resolution":{"observed_at":"2026-08-10T15:50:21.951455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14619","last_updated":"2024-05-02T00:30:57Z","snapshot_observed_at":"2026-07-06T18:04:04.541434Z","submitted_at":"2024-04-22T23:12:03Z","title":"OpenELM: An Efficient Language Model Family with Open Training and Inference Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14619","snapshot_observed_at":"2026-08-10T15:50:21.955933Z","title":"H., Cao, Q., Horton, M., Jin, Y ., Sun, C., Mirzadeh, I., Najibi, M., Belenko, D., Zatloukal, P., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","snapshot_observed_at":"2026-08-11T11:09:19.365931Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T15:50:21.955933Z"},"links":{"cited_paper":"/paper/2404.14619","citing_paper":"/paper/2501.13629"},"observation_digest":"sha256:6d53e3a1dd1b84fc8cec13b5cc5eb01d2800220a8bb94265ff77c14fcb1f99e4","observation_id":"bd1c4c82-473f-4bf9-82d3-8dcd390411cf","resolution":{"observed_at":"2026-08-10T15:50:21.955933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01786","last_updated":"2023-05-29T16:40:37Z","snapshot_observed_at":"2026-08-06T03:54:27.439090Z","submitted_at":"2022-11-03T13:19:32Z","title":"Crosslingual Generalization through Multitask Finetuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01786","snapshot_observed_at":"2026-08-10T15:50:21.960583Z","title":"L., Bari, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","snapshot_observed_at":"2026-08-11T11:09:19.365931Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T15:50:21.960583Z"},"links":{"cited_paper":"/paper/2211.01786","citing_paper":"/paper/2501.13629"},"observation_digest":"sha256:e6a26292989a1b4918824771f29ef476b8d84dee18151807818442962908e437","observation_id":"935baa46-b278-4059-94c9-4216709a48d9","resolution":{"observed_at":"2026-08-10T15:50:21.960583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02150","last_updated":"2019-11-06T00:19:05Z","snapshot_observed_at":"2026-07-06T08:35:01.386074Z","submitted_at":"2019-11-06T00:19:05Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.02150","snapshot_observed_at":"2026-08-10T15:50:21.973704Z","title":"Fast transformer decoding: One write-head is all you need","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","snapshot_observed_at":"2026-08-11T11:09:19.365931Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T15:50:21.973704Z"},"links":{"cited_paper":"/paper/1911.02150","citing_paper":"/paper/2501.13629"},"observation_digest":"sha256:a62034cad0ac9dec430f5ab4ff58ddd4702f50981d282aaf124419194907b7f2","observation_id":"09ae0fca-2fec-4119-865b-cfcc12c788e2","resolution":{"observed_at":"2026-08-10T15:50:21.973704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05254","last_updated":"2024-05-09T14:12:45Z","snapshot_observed_at":"2026-08-04T14:59:09.585356Z","submitted_at":"2024-05-08T17:57:39Z","title":"You Only Cache Once: Decoder-Decoder Architectures for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05254","snapshot_observed_at":"2026-08-10T15:50:21.978594Z","title":"You only cache once: Decoder-decoder architectures for language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","snapshot_observed_at":"2026-08-11T11:09:19.365931Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T15:50:21.978594Z"},"links":{"cited_paper":"/paper/2405.05254","citing_paper":"/paper/2501.13629"},"observation_digest":"sha256:d395b53da5718d2351b5240bd521d77d385d4854ce0ee55b2779cf1745f988dd","observation_id":"87415344-5f4d-4e26-837e-257f1bcaa594","resolution":{"observed_at":"2026-08-10T15:50:21.978594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09261","last_updated":"2022-10-17T17:08:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-17T17:08:26Z","title":"Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09261","snapshot_observed_at":"2026-08-10T15:50:21.983664Z","title":"W., Chowdhery, A., Le, Q","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","snapshot_observed_at":"2026-08-11T11:09:19.365931Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T15:50:21.983664Z"},"links":{"cited_paper":"/paper/2210.09261","citing_paper":"/paper/2501.13629"},"observation_digest":"sha256:b2c9d0140ecb03c18c33586bd931582b8da0e41a7bf53579b8f3fa6f7d58b92c","observation_id":"8fb2f21f-e0ef-42ee-8ea8-e223838bbc8b","resolution":{"observed_at":"2026-08-10T15:50:21.983664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06209","last_updated":"2017-07-19T17:28:46Z","snapshot_observed_at":"2026-08-06T06:05:27.671303Z","submitted_at":"2017-07-19T17:28:46Z","title":"Crowdsourcing Multiple Choice Science Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06209","snapshot_observed_at":"2026-08-10T15:50:21.998284Z","title":"F., and Gardner, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","snapshot_observed_at":"2026-08-11T11:09:19.365931Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T15:50:21.998284Z"},"links":{"cited_paper":"/paper/1707.06209","citing_paper":"/paper/2501.13629"},"observation_digest":"sha256:f62309f1ff48b13be1e167c9bf02b18cac1ac9adcd3952b1dc1a99f0ff1bac4e","observation_id":"7adfde4e-8019-41b0-b75e-bfa92e2aef56","resolution":{"observed_at":"2026-08-10T15:50:21.998284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08152","last_updated":"2024-08-15T13:40:03Z","snapshot_observed_at":"2026-08-11T02:42:54.135677Z","submitted_at":"2024-08-15T13:40:03Z","title":"DeepSeek-Prover-V1.5: Harnessing Proof Assistant Feedback for Reinforcement Learning and Monte-Carlo Tree Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08152","snapshot_observed_at":"2026-08-10T15:50:22.003332Z","title":"Deepseek-prover-v1","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","snapshot_observed_at":"2026-08-11T11:09:19.365931Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T15:50:22.003332Z"},"links":{"cited_paper":"/paper/2408.08152","citing_paper":"/paper/2501.13629"},"observation_digest":"sha256:60a71c3272065b5ae226be2ee395d48247f281bad979116fdb0b860bee29058e","observation_id":"eb0ca9fb-c7d5-43a6-98d7-ad840d762eda","resolution":{"observed_at":"2026-08-10T15:50:22.003332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-10T15:50:22.008336Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","snapshot_observed_at":"2026-08-11T11:09:19.365931Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T15:50:22.008336Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2501.13629"},"observation_digest":"sha256:9646fb53125903cc39245c55bfc047df2569006221d83a36c1c61ba75a30890c","observation_id":"b910b473-1d98-4a38-bb75-b07b9fc2a918","resolution":{"observed_at":"2026-08-10T15:50:22.008336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-08-10T16:18:23.994244Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-10T15:50:22.012847Z","title":"Hellaswag: Can a machine really finish your sentence? arXiv preprint arXiv:1905.07830,","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","snapshot_observed_at":"2026-08-11T11:09:19.365931Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T15:50:22.012847Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2501.13629"},"observation_digest":"sha256:e47d96e7b8b804657bbb5727605bec828e7ee098a300ff8eeac8cb7c3ba2e338","observation_id":"ea036654-4797-48a1-85ee-43b240bba0bd","resolution":{"observed_at":"2026-08-10T15:50:22.012847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02385","last_updated":"2024-06-04T02:05:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-04T17:54:59Z","title":"TinyLlama: An Open-Source Small Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02385","snapshot_observed_at":"2026-08-10T15:50:22.017958Z","title":"TinyLlama: An open-source small language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","snapshot_observed_at":"2026-08-11T11:09:19.365931Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T15:50:22.017958Z"},"links":{"cited_paper":"/paper/2401.02385","citing_paper":"/paper/2501.13629"},"observation_digest":"sha256:eb4cb88d4cea67cb0156bcb701a11d9bdde4540fa7ef8e20337575af5c8d3f79","observation_id":"bb604531-9f86-4a95-a722-a19aae6b7d90","resolution":{"observed_at":"2026-08-10T15:50:22.017958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14294","last_updated":"2024-07-19T04:47:36Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T15:53:08Z","title":"A Survey on Efficient Inference for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14294","snapshot_observed_at":"2026-08-10T15:50:22.023813Z","title":"H2O: Heavy-hitter oracle for efficient generative inference of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","snapshot_observed_at":"2026-08-11T11:09:19.365931Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T15:50:22.023813Z"},"links":{"cited_paper":"/paper/2404.14294","citing_paper":"/paper/2501.13629"},"observation_digest":"sha256:cdb46058578746d3f8d9c92292e8d670c0cfa74f496979151f3bdb6ebfd445c7","observation_id":"8e693bb6-c968-4365-b2b1-5fe037c91411","resolution":{"observed_at":"2026-08-10T15:50:22.023813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:50:22.976478Z","title":null,"venue":null,"work_id":"88f26aad-917e-44d0-abaf-0e2146362c64","year":2023},"citing_paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","snapshot_observed_at":"2026-08-11T11:09:19.365931Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T15:50:22.029281Z"},"links":{"citing_paper":"/paper/2501.13629"},"observation_digest":"sha256:04a9041711c7386b878c8d7d32495d147ffb538003b3bbb1538f3e539c11cfaf","observation_id":"4ad9a14d-aa44-4051-baf3-e91343b9ea33","resolution":{"observed_at":"2026-08-10T15:50:22.981594Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:50:22.958673Z","title":null,"venue":null,"work_id":"f4acbbf3-eb00-4ecd-ab57-0dae38824be3","year":2020},"citing_paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","snapshot_observed_at":"2026-08-11T11:09:19.365931Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T15:50:22.034114Z"},"links":{"citing_paper":"/paper/2501.13629"},"observation_digest":"sha256:f898a59a1fbc86185013e26325625b1e9ac0b934f3f8ab01045d11bfc1a8d399","observation_id":"57436a0e-d8d3-464e-9265-fec22c8ab6b7","resolution":{"observed_at":"2026-08-10T15:50:22.963628Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:50:22.943263Z","title":"MQA is a variant of the standard Multi-Head Attention (MHA) mechanism, where all query heads share a single key head and value head","venue":null,"work_id":"ac2af128-616e-483a-8b7b-65f906ff1bcc","year":2023},"citing_paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","snapshot_observed_at":"2026-08-11T11:09:19.365931Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T15:50:22.039598Z"},"links":{"citing_paper":"/paper/2501.13629"},"observation_digest":"sha256:1b3d8110f078f9e2f3ca1abc9af139d98d48feb92cf6723c3aa40c274d3bd456","observation_id":"11b3c6bb-3722-444c-825b-b1afd5d9021d","resolution":{"observed_at":"2026-08-10T15:50:22.947879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:50:22.911826Z","title":"This operation significantly enhances inference efficiency by reducing memory usage","venue":null,"work_id":"1e81da36-344a-4901-9be8-82c415fa4093","year":2023},"citing_paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","snapshot_observed_at":"2026-08-11T11:09:19.365931Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T15:50:22.049757Z"},"links":{"citing_paper":"/paper/2501.13629"},"observation_digest":"sha256:835eced4b71c79ef4abdfdb94684c265af2c92a2ccca458c1da62e3390dc8b6c","observation_id":"5f356d01-08c5-4785-8ea8-fdd48ee032cb","resolution":{"observed_at":"2026-08-10T15:50:22.917344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:50:22.895440Z","title":"Sel.V-top100","venue":null,"work_id":"8792d6f7-4452-4ea3-918b-6a460eae6ce5","year":2021},"citing_paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","snapshot_observed_at":"2026-08-11T11:09:19.365931Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T15:50:22.055569Z"},"links":{"citing_paper":"/paper/2501.13629"},"observation_digest":"sha256:8a86158d596e4e01664cfcfa3f5e6aa6e3ae5333ce5bb8b83bdb81982ccc1f61","observation_id":"c40c6226-cc4a-4d8c-b9e4-8d0d8c9105b2","resolution":{"observed_at":"2026-08-10T15:50:22.900479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:50:22.878290Z","title":"We utilize the same vocabulary as Llama3 (Dubey et al., 2024), with a vocabulary size of 128k","venue":null,"work_id":"77ff39cf-ede3-4f1b-b0d6-695f7cfeab6b","year":2024},"citing_paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","snapshot_observed_at":"2026-08-11T11:09:19.365931Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T15:50:22.059879Z"},"links":{"citing_paper":"/paper/2501.13629"},"observation_digest":"sha256:e6ccc99e8aefb258c89fcfef3296bd0be055d54462ae1ef88090e82d8a3b4b21","observation_id":"76baeb35-e653-4ecf-b9e0-af6f355cfb82","resolution":{"observed_at":"2026-08-10T15:50:22.883032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:50:22.844774Z","title":null,"venue":null,"work_id":"4c0d0647-efdd-48ea-a83e-a08a5c3b8057","year":2020},"citing_paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","snapshot_observed_at":"2026-08-11T11:09:19.365931Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T15:50:22.068540Z"},"links":{"citing_paper":"/paper/2501.13629"},"observation_digest":"sha256:8d84fc179e01bc96ec81a5002467661f95e23ebe556c7175225d7c8a494d1c44","observation_id":"df503ac4-0015-466c-965c-7ff532b32281","resolution":{"observed_at":"2026-08-10T15:50:22.849794Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:50:22.827157Z","title":null,"venue":null,"work_id":"6431f807-7a74-47e4-b97c-8a084ad53123","year":2021},"citing_paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","snapshot_observed_at":"2026-08-11T11:09:19.365931Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T15:50:22.073236Z"},"links":{"citing_paper":"/paper/2501.13629"},"observation_digest":"sha256:538d2d70bafd2ebde2ca590341efe94617bcf4f9c681cc4226e140118ea2f96e","observation_id":"06476e3c-9832-40d5-81aa-3028b31efde2","resolution":{"observed_at":"2026-08-10T15:50:22.832044Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:50:22.808119Z","title":"The evaluation results on various general, coding and math problem-solving benchmarks are shown in Table","venue":null,"work_id":"d2fdea37-0cd4-4d59-88c3-0d3f8e2bb2b0","year":2021},"citing_paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","snapshot_observed_at":"2026-08-11T11:09:19.365931Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T15:50:22.077513Z"},"links":{"citing_paper":"/paper/2501.13629"},"observation_digest":"sha256:7bad8b9ac598a59486e0bb9c649900f92712652d9b31260d8dd1abd53dd3df5a","observation_id":"4cbb45b9-6355-44b6-819d-8a3c5b23bdbe","resolution":{"observed_at":"2026-08-10T15:50:22.815410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17557","last_updated":"2024-10-31T11:37:49Z","snapshot_observed_at":"2026-08-02T15:25:02.551919Z","submitted_at":"2024-06-25T13:50:56Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17557","snapshot_observed_at":"2026-08-10T15:50:21.964947Z","title":"The fineweb datasets: Decanting the web for the finest text data at scale","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","snapshot_observed_at":"2026-08-11T11:09:19.365931Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-10T15:50:21.964947Z"},"links":{"cited_paper":"/paper/2406.17557","citing_paper":"/paper/2501.13629"},"observation_digest":"sha256:045924380eecf36757e177bed1be29a410e175cd561dc13068f6fea455c52f79","observation_id":"f6103bd0-c76c-49ba-a690-9e296062065f","resolution":{"observed_at":"2026-08-10T15:50:21.964947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01574","last_updated":"2024-11-06T02:54:00Z","snapshot_observed_at":"2026-08-06T00:29:17.674418Z","submitted_at":"2024-06-03T17:53:00Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01574","snapshot_observed_at":"2026-08-10T15:50:21.993095Z","title":"Mmlu-pro: A more robust and challenging multi-task language under- standing benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","snapshot_observed_at":"2026-08-11T11:09:19.365931Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-10T15:50:21.993095Z"},"links":{"cited_paper":"/paper/2406.01574","citing_paper":"/paper/2501.13629"},"observation_digest":"sha256:8940edad5be6c4cde21946a2da292fb9dfb39bff27df34276e833fd24e1b3bb0","observation_id":"7cc7a532-dd2d-43f2-973c-29bb34010358","resolution":{"observed_at":"2026-08-10T15:50:21.993095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-10T15:50:21.876185Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","snapshot_observed_at":"2026-08-11T11:09:19.365931Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-10T15:50:21.876185Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2501.13629"},"observation_digest":"sha256:651745e5f8a6138b42079e340b81d42c7f8d702b49d2b750282c5da7394199ea","observation_id":"fc2e5ab9-fa6a-48df-824a-4ae84726c406","resolution":{"observed_at":"2026-08-10T15:50:21.876185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-10T15:50:21.871591Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","snapshot_observed_at":"2026-08-11T11:09:19.365931Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-10T15:50:21.871591Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2501.13629"},"observation_digest":"sha256:92dd6795fb345d4351c81b001b7bc3fe7ae4e0a4a3613dcafd12c59d2ac23544","observation_id":"4bb69983-4524-4a16-aaa7-9f5efa17537a","resolution":{"observed_at":"2026-08-10T15:50:21.871591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12981","last_updated":"2024-05-21T17:59:29Z","snapshot_observed_at":"2026-08-02T00:33:35.724101Z","submitted_at":"2024-05-21T17:59:29Z","title":"Reducing Transformer Key-Value Cache Size with Cross-Layer Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12981","snapshot_observed_at":"2026-08-10T15:50:21.846487Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","snapshot_observed_at":"2026-08-11T11:09:19.365931Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-10T15:50:21.846487Z"},"links":{"cited_paper":"/paper/2405.12981","citing_paper":"/paper/2501.13629"},"observation_digest":"sha256:444ea27d55d21a5fbefd26bceb75ae0264e21d5e2d4ba3993f077c239d0cfc35","observation_id":"2a8512ca-d088-4f2a-b192-7d6577b5871b","resolution":{"observed_at":"2026-08-10T15:50:21.846487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10631","last_updated":"2024-03-15T19:14:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-16T17:54:07Z","title":"Llemma: An Open Language Model For Mathematics","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10631","snapshot_observed_at":"2026-08-10T15:50:21.831787Z","title":"D., McAleer, S., Jiang, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","snapshot_observed_at":"2026-08-11T11:09:19.365931Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-10T15:50:21.831787Z"},"links":{"cited_paper":"/paper/2310.10631","citing_paper":"/paper/2501.13629"},"observation_digest":"sha256:996ac9db14ebade8837796f425c28af0eeab33bb418802b9205a922979bce5b6","observation_id":"be63b3b5-8dd8-49ae-979b-8de0f1878524","resolution":{"observed_at":"2026-08-10T15:50:21.831787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-10T15:50:21.988323Z","title":"S., Love, J., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","snapshot_observed_at":"2026-08-11T11:09:19.365931Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-10T15:50:21.988323Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2501.13629"},"observation_digest":"sha256:5b1917f15a7ed9e2728f47a278755d727f4f1c302724c500d52d81caad71f798","observation_id":"9f848709-c9fe-4e2b-a873-8d53b114eaff","resolution":{"observed_at":"2026-08-10T15:50:21.988323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:50:23.009223Z","title":"GQA: Training general- ized multi-query transformer models from multi-head checkpoints","venue":null,"work_id":"62437f47-dc85-4b38-a53c-2ce019160f21","year":2023},"citing_paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","snapshot_observed_at":"2026-08-11T11:09:19.365931Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-10T15:50:21.822080Z"},"links":{"citing_paper":"/paper/2501.13629"},"observation_digest":"sha256:389a7c50677f136213a34a708221671547f9ef8f29bad607a00c7e9dff2ebc27","observation_id":"6253936d-fde1-4d71-91ac-ec2a0ebd7546","resolution":{"observed_at":"2026-08-10T15:50:23.014540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-10T15:50:21.826854Z","title":"Program synthesis with large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","snapshot_observed_at":"2026-08-11T11:09:19.365931Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-10T15:50:21.826854Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2501.13629"},"observation_digest":"sha256:e39261c245ee5f65de31a044dcf9e908bf031f73cb167319bcd2847aac130beb","observation_id":"4912977d-a85e-4533-baaf-f934a7d80f5a","resolution":{"observed_at":"2026-08-10T15:50:21.826854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:50:22.928049Z","title":null,"venue":null,"work_id":"392c0d38-5ffd-4691-9679-af743433dfc6","year":2019},"citing_paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","snapshot_observed_at":"2026-08-11T11:09:19.365931Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models","version":2},"reference_index":2048,"source":"pdf_text","source_observed_at":"2026-08-10T15:50:22.044486Z"},"links":{"citing_paper":"/paper/2501.13629"},"observation_digest":"sha256:17a2139fb6673308d4f6b98b7b9d63ed75a0af4bb38b85c3a1e764c72b1d401a","observation_id":"a4a29beb-0ceb-4799-893c-080363cfe96f","resolution":{"observed_at":"2026-08-10T15:50:22.932979Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.13629","last_updated":"2025-02-10T17:19:21Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-11T11:09:19.365931Z","submitted_at":"2025-01-23T12:58:14Z","title":"Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":46,"verified_exact":0,"verified_fuzzy":7},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 2 inbound Pith citation observations for arXiv:2501.13629."}