{"as_of":"2026-08-11T01:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:eb900fd4b1161c48e2efe69b5200758177b03c390573762290098bda5a6df663","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T00:55:04.061512Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:42:52.656467Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T13:32:36.395278Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-11T00:45:10.967718Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19255","snapshot_observed_at":"2026-08-07T15:42:52.656467Z","title":"Multi-matrix factorization attention.arXiv preprint arXiv:2412.19255, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14010","last_updated":"2025-05-20T07:04:34Z","snapshot_observed_at":"2026-08-10T11:59:23.230097Z","submitted_at":"2025-05-20T07:04:34Z","title":"UHD Image Dehazing via anDehazeFormer with Atmospheric-aware KV Cache","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:52.656467Z"},"links":{"cited_paper":"/paper/2412.19255","citing_paper":"/paper/2505.14010"},"observation_digest":"sha256:fcd3838ffc0644859cf9e0ebe82130edbdf123110dad73f675fa0ca35e969363","observation_id":"8d6772a9-cfea-4d8e-8201-6ebe13e2042e","resolution":{"observed_at":"2026-08-07T15:42:52.656467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-11T00:45:10.967718Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"cited_work":{"arxiv_id":"2412.19255","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.19255","snapshot_observed_at":"2026-08-07T13:32:36.395278Z","title":"Multi-matrix Factorization Attention","venue":"cs.LG","work_id":"8fb87a74-f9c6-440c-852e-e41506b27e1e","year":2024},"citing_paper":{"arxiv_id":"2505.21487","last_updated":"2025-05-27T17:54:07Z","snapshot_observed_at":"2026-08-07T13:24:37.243429Z","submitted_at":"2025-05-27T17:54:07Z","title":"Hardware-Efficient Attention for Fast Decoding","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T13:32:30.968649Z"},"links":{"cited_paper":"/paper/2412.19255","citing_paper":"/paper/2505.21487"},"observation_digest":"sha256:764c04471a130301fcd3557ba2d93e1717ada728e40559a14bb4e9f4c39b7b51","observation_id":"52e12996-15d3-485f-bf64-f646d8edfe21","resolution":{"observed_at":"2026-08-07T13:32:36.488542Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.19255/citation-record","integrity":"/paper/2412.19255/integrity","json":"/paper/2412.19255/citation-record.json","paper":"/paper/2412.19255"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-11T00:55:03.742782Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-11T00:45:10.967718Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T00:55:03.742782Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2412.19255"},"observation_digest":"sha256:ba0186262610f636c39a4684caa517345ac41331d8ae946d772cc27e6d190765","observation_id":"bcb67969-c01d-48d7-81b1-b21ff41c4f52","resolution":{"observed_at":"2026-08-11T00:55:03.742782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16867","last_updated":"2023-11-29T19:45:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-28T15:12:47Z","title":"The Falcon Series of Open Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16867","snapshot_observed_at":"2026-08-11T00:55:03.749966Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-11T00:45:10.967718Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T00:55:03.749966Z"},"links":{"cited_paper":"/paper/2311.16867","citing_paper":"/paper/2412.19255"},"observation_digest":"sha256:6e314c7031244d09a43def7e2807e05f4aba8438a14ce440ecf75a00cdfe3805","observation_id":"e76f2303-2042-4701-89b5-4dd16375b2e6","resolution":{"observed_at":"2026-08-11T00:55:03.749966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:55:05.194384Z","title":null,"venue":null,"work_id":"f2534c92-cb4e-4adb-a138-b8118de37b34","year":2024},"citing_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-11T00:45:10.967718Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T00:55:03.756583Z"},"links":{"citing_paper":"/paper/2412.19255"},"observation_digest":"sha256:1f7697168daf259e1359d7c2daa013419c84a0643038bd50d5764101f1444b7c","observation_id":"3caed963-bb3b-451a-b038-868ea514c13b","resolution":{"observed_at":"2026-08-11T00:55:05.201098Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.07028","last_updated":"2020-02-17T16:16:40Z","snapshot_observed_at":"2026-08-06T13:29:02.573348Z","submitted_at":"2020-02-17T16:16:40Z","title":"Low-Rank Bottleneck in Multi-head Attention Models","version":1},"cited_work":{"arxiv_id":"2002.07028","doi":null,"metadata_source":"pith","pith_arxiv_id":"2002.07028","snapshot_observed_at":"2026-08-11T00:55:04.959070Z","title":"Low-Rank Bottleneck in Multi-head Attention Models","venue":"cs.LG","work_id":"d2c23028-3021-48ba-ae00-1227ea11e228","year":2020},"citing_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-11T00:45:10.967718Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T00:55:03.763727Z"},"links":{"cited_paper":"/paper/2002.07028","citing_paper":"/paper/2412.19255"},"observation_digest":"sha256:e1e0f5cf956f5d155ee1e92b2a916414a0b3f4b1489e1269536ab7ac8c37ebdc","observation_id":"92b67c6b-c2ad-4f6e-80ab-be3fd0fa0894","resolution":{"observed_at":"2026-08-11T00:55:04.965410Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:55:03.772492Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-11T00:45:10.967718Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T00:55:03.772492Z"},"links":{"citing_paper":"/paper/2412.19255"},"observation_digest":"sha256:f25b2bea5261bd815f5dfcfc4e2e1a717837a5001d061f34b5fe90cb935bc9e4","observation_id":"ae81c9a7-50c7-4072-a22b-4d00f3febee7","resolution":{"observed_at":"2026-08-11T00:55:03.772492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12981","last_updated":"2024-05-21T17:59:29Z","snapshot_observed_at":"2026-08-02T00:33:35.724101Z","submitted_at":"2024-05-21T17:59:29Z","title":"Reducing Transformer Key-Value Cache Size with Cross-Layer Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12981","snapshot_observed_at":"2026-08-11T00:55:03.777756Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-11T00:45:10.967718Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T00:55:03.777756Z"},"links":{"cited_paper":"/paper/2405.12981","citing_paper":"/paper/2412.19255"},"observation_digest":"sha256:4f3a0c9b9c07914263018e686e1287f32d8f163226c1fa1bbc5ba114f7972bf3","observation_id":"e6d12d0e-1a79-4b0e-8f87-f82d9fe68267","resolution":{"observed_at":"2026-08-11T00:55:03.777756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.10044","last_updated":"2019-05-24T05:48:49Z","snapshot_observed_at":"2026-07-06T07:55:12.121264Z","submitted_at":"2019-05-24T05:48:49Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.10044","snapshot_observed_at":"2026-08-11T00:55:03.784450Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-11T00:45:10.967718Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T00:55:03.784450Z"},"links":{"cited_paper":"/paper/1905.10044","citing_paper":"/paper/2412.19255"},"observation_digest":"sha256:d64ccc03fa5115f531719657cd7340bae45aac63100dc04ac9623efb38c0269e","observation_id":"678b5c3c-087f-4b4a-9bef-24fa8d8c3f0b","resolution":{"observed_at":"2026-08-11T00:55:03.784450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:55:03.789651Z","title":"Xu, Huazuo Gao, Deli Chen, Jiashi Li, Wangding Zeng, Xingkai Yu, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-11T00:45:10.967718Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T00:55:03.789651Z"},"links":{"citing_paper":"/paper/2412.19255"},"observation_digest":"sha256:affe89d9d74be25b59aecd943367ae07cc040a2f6207c25c860f29cb95706d68","observation_id":"c451885a-bfe1-4cfe-b4a3-0e86e51439ff","resolution":{"observed_at":"2026-08-11T00:55:03.789651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14135","last_updated":"2022-06-23T17:53:32Z","snapshot_observed_at":"2026-07-06T13:14:48.753329Z","submitted_at":"2022-05-27T17:53:09Z","title":"FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14135","snapshot_observed_at":"2026-08-11T00:55:03.794878Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher R \\'e","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-11T00:45:10.967718Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T00:55:03.794878Z"},"links":{"cited_paper":"/paper/2205.14135","citing_paper":"/paper/2412.19255"},"observation_digest":"sha256:2b4f5787cfb3b2106b089ffdb2cfed8ec50a9b6bc29582d065c81d4d066cbc74","observation_id":"73001b93-6c2f-4a70-9f99-d319f3a44414","resolution":{"observed_at":"2026-08-11T00:55:03.794878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-11T00:55:03.802359Z","title":"Zhang, Hanwei Xu, Hao Yang, Haowei Zhang, Honghui Ding, Huajian Xin, Huazuo Gao, Hui Li, Hui Qu, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-11T00:45:10.967718Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T00:55:03.802359Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2412.19255"},"observation_digest":"sha256:9a5bc80e76c803a1000481e4824e9aecfed1853beb554fabd419a876547aba80","observation_id":"db60e678-aaca-40c2-8c99-d91446af1d55","resolution":{"observed_at":"2026-08-11T00:55:03.802359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10830","last_updated":"2024-05-02T17:10:44Z","snapshot_observed_at":"2026-08-03T15:51:51.613383Z","submitted_at":"2024-04-16T18:08:29Z","title":"Fewer Truncations Improve Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10830","snapshot_observed_at":"2026-08-11T00:55:03.808027Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-11T00:45:10.967718Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T00:55:03.808027Z"},"links":{"cited_paper":"/paper/2404.10830","citing_paper":"/paper/2412.19255"},"observation_digest":"sha256:3b71d4c8731e4cb646a3b349520b9e288101fffab2970bacab7c75c20cf7e130","observation_id":"7d058330-4dd1-409d-9251-92e2e7dfc3b0","resolution":{"observed_at":"2026-08-11T00:55:03.808027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-11T00:55:03.812973Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-11T00:45:10.967718Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T00:55:03.812973Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2412.19255"},"observation_digest":"sha256:b33f2160f87123ec7cbb9551423b30a2bf1037b524a7bb74362dde93ba95ede7","observation_id":"8f0ae81e-355c-4074-a3a8-7d89bebb67d5","resolution":{"observed_at":"2026-08-11T00:55:03.812973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:55:03.819178Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-11T00:45:10.967718Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T00:55:03.819178Z"},"links":{"citing_paper":"/paper/2412.19255"},"observation_digest":"sha256:7d6c3eb5429b540b40e27fb0c4b25e0a128a49e78572d265a8224fbcb811c8ac","observation_id":"27d5b3ed-c61a-459a-8222-f31e5773b378","resolution":{"observed_at":"2026-08-11T00:55:03.819178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-11T00:55:03.824319Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-11T00:45:10.967718Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T00:55:03.824319Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2412.19255"},"observation_digest":"sha256:fb3d64159f3132a4381e31ed7bf3d76d2777b04525d95f71a6918cd976556897","observation_id":"16a0bccf-9d73-4f53-abfc-ae3a4467ff13","resolution":{"observed_at":"2026-08-11T00:55:03.824319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-10T12:35:09.020030Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-11T00:55:03.828877Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-11T00:45:10.967718Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T00:55:03.828877Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2412.19255"},"observation_digest":"sha256:fe7723e12d4c9730ba4865ae4e7bf44760d1148618f9d44a525c520708827da1","observation_id":"9e1f3c55-eea6-43c0-ab90-debb06b7fe67","resolution":{"observed_at":"2026-08-11T00:55:03.828877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-11T00:55:03.833918Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-11T00:45:10.967718Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T00:55:03.833918Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2412.19255"},"observation_digest":"sha256:7437981b4df258bd45cd32515034fe681fd3db7d9ec3b6fda212897dcd660566","observation_id":"515c7370-7777-40ac-8362-1158ad466c85","resolution":{"observed_at":"2026-08-11T00:55:03.833918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-08-10T09:20:57.804343Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-11T00:55:03.839350Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-11T00:45:10.967718Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T00:55:03.839350Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2412.19255"},"observation_digest":"sha256:6086f0856343ac01d768a00e89f183ddbcf91d5fd65b92b9c442751e7c0ecf9f","observation_id":"1e29b1d1-8265-487e-b149-d23950b0e44b","resolution":{"observed_at":"2026-08-11T00:55:03.839350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-11T00:55:03.844509Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu , Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-11T00:45:10.967718Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T00:55:03.844509Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2412.19255"},"observation_digest":"sha256:a4d02025dc3f5fc7456b5b7419211940400fcedaea66a0216e7de549e4d7b11a","observation_id":"8fcc3c4c-8363-4af5-8151-9b398e34449c","resolution":{"observed_at":"2026-08-11T00:55:03.844509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-11T00:55:03.850264Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-11T00:45:10.967718Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T00:55:03.850264Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2412.19255"},"observation_digest":"sha256:2400b9d224c3b71ed22f959c502283589a8452a99b5e132b3006354cf6f26df3","observation_id":"a5f8428a-9483-4257-9547-65091a61dd79","resolution":{"observed_at":"2026-08-11T00:55:03.850264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16236","last_updated":"2020-08-31T11:09:32Z","snapshot_observed_at":"2026-08-06T23:24:28.908251Z","submitted_at":"2020-06-29T17:55:38Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16236","snapshot_observed_at":"2026-08-11T00:55:03.855619Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-11T00:45:10.967718Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T00:55:03.855619Z"},"links":{"cited_paper":"/paper/2006.16236","citing_paper":"/paper/2412.19255"},"observation_digest":"sha256:642e18fb05ad655ccfbfda986567f2805194939f94911cb3c0d454c87615be4a","observation_id":"e29ba3a1-f6a0-474b-a947-cb21c7a285ae","resolution":{"observed_at":"2026-08-11T00:55:03.855619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23819","last_updated":"2024-10-31T11:04:07Z","snapshot_observed_at":"2026-08-10T20:16:20.965333Z","submitted_at":"2024-10-31T11:04:07Z","title":"Weight decay induces low-rank attention layers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23819","snapshot_observed_at":"2026-08-11T00:55:03.863080Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-11T00:45:10.967718Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T00:55:03.863080Z"},"links":{"cited_paper":"/paper/2410.23819","citing_paper":"/paper/2412.19255"},"observation_digest":"sha256:8d3c5f8176ecd98e07502196884cb5261d466566b192e68abc05ad8dcf086ef7","observation_id":"26de0459-1aed-4a8c-9acb-590f0067ebeb","resolution":{"observed_at":"2026-08-11T00:55:03.863080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11501","last_updated":"2022-11-18T17:20:27Z","snapshot_observed_at":"2026-08-09T13:53:26.987097Z","submitted_at":"2022-11-18T17:20:27Z","title":"DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11501","snapshot_observed_at":"2026-08-11T00:55:03.868518Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-11T00:45:10.967718Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T00:55:03.868518Z"},"links":{"cited_paper":"/paper/2211.11501","citing_paper":"/paper/2412.19255"},"observation_digest":"sha256:e7bda5fc53e2824229ad84823c9675f6ef25f7676b32e45acd079cad4f2acd3f","observation_id":"0e627618-f2cf-411c-9900-7e6e3932e4b3","resolution":{"observed_at":"2026-08-11T00:55:03.868518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19887","last_updated":"2024-07-03T14:30:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-28T23:55:06Z","title":"Jamba: A Hybrid Transformer-Mamba Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19887","snapshot_observed_at":"2026-08-11T00:55:03.873620Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-11T00:45:10.967718Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T00:55:03.873620Z"},"links":{"cited_paper":"/paper/2403.19887","citing_paper":"/paper/2412.19255"},"observation_digest":"sha256:3f67c5a709911566e53989dd4a4eb8f52c32376a3f88b2096bf08b37ab8c7153","observation_id":"2d07eded-e829-4e6b-8ea6-878072c60e98","resolution":{"observed_at":"2026-08-11T00:55:03.873620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-11T00:55:03.878675Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-11T00:45:10.967718Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T00:55:03.878675Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2412.19255"},"observation_digest":"sha256:f962570d56bfea69e6cf1f07c955bb529bce5c82b7129950ee61b56e219684ad","observation_id":"7f855f8d-2a7d-47cc-962b-b53268c255a9","resolution":{"observed_at":"2026-08-11T00:55:03.878675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02063","last_updated":"2024-11-04T13:06:17Z","snapshot_observed_at":"2026-07-06T19:44:47.582139Z","submitted_at":"2024-11-04T13:06:17Z","title":"Scalable Efficient Training of Large Language Models with Low-dimensional Projected Attention","version":1},"cited_work":{"arxiv_id":"2411.02063","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.02063","snapshot_observed_at":"2026-08-11T00:55:04.146913Z","title":"Scalable Efficient Training of Large Language Models with Low-dimensional Projected Attention","venue":"cs.CL","work_id":"491d9298-5f0c-4dbe-9935-8b13716a7666","year":2024},"citing_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-11T00:45:10.967718Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T00:55:03.884161Z"},"links":{"cited_paper":"/paper/2411.02063","citing_paper":"/paper/2412.19255"},"observation_digest":"sha256:d7a1d46c45d14a86ddd9ce16dc8e14abf573125ce5b91f92ff0fc6c127051336","observation_id":"2a33144a-e033-44d2-8b79-e10b0888ef76","resolution":{"observed_at":"2026-08-11T00:55:04.155091Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:55:03.890189Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-11T00:45:10.967718Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T00:55:03.890189Z"},"links":{"citing_paper":"/paper/2412.19255"},"observation_digest":"sha256:6d63330eceade3dcfa01a0c98769c563cca5fa06bca83607854ad70d96911f8d","observation_id":"3e62234d-b87f-4364-82fe-676556fbf698","resolution":{"observed_at":"2026-08-11T00:55:03.890189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02060","last_updated":"2025-03-03T01:25:46Z","snapshot_observed_at":"2026-07-29T16:11:06.082798Z","submitted_at":"2024-09-03T17:08:20Z","title":"OLMoE: Open Mixture-of-Experts Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02060","snapshot_observed_at":"2026-08-11T00:55:03.895257Z","title":"Smith, Pang Wei Koh, Amanpreet Singh, and Hannaneh Hajishirzi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-11T00:45:10.967718Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T00:55:03.895257Z"},"links":{"cited_paper":"/paper/2409.02060","citing_paper":"/paper/2412.19255"},"observation_digest":"sha256:1f924ac6cdefb96245608f3e9f1cbf216c04a0448341d6bdd6fbc7777db077cb","observation_id":"bd718645-5319-4ee1-8220-a2a76148f831","resolution":{"observed_at":"2026-08-11T00:55:03.895257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-08T01:15:17.906950Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-11T00:55:03.901462Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-11T00:45:10.967718Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T00:55:03.901462Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2412.19255"},"observation_digest":"sha256:83ddc0899b7f4adb922136c7453a82f3b42068c0fa60b60097dfef72d0a53b63","observation_id":"52a26e0c-be81-4f2f-9c4c-ef851eb31be0","resolution":{"observed_at":"2026-08-11T00:55:03.901462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05892","last_updated":"2024-09-26T22:39:08Z","snapshot_observed_at":"2026-08-10T10:37:29.996750Z","submitted_at":"2024-04-08T22:20:59Z","title":"Eagle and Finch: RWKV with Matrix-Valued States and Dynamic Recurrence","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05892","snapshot_observed_at":"2026-08-11T00:55:03.907073Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-11T00:45:10.967718Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T00:55:03.907073Z"},"links":{"cited_paper":"/paper/2404.05892","citing_paper":"/paper/2412.19255"},"observation_digest":"sha256:9cde54d14d387da3ae40670a90005ace4d210f9dafcbafe9bc97f71b104b35d4","observation_id":"f9372660-e69a-4365-9c66-3cd35823a340","resolution":{"observed_at":"2026-08-11T00:55:03.907073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:55:03.912598Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-11T00:45:10.967718Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T00:55:03.912598Z"},"links":{"citing_paper":"/paper/2412.19255"},"observation_digest":"sha256:3fc6e49afed93a3a40206177ac20b25a57e0e6a4b78e61a6526c2ac5667dedfa","observation_id":"eab54852-8589-4d4c-996e-0ade451bf39a","resolution":{"observed_at":"2026-08-11T00:55:03.912598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.12409","last_updated":"2022-04-22T18:20:48Z","snapshot_observed_at":"2026-08-07T11:26:24.970964Z","submitted_at":"2021-08-27T17:35:06Z","title":"Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.12409","snapshot_observed_at":"2026-08-11T00:55:03.918833Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-11T00:45:10.967718Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T00:55:03.918833Z"},"links":{"cited_paper":"/paper/2108.12409","citing_paper":"/paper/2412.19255"},"observation_digest":"sha256:0c298153477abb8a29d857f32628b1188ee391099c22aedf6d7a3c217baa1f38","observation_id":"2439adca-13bd-43e4-bbc1-ec73fe15d66b","resolution":{"observed_at":"2026-08-11T00:55:03.918833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:55:03.924736Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-11T00:45:10.967718Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T00:55:03.924736Z"},"links":{"citing_paper":"/paper/2412.19255"},"observation_digest":"sha256:a01a3d85147780a00eb1781feaa5870026ef0dbf4efbaca795f5731c12b901b5","observation_id":"5a745ef7-1ac7-4647-81af-de117a6f7d03","resolution":{"observed_at":"2026-08-11T00:55:03.924736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:55:03.930221Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-11T00:45:10.967718Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T00:55:03.930221Z"},"links":{"citing_paper":"/paper/2412.19255"},"observation_digest":"sha256:8fdbf25011fef333bfc8d1ededc3ec84abaf991f6211be4e7b5c4e4cb35bdf19","observation_id":"e845b31c-b6c2-492a-acbb-35a364e79dd2","resolution":{"observed_at":"2026-08-11T00:55:03.930221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09728","last_updated":"2019-09-09T17:29:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-04-22T05:36:37Z","title":"SocialIQA: Commonsense Reasoning about Social Interactions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09728","snapshot_observed_at":"2026-08-11T00:55:03.944483Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-11T00:45:10.967718Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T00:55:03.944483Z"},"links":{"cited_paper":"/paper/1904.09728","citing_paper":"/paper/2412.19255"},"observation_digest":"sha256:7bfd1f3c5ebb5bad60c5c91f05f357f062b6aeddbddb6c6e58b812ed8d5ea25e","observation_id":"c53b8bad-ebfd-4a94-b39d-9071aada4429","resolution":{"observed_at":"2026-08-11T00:55:03.944483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1508.07909","last_updated":"2016-06-10T14:45:08Z","snapshot_observed_at":"2026-07-06T04:28:16.222296Z","submitted_at":"2015-08-31T16:37:31Z","title":"Neural Machine Translation of Rare Words with Subword Units","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1508.07909","snapshot_observed_at":"2026-08-11T00:55:03.953507Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-11T00:45:10.967718Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T00:55:03.953507Z"},"links":{"cited_paper":"/paper/1508.07909","citing_paper":"/paper/2412.19255"},"observation_digest":"sha256:aa59403daeec2c2d69864390cb54345dfb8b67524e3954235c532aeb04fdf0b6","observation_id":"044f62ea-03b4-499f-aa1f-934571b1e6e5","resolution":{"observed_at":"2026-08-11T00:55:03.953507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02150","last_updated":"2019-11-06T00:19:05Z","snapshot_observed_at":"2026-07-06T08:35:01.386074Z","submitted_at":"2019-11-06T00:19:05Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.02150","snapshot_observed_at":"2026-08-11T00:55:03.962019Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-11T00:45:10.967718Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T00:55:03.962019Z"},"links":{"cited_paper":"/paper/1911.02150","citing_paper":"/paper/2412.19255"},"observation_digest":"sha256:d9b760a578703c5725da27505f413e4f10aee48a4c1ce761444d683305f108a2","observation_id":"9dc26d3b-df67-433d-a6db-e221fa417004","resolution":{"observed_at":"2026-08-11T00:55:03.962019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-11T00:55:03.969065Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-11T00:45:10.967718Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T00:55:03.969065Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2412.19255"},"observation_digest":"sha256:ec8b10aee8276296a18525cbd41feaaf62b5fd41287cf2abeef69749ca7ca76a","observation_id":"46481ceb-e592-43b7-953d-e3d8f80a6bb7","resolution":{"observed_at":"2026-08-11T00:55:03.969065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.02436","last_updated":"2020-03-05T05:17:17Z","snapshot_observed_at":"2026-07-06T09:02:20.513789Z","submitted_at":"2020-03-05T05:17:17Z","title":"Talking-Heads Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.02436","snapshot_observed_at":"2026-08-11T00:55:03.976160Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-11T00:45:10.967718Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T00:55:03.976160Z"},"links":{"cited_paper":"/paper/2003.02436","citing_paper":"/paper/2412.19255"},"observation_digest":"sha256:d3020035fd29307b3a253ae34a567f4761df5f39df44b9842df3e340c578c8a4","observation_id":"f0cebf4b-e2e1-47b6-830e-0458faf94f32","resolution":{"observed_at":"2026-08-11T00:55:03.976160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-07-06T05:27:13.416519Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-11T00:55:03.982953Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-11T00:45:10.967718Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T00:55:03.982953Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2412.19255"},"observation_digest":"sha256:b5d5b20b294da4b7af1a7bd19fcd4fc67e8983f95472989adb34df55b1eecee0","observation_id":"d599db10-43d2-418a-9ce6-335e5f5feeeb","resolution":{"observed_at":"2026-08-11T00:55:03.982953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:55:03.989969Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-11T00:45:10.967718Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T00:55:03.989969Z"},"links":{"citing_paper":"/paper/2412.19255"},"observation_digest":"sha256:da243a3780c43badfbf09caa466905129f812b45e85350f34e16c464e5fd2a57","observation_id":"d1ad1292-b006-46c8-914a-c6e9b46962a9","resolution":{"observed_at":"2026-08-11T00:55:03.989969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09261","last_updated":"2022-10-17T17:08:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-17T17:08:26Z","title":"Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09261","snapshot_observed_at":"2026-08-11T00:55:04.003033Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-11T00:45:10.967718Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T00:55:04.003033Z"},"links":{"cited_paper":"/paper/2210.09261","citing_paper":"/paper/2412.19255"},"observation_digest":"sha256:88b99d46c3b7d12a1a27708fcab6176af999aa07594ca39adcd00ae7e56d377c","observation_id":"36bc1ab2-a1db-49a9-a90f-bcb34ab95f26","resolution":{"observed_at":"2026-08-11T00:55:04.003033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-11T00:55:04.009622Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-11T00:45:10.967718Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T00:55:04.009622Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2412.19255"},"observation_digest":"sha256:c1f40af93401e124b489b93ea202e6c2b41adfbbc26313afc98ac728dc9e7b5d","observation_id":"ecd3b455-2d7e-4233-af32-645607228eeb","resolution":{"observed_at":"2026-08-11T00:55:04.009622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-11T00:55:04.016132Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-11T00:45:10.967718Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T00:55:04.016132Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2412.19255"},"observation_digest":"sha256:c0835fb8f7763053aae27f41443a5f0adb45f8f19acb246d31fff92af2376a55","observation_id":"3ca8e6cc-aa11-482a-a0b4-51a81a288680","resolution":{"observed_at":"2026-08-11T00:55:04.016132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06209","last_updated":"2017-07-19T17:28:46Z","snapshot_observed_at":"2026-08-06T06:05:27.671303Z","submitted_at":"2017-07-19T17:28:46Z","title":"Crowdsourcing Multiple Choice Science Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06209","snapshot_observed_at":"2026-08-11T00:55:04.021750Z","title":"Liu, and Matt Gardner","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-11T00:45:10.967718Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T00:55:04.021750Z"},"links":{"cited_paper":"/paper/1707.06209","citing_paper":"/paper/2412.19255"},"observation_digest":"sha256:010b4495423a6b0e645949b0909a0c4570c04031add00b0d229103e80b4510dc","observation_id":"3dbcce2b-91ea-470b-b348-b6e9d2e20cf3","resolution":{"observed_at":"2026-08-11T00:55:04.021750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08553","last_updated":"2024-06-04T14:49:36Z","snapshot_observed_at":"2026-07-06T18:14:08.102261Z","submitted_at":"2024-05-14T12:41:11Z","title":"Improving Transformers with Dynamically Composable Multi-Head Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08553","snapshot_observed_at":"2026-08-11T00:55:04.027465Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-11T00:45:10.967718Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T00:55:04.027465Z"},"links":{"cited_paper":"/paper/2405.08553","citing_paper":"/paper/2412.19255"},"observation_digest":"sha256:c91e47e53e113035f8445fff2c034396d1b1f2d25fb8b83248c127ed3c2d6268","observation_id":"c02ce927-b42e-47cb-8078-db7de2b8cb3d","resolution":{"observed_at":"2026-08-11T00:55:04.027465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-08-11T00:55:04.032759Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-11T00:45:10.967718Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T00:55:04.032759Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2412.19255"},"observation_digest":"sha256:9b75ab67ca4b186e0c3e1432583884fdfe487d1de5d455a617d357771ed6f823","observation_id":"aa6f7a4b-58ba-466b-98c5-7c236e74f2fd","resolution":{"observed_at":"2026-08-11T00:55:04.032759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-08-10T16:18:23.994244Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-11T00:55:04.038913Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-11T00:45:10.967718Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T00:55:04.038913Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2412.19255"},"observation_digest":"sha256:e5615c9eb3f5c035b642622e82ae44fcb8f12f3d3d27df2eebc39d056a11babc","observation_id":"89770ec0-a618-4696-b185-7fcf6e6be6f2","resolution":{"observed_at":"2026-08-11T00:55:04.038913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:55:04.044373Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-11T00:45:10.967718Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T00:55:04.044373Z"},"links":{"citing_paper":"/paper/2412.19255"},"observation_digest":"sha256:ec53cdda0f00420ddb127ab4795a2c080c4d5beed8a35b4cc10dbb050a1b36e5","observation_id":"eccf9207-bffa-43db-88ba-eb1282551107","resolution":{"observed_at":"2026-08-11T00:55:04.044373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09297","last_updated":"2024-10-15T08:45:18Z","snapshot_observed_at":"2026-08-10T21:50:56.589747Z","submitted_at":"2024-06-13T16:33:44Z","title":"MLKV: Multi-Layer Key-Value Heads for Memory Efficient Transformer Decoding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09297","snapshot_observed_at":"2026-08-11T00:55:04.049741Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-11T00:45:10.967718Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T00:55:04.049741Z"},"links":{"cited_paper":"/paper/2406.09297","citing_paper":"/paper/2412.19255"},"observation_digest":"sha256:2bf06a3d2f632a204ca85f3cfecb6d0e5ac06af9b9bc30768bfdc1cc13d6357e","observation_id":"f6a75ec7-d879-4c79-ab6d-85c446259519","resolution":{"observed_at":"2026-08-11T00:55:04.049741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:55:04.055304Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-11T00:45:10.967718Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T00:55:04.055304Z"},"links":{"citing_paper":"/paper/2412.19255"},"observation_digest":"sha256:8ad334b3309bbe3319d31c20277e94caace66b321d0e44f37bd05b9e197aab48","observation_id":"311f6198-0f32-4797-bba9-abeef5f0edbf","resolution":{"observed_at":"2026-08-11T00:55:04.055304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:55:04.061512Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-11T00:45:10.967718Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T00:55:04.061512Z"},"links":{"citing_paper":"/paper/2412.19255"},"observation_digest":"sha256:c8a12efa5eb7ee1201ed88da3f07526c830a7ac061a4aba4e87041dbe7207849","observation_id":"647f227c-efdd-401b-adef-4d3c79a9398c","resolution":{"observed_at":"2026-08-11T00:55:04.061512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-11T00:45:10.967718Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":49,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 2 inbound Pith citation observations for arXiv:2412.19255."}