{"as_of":"2026-08-12T13:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b75f09b783dadef3df557c70367e74de947c0b07cbe19d3376e3062be7b7b5d3","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:53:51.139013Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.17286/citation-record","integrity":"/paper/2506.17286/integrity","json":"/paper/2506.17286/citation-record.json","paper":"/paper/2506.17286"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:47.390682Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2506.17286","last_updated":"2025-07-23T05:57:32Z","snapshot_observed_at":"2026-08-12T09:56:54.298519Z","submitted_at":"2025-06-15T07:19:33Z","title":"GTA: Grouped-head latenT Attention","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:47.390682Z"},"links":{"citing_paper":"/paper/2506.17286"},"observation_digest":"sha256:280e6f4521b362589963674ce132791c65b4cb81489aba06ec2bac5ba86934ed","observation_id":"00dbff2e-f327-4928-9f0b-8d5c481e0104","resolution":{"observed_at":"2026-08-07T00:53:47.390682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T00:53:47.501981Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17286","last_updated":"2025-07-23T05:57:32Z","snapshot_observed_at":"2026-08-12T09:56:54.298519Z","submitted_at":"2025-06-15T07:19:33Z","title":"GTA: Grouped-head latenT Attention","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:47.501981Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.17286"},"observation_digest":"sha256:376a6d04c15e3fa32d260006dde39b02fef40a90b2e18a440f8f9ff17811f2a9","observation_id":"4ebbec90-b89c-41fd-be84-6e272170501a","resolution":{"observed_at":"2026-08-07T00:53:47.501981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:47.647788Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.17286","last_updated":"2025-07-23T05:57:32Z","snapshot_observed_at":"2026-08-12T09:56:54.298519Z","submitted_at":"2025-06-15T07:19:33Z","title":"GTA: Grouped-head latenT Attention","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:47.647788Z"},"links":{"citing_paper":"/paper/2506.17286"},"observation_digest":"sha256:bc5e347319209fe7ecee44af3c1da8f49fcba13426005d8637131859a9298722","observation_id":"fc29431e-b635-49aa-bcbb-a996ea5d8ca4","resolution":{"observed_at":"2026-08-07T00:53:47.647788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:47.764009Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17286","last_updated":"2025-07-23T05:57:32Z","snapshot_observed_at":"2026-08-12T09:56:54.298519Z","submitted_at":"2025-06-15T07:19:33Z","title":"GTA: Grouped-head latenT Attention","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:47.764009Z"},"links":{"citing_paper":"/paper/2506.17286"},"observation_digest":"sha256:dc1b9f2b5fce6e09b2cd41b40a1f869e7840346f18db090c06970d753e3c2413","observation_id":"920eb91f-e7c4-4663-aae1-85b1eb9c38cf","resolution":{"observed_at":"2026-08-07T00:53:47.764009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:47.833695Z","title":"Liu, Kevin Lin, John Hewitt, Ashwin Paranjape, Michele Bevilacqua, Fabio Petroni, and Percy Liang","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17286","last_updated":"2025-07-23T05:57:32Z","snapshot_observed_at":"2026-08-12T09:56:54.298519Z","submitted_at":"2025-06-15T07:19:33Z","title":"GTA: Grouped-head latenT Attention","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:47.833695Z"},"links":{"citing_paper":"/paper/2506.17286"},"observation_digest":"sha256:8f67736f55347eb1af239fac91329e5e2ceb6ef0afbb2b4804698d8b9ec5ecb1","observation_id":"4ea556eb-1159-4dc4-8ae5-5fb29e61424d","resolution":{"observed_at":"2026-08-07T00:53:47.833695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02150","last_updated":"2019-11-06T00:19:05Z","snapshot_observed_at":"2026-07-06T08:35:01.386074Z","submitted_at":"2019-11-06T00:19:05Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.02150","snapshot_observed_at":"2026-08-07T00:53:47.967513Z","title":"Fast transformer decoding: One write-head is all you need","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2506.17286","last_updated":"2025-07-23T05:57:32Z","snapshot_observed_at":"2026-08-12T09:56:54.298519Z","submitted_at":"2025-06-15T07:19:33Z","title":"GTA: Grouped-head latenT Attention","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:47.967513Z"},"links":{"cited_paper":"/paper/1911.02150","citing_paper":"/paper/2506.17286"},"observation_digest":"sha256:011a24beed430e79e324f820a9b817cd66d360d1c5356cdfa5f0bb60a4a2e3d9","observation_id":"a8326140-3e94-4c77-9983-a9226041878d","resolution":{"observed_at":"2026-08-07T00:53:47.967513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-07T00:53:48.108508Z","title":"Gqa: Training generalized multi-query transformer models from multi-head checkpoints","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17286","last_updated":"2025-07-23T05:57:32Z","snapshot_observed_at":"2026-08-12T09:56:54.298519Z","submitted_at":"2025-06-15T07:19:33Z","title":"GTA: Grouped-head latenT Attention","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:48.108508Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2506.17286"},"observation_digest":"sha256:0c15c430b98b843a30fcf7b296220c948c9eb5efe32986663d8d33826e58e8e7","observation_id":"b95852db-d43f-4473-af45-d4722c829c85","resolution":{"observed_at":"2026-08-07T00:53:48.108508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-11T01:48:59.557045Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T00:53:48.226361Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17286","last_updated":"2025-07-23T05:57:32Z","snapshot_observed_at":"2026-08-12T09:56:54.298519Z","submitted_at":"2025-06-15T07:19:33Z","title":"GTA: Grouped-head latenT Attention","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:48.226361Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.17286"},"observation_digest":"sha256:cd95841f588acedbb024b093928fdb3c470a45361f542ecdaf03f4546c8552b2","observation_id":"307edecf-d678-4982-b0c5-4dbd80e6415e","resolution":{"observed_at":"2026-08-07T00:53:48.226361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:53.031526Z","title":"Differential transformer, 2025","venue":null,"work_id":"71bf9b0d-2f40-42e5-96c2-24c4c9a28a6a","year":2025},"citing_paper":{"arxiv_id":"2506.17286","last_updated":"2025-07-23T05:57:32Z","snapshot_observed_at":"2026-08-12T09:56:54.298519Z","submitted_at":"2025-06-15T07:19:33Z","title":"GTA: Grouped-head latenT Attention","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:48.355571Z"},"links":{"citing_paper":"/paper/2506.17286"},"observation_digest":"sha256:48c171c11e50f1588fa927c18c66d21a5b5c92ec082f69f6b06244311e39046b","observation_id":"fe511906-48f7-45b3-a422-053b641aef66","resolution":{"observed_at":"2026-08-07T00:53:53.096465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:52.924943Z","title":"Multi-token attention, 2025","venue":null,"work_id":"ed943a93-dd8b-43c9-bd99-5e04cc1dac94","year":2025},"citing_paper":{"arxiv_id":"2506.17286","last_updated":"2025-07-23T05:57:32Z","snapshot_observed_at":"2026-08-12T09:56:54.298519Z","submitted_at":"2025-06-15T07:19:33Z","title":"GTA: Grouped-head latenT Attention","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:48.456181Z"},"links":{"citing_paper":"/paper/2506.17286"},"observation_digest":"sha256:0c70ea358800acac9996604fb11b4639475cbd31684da8907492602fc12ce6e0","observation_id":"b51b9367-075d-4340-8c3f-60a558981f32","resolution":{"observed_at":"2026-08-07T00:53:52.972928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:48.518843Z","title":"Glu variants improve transformer, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.17286","last_updated":"2025-07-23T05:57:32Z","snapshot_observed_at":"2026-08-12T09:56:54.298519Z","submitted_at":"2025-06-15T07:19:33Z","title":"GTA: Grouped-head latenT Attention","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:48.518843Z"},"links":{"citing_paper":"/paper/2506.17286"},"observation_digest":"sha256:42574ef255bfa9ae6685480aabba819bb9bb722255031cb8e1d8e301bd0137e3","observation_id":"d2968eed-4a2f-4e4d-9508-2ed67aa706ef","resolution":{"observed_at":"2026-08-07T00:53:48.518843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:52.774144Z","title":"You only cache once: Decoder-decoder architectures for language models","venue":null,"work_id":"401a53e4-0029-4027-a614-d37f6501be42","year":2024},"citing_paper":{"arxiv_id":"2506.17286","last_updated":"2025-07-23T05:57:32Z","snapshot_observed_at":"2026-08-12T09:56:54.298519Z","submitted_at":"2025-06-15T07:19:33Z","title":"GTA: Grouped-head latenT Attention","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:48.572133Z"},"links":{"citing_paper":"/paper/2506.17286"},"observation_digest":"sha256:53ac31b08e8229b2001bd2bdacdffea6370dcf60200a70ceba81bfc06d03bfad","observation_id":"c722fbdb-1af5-4fad-bb5c-1a813315cc2e","resolution":{"observed_at":"2026-08-07T00:53:52.849712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:52.631450Z","title":"Ni, Haifeng Zhang, and Jun Wang","venue":null,"work_id":"1aba7bd4-19a5-4e56-a444-991fadc97476","year":2025},"citing_paper":{"arxiv_id":"2506.17286","last_updated":"2025-07-23T05:57:32Z","snapshot_observed_at":"2026-08-12T09:56:54.298519Z","submitted_at":"2025-06-15T07:19:33Z","title":"GTA: Grouped-head latenT Attention","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:48.674845Z"},"links":{"citing_paper":"/paper/2506.17286"},"observation_digest":"sha256:8a84fc6b084e7e49d9f84bce14b978ecb4633c6dcc97543a97fd1c136a014db4","observation_id":"58ba30cb-17a5-4f4a-9488-88b050c1b950","resolution":{"observed_at":"2026-08-07T00:53:52.684881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-08-11T06:21:56.129166Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-07T00:53:48.777635Z","title":"Glu variants improve transformer","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.17286","last_updated":"2025-07-23T05:57:32Z","snapshot_observed_at":"2026-08-12T09:56:54.298519Z","submitted_at":"2025-06-15T07:19:33Z","title":"GTA: Grouped-head latenT Attention","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:48.777635Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2506.17286"},"observation_digest":"sha256:3b97f42df5df3b4e972ef5d9140e9724e8d9bc0f9bf2cc699a13bdafe02267aa","observation_id":"08ad2c8a-ae4f-4aa7-8d96-49f80ec64a0e","resolution":{"observed_at":"2026-08-07T00:53:48.777635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:52.450005Z","title":"Gated linear attention transformers with hardware-efficient training, 2024","venue":null,"work_id":"7147649a-135e-4e74-abdd-2fefe3a79ba2","year":2024},"citing_paper":{"arxiv_id":"2506.17286","last_updated":"2025-07-23T05:57:32Z","snapshot_observed_at":"2026-08-12T09:56:54.298519Z","submitted_at":"2025-06-15T07:19:33Z","title":"GTA: Grouped-head latenT Attention","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:48.880524Z"},"links":{"citing_paper":"/paper/2506.17286"},"observation_digest":"sha256:4d7eaf99a1c1537d4b5d6c83e217829429efa3e31f2973fde0901e99cd6907aa","observation_id":"43b62c68-2d45-4000-a3f3-492cd34c5dd0","resolution":{"observed_at":"2026-08-07T00:53:52.535108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:52.308133Z","title":"Hardware-efficient attention for fast decoding, 2025","venue":null,"work_id":"5014c13f-d02d-4584-a3ea-75af5ca3077b","year":2025},"citing_paper":{"arxiv_id":"2506.17286","last_updated":"2025-07-23T05:57:32Z","snapshot_observed_at":"2026-08-12T09:56:54.298519Z","submitted_at":"2025-06-15T07:19:33Z","title":"GTA: Grouped-head latenT Attention","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:48.956459Z"},"links":{"citing_paper":"/paper/2506.17286"},"observation_digest":"sha256:75a8b4e1aa5d2f36f20a2ddcecdf12ec92fe494aaf9b3376ac82132777daf4fc","observation_id":"06bd6350-5d75-4be8-b3ab-1927f5051590","resolution":{"observed_at":"2026-08-07T00:53:52.367762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:49.088623Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17286","last_updated":"2025-07-23T05:57:32Z","snapshot_observed_at":"2026-08-12T09:56:54.298519Z","submitted_at":"2025-06-15T07:19:33Z","title":"GTA: Grouped-head latenT Attention","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:49.088623Z"},"links":{"citing_paper":"/paper/2506.17286"},"observation_digest":"sha256:7dc583963944103c0f3fdd053184bb26317f262544048773387f88edb70a0b52","observation_id":"b0d713df-c335-4064-8255-7beb72fc8881","resolution":{"observed_at":"2026-08-07T00:53:49.088623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T00:53:49.214988Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.17286","last_updated":"2025-07-23T05:57:32Z","snapshot_observed_at":"2026-08-12T09:56:54.298519Z","submitted_at":"2025-06-15T07:19:33Z","title":"GTA: Grouped-head latenT Attention","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:49.214988Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2506.17286"},"observation_digest":"sha256:dde67219d56fff68f14a855570f54800388103f2177e79ee9f08b8eb7becf577","observation_id":"a9eaddfe-0c3a-46f5-8b68-5036f0ad77db","resolution":{"observed_at":"2026-08-07T00:53:49.214988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02385","last_updated":"2024-06-04T02:05:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-04T17:54:59Z","title":"TinyLlama: An Open-Source Small Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02385","snapshot_observed_at":"2026-08-07T00:53:49.285407Z","title":"Tinyllama: An open-source small language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17286","last_updated":"2025-07-23T05:57:32Z","snapshot_observed_at":"2026-08-12T09:56:54.298519Z","submitted_at":"2025-06-15T07:19:33Z","title":"GTA: Grouped-head latenT Attention","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:49.285407Z"},"links":{"cited_paper":"/paper/2401.02385","citing_paper":"/paper/2506.17286"},"observation_digest":"sha256:0a00e753fc5c8e7d42ce373c63054b27ebd711582e780cb45df5616409501842","observation_id":"56d20d05-d48d-4d11-b3e2-25b021c85938","resolution":{"observed_at":"2026-08-07T00:53:49.285407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:49.369240Z","title":"Sigmoid-weighted linear units for neural network function approximation in reinforcement learning, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.17286","last_updated":"2025-07-23T05:57:32Z","snapshot_observed_at":"2026-08-12T09:56:54.298519Z","submitted_at":"2025-06-15T07:19:33Z","title":"GTA: Grouped-head latenT Attention","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:49.369240Z"},"links":{"citing_paper":"/paper/2506.17286"},"observation_digest":"sha256:37ee4363980fb7819e216803588902eb26bcaed06998cd80c838c950e655e732","observation_id":"dc9c92cb-2732-498e-8ab7-17540c8354b5","resolution":{"observed_at":"2026-08-07T00:53:49.369240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:52.155863Z","title":"Relu 2 wins: Discovering efficient activation functions for sparse llms, 2024","venue":null,"work_id":"46086539-6052-4a96-a1a3-0e79713752c6","year":2024},"citing_paper":{"arxiv_id":"2506.17286","last_updated":"2025-07-23T05:57:32Z","snapshot_observed_at":"2026-08-12T09:56:54.298519Z","submitted_at":"2025-06-15T07:19:33Z","title":"GTA: Grouped-head latenT Attention","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:49.498212Z"},"links":{"citing_paper":"/paper/2506.17286"},"observation_digest":"sha256:41a9eac782de8945e0096633f55f53ad5133f424e99c6049c3db639244098575","observation_id":"77e9d984-8634-4cb3-8730-055289ba8ece","resolution":{"observed_at":"2026-08-07T00:53:52.194831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:49.632203Z","title":"Smollm-corpus, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17286","last_updated":"2025-07-23T05:57:32Z","snapshot_observed_at":"2026-08-12T09:56:54.298519Z","submitted_at":"2025-06-15T07:19:33Z","title":"GTA: Grouped-head latenT Attention","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:49.632203Z"},"links":{"citing_paper":"/paper/2506.17286"},"observation_digest":"sha256:088a8463f036c359108a6f268fc417c26579a9c812b30dc3c75c57397e415bc5","observation_id":"f4d3644c-b984-4d45-8a23-4bd89a89d1d9","resolution":{"observed_at":"2026-08-07T00:53:49.632203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:52.013000Z","title":"The llama 3 herd of models, 2024","venue":null,"work_id":"68610daf-f610-4fb6-87d0-4238175a0c3d","year":2024},"citing_paper":{"arxiv_id":"2506.17286","last_updated":"2025-07-23T05:57:32Z","snapshot_observed_at":"2026-08-12T09:56:54.298519Z","submitted_at":"2025-06-15T07:19:33Z","title":"GTA: Grouped-head latenT Attention","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:49.697068Z"},"links":{"citing_paper":"/paper/2506.17286"},"observation_digest":"sha256:771ef4c2e278868229fe3a145b7b43b71fe84c59287f3a47ff27a80fabd78b41","observation_id":"5c8ba0fb-51db-479c-8c4b-9ebddd7450a5","resolution":{"observed_at":"2026-08-07T00:53:52.063682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:49.814149Z","title":"Mobilellm: Optimizing sub-billion parameter language models for on-device use cases, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17286","last_updated":"2025-07-23T05:57:32Z","snapshot_observed_at":"2026-08-12T09:56:54.298519Z","submitted_at":"2025-06-15T07:19:33Z","title":"GTA: Grouped-head latenT Attention","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:49.814149Z"},"links":{"citing_paper":"/paper/2506.17286"},"observation_digest":"sha256:9b2748741a6c4d4adc5125cd8a39ceeec1ea3dde0b34c4d12306246f29af5b7f","observation_id":"c2ef41e4-dfdb-4af5-9f77-e9cbe4ad480e","resolution":{"observed_at":"2026-08-07T00:53:49.814149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:49.960808Z","title":"The language model evaluation harness, 07 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17286","last_updated":"2025-07-23T05:57:32Z","snapshot_observed_at":"2026-08-12T09:56:54.298519Z","submitted_at":"2025-06-15T07:19:33Z","title":"GTA: Grouped-head latenT Attention","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:49.960808Z"},"links":{"citing_paper":"/paper/2506.17286"},"observation_digest":"sha256:7e0a501aeb507d882d99dcde1199240a044b9909a744f9c2e570a9a8e45f806a","observation_id":"3cf808b0-f001-4041-9900-5ca672e55c3d","resolution":{"observed_at":"2026-08-07T00:53:49.960808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-07T00:53:49.994896Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.17286","last_updated":"2025-07-23T05:57:32Z","snapshot_observed_at":"2026-08-12T09:56:54.298519Z","submitted_at":"2025-06-15T07:19:33Z","title":"GTA: Grouped-head latenT Attention","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:49.994896Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2506.17286"},"observation_digest":"sha256:e35b55efc6da7eedc5a650a175199cfbdb4ddc707b9a22baab32224b33151a18","observation_id":"b0ea5114-81a4-4763-823d-df4477e0d4c0","resolution":{"observed_at":"2026-08-07T00:53:49.994896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:50.081508Z","title":"Hellaswag: Can a machine really finish your sentence? In Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.17286","last_updated":"2025-07-23T05:57:32Z","snapshot_observed_at":"2026-08-12T09:56:54.298519Z","submitted_at":"2025-06-15T07:19:33Z","title":"GTA: Grouped-head latenT Attention","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:50.081508Z"},"links":{"citing_paper":"/paper/2506.17286"},"observation_digest":"sha256:df028ec296b8756d6d8a987ae462681fa9e86513cd0c44f31322af931c364d96","observation_id":"49bdd69e-18ce-4294-a2e0-0dba32490221","resolution":{"observed_at":"2026-08-07T00:53:50.081508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.10044","last_updated":"2019-05-24T05:48:49Z","snapshot_observed_at":"2026-07-06T07:55:12.121264Z","submitted_at":"2019-05-24T05:48:49Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.10044","snapshot_observed_at":"2026-08-07T00:53:50.161101Z","title":"Boolq: Exploring the surprising difficulty of natural yes/no questions","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2506.17286","last_updated":"2025-07-23T05:57:32Z","snapshot_observed_at":"2026-08-12T09:56:54.298519Z","submitted_at":"2025-06-15T07:19:33Z","title":"GTA: Grouped-head latenT Attention","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:50.161101Z"},"links":{"cited_paper":"/paper/1905.10044","citing_paper":"/paper/2506.17286"},"observation_digest":"sha256:57846d5b3eeb24c321c31077f894f675e04b226022d1cabdbc6427ae41a05ad1","observation_id":"0b0fd502-af34-455e-b466-23472381942f","resolution":{"observed_at":"2026-08-07T00:53:50.161101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:50.214470Z","title":"Piqa: Reasoning about physical commonsense in natural language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.17286","last_updated":"2025-07-23T05:57:32Z","snapshot_observed_at":"2026-08-12T09:56:54.298519Z","submitted_at":"2025-06-15T07:19:33Z","title":"GTA: Grouped-head latenT Attention","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:50.214470Z"},"links":{"citing_paper":"/paper/2506.17286"},"observation_digest":"sha256:c010e810fbd2acc7fe84ce63e9626a36271a9e138b60698e3f171d0e30676ad9","observation_id":"87aafeb8-9661-4c83-8d04-119cb1a6d60c","resolution":{"observed_at":"2026-08-07T00:53:50.214470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:51.879033Z","title":"MathQA: Towards interpretable math word problem solving with operation-based formalisms","venue":null,"work_id":"d755d958-ce49-4d13-a5ea-184e963dc134","year":2019},"citing_paper":{"arxiv_id":"2506.17286","last_updated":"2025-07-23T05:57:32Z","snapshot_observed_at":"2026-08-12T09:56:54.298519Z","submitted_at":"2025-06-15T07:19:33Z","title":"GTA: Grouped-head latenT Attention","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:50.285598Z"},"links":{"citing_paper":"/paper/2506.17286"},"observation_digest":"sha256:b78c1320b9f4fddc6bf84ceecc681af0dbd33b8ba9fff77f9433fcaf2b2f2086","observation_id":"07b4956b-e65e-4d1e-af13-605dc5505eb8","resolution":{"observed_at":"2026-08-07T00:53:51.940208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.07958","last_updated":"2022-05-08T02:43:02Z","snapshot_observed_at":"2026-08-03T16:26:48.747700Z","submitted_at":"2021-09-08T17:15:27Z","title":"TruthfulQA: Measuring How Models Mimic Human Falsehoods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.07958","snapshot_observed_at":"2026-08-07T00:53:50.363927Z","title":"Truthfulqa: Measuring how models mimic human falsehoods, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17286","last_updated":"2025-07-23T05:57:32Z","snapshot_observed_at":"2026-08-12T09:56:54.298519Z","submitted_at":"2025-06-15T07:19:33Z","title":"GTA: Grouped-head latenT Attention","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:50.363927Z"},"links":{"cited_paper":"/paper/2109.07958","citing_paper":"/paper/2506.17286"},"observation_digest":"sha256:deca16f5411ff777810932d8864bdebae020f860e024aa18cb5a802c03467589","observation_id":"e93a7f2a-d47a-4b22-95f9-99829db64080","resolution":{"observed_at":"2026-08-07T00:53:50.363927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09728","last_updated":"2019-09-09T17:29:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-04-22T05:36:37Z","title":"SocialIQA: Commonsense Reasoning about Social Interactions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09728","snapshot_observed_at":"2026-08-07T00:53:50.475025Z","title":"Socialiqa: Com- monsense reasoning about social interactions","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2506.17286","last_updated":"2025-07-23T05:57:32Z","snapshot_observed_at":"2026-08-12T09:56:54.298519Z","submitted_at":"2025-06-15T07:19:33Z","title":"GTA: Grouped-head latenT Attention","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:50.475025Z"},"links":{"cited_paper":"/paper/1904.09728","citing_paper":"/paper/2506.17286"},"observation_digest":"sha256:2e18c99d5967056be3d55f64b6de28915d2d6885e5ce3a7b6085bd3910ba51ce","observation_id":"18f11fec-a649-47e8-ba35-77e51e755d9a","resolution":{"observed_at":"2026-08-07T00:53:50.475025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-07T00:53:50.540047Z","title":"Program synthesis with large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.17286","last_updated":"2025-07-23T05:57:32Z","snapshot_observed_at":"2026-08-12T09:56:54.298519Z","submitted_at":"2025-06-15T07:19:33Z","title":"GTA: Grouped-head latenT Attention","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:50.540047Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2506.17286"},"observation_digest":"sha256:fdba01144ac21f011a17b6a3164122fa31783be9556d180db29847f9918bb8cb","observation_id":"7ab3499b-47f7-44f7-8964-9f5ad47448e7","resolution":{"observed_at":"2026-08-07T00:53:50.540047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-07T00:53:50.616735Z","title":"Instruction-following evaluation for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17286","last_updated":"2025-07-23T05:57:32Z","snapshot_observed_at":"2026-08-12T09:56:54.298519Z","submitted_at":"2025-06-15T07:19:33Z","title":"GTA: Grouped-head latenT Attention","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:50.616735Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2506.17286"},"observation_digest":"sha256:c21d374541d25d1dd6921369b94c52527c8239c38bc3596899c511302160917d","observation_id":"8740e4f0-43d0-43c6-8de4-6ea2b9f9383d","resolution":{"observed_at":"2026-08-07T00:53:50.616735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.08124","last_updated":"2020-07-16T05:52:16Z","snapshot_observed_at":"2026-08-10T13:06:17.421919Z","submitted_at":"2020-07-16T05:52:16Z","title":"LogiQA: A Challenge Dataset for Machine Reading Comprehension with Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.08124","snapshot_observed_at":"2026-08-07T00:53:50.701663Z","title":"Logiqa: A challenge dataset for machine reading comprehension with logical reasoning","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2506.17286","last_updated":"2025-07-23T05:57:32Z","snapshot_observed_at":"2026-08-12T09:56:54.298519Z","submitted_at":"2025-06-15T07:19:33Z","title":"GTA: Grouped-head latenT Attention","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:50.701663Z"},"links":{"cited_paper":"/paper/2007.08124","citing_paper":"/paper/2506.17286"},"observation_digest":"sha256:0f8e4d057f5cf3d90312f46e47bbe963710c5899ba4f3b52a2518c585a173dc6","observation_id":"a82b3e84-a2a8-424b-a46b-a42348b96bd7","resolution":{"observed_at":"2026-08-07T00:53:50.701663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09261","last_updated":"2022-10-17T17:08:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-17T17:08:26Z","title":"Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09261","snapshot_observed_at":"2026-08-07T00:53:50.764532Z","title":"Challenging big- bench tasks and whether chain-of-thought can solve them","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17286","last_updated":"2025-07-23T05:57:32Z","snapshot_observed_at":"2026-08-12T09:56:54.298519Z","submitted_at":"2025-06-15T07:19:33Z","title":"GTA: Grouped-head latenT Attention","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:50.764532Z"},"links":{"cited_paper":"/paper/2210.09261","citing_paper":"/paper/2506.17286"},"observation_digest":"sha256:319ddf4024cd8d566b09ede408d677716b1cedd08072ab4fd8ccaa3cc711ae09","observation_id":"33c5ad1b-d64a-455b-8b27-754e019856c8","resolution":{"observed_at":"2026-08-07T00:53:50.764532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:51.750432Z","title":"Miranda, Alisa Liu, Nouha Dziri, Shane Lyu, Yuling Gu, Saumya Malik, Victoria Graf, Jena D","venue":null,"work_id":"8a29d42d-d8a6-42fa-84e9-4fe206b793ba","year":2024},"citing_paper":{"arxiv_id":"2506.17286","last_updated":"2025-07-23T05:57:32Z","snapshot_observed_at":"2026-08-12T09:56:54.298519Z","submitted_at":"2025-06-15T07:19:33Z","title":"GTA: Grouped-head latenT Attention","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:50.841526Z"},"links":{"citing_paper":"/paper/2506.17286"},"observation_digest":"sha256:504a5bbdbb17017fb3a809fc2c661481a43a905c09408cbe78c8f0d77d49b43a","observation_id":"d7d3f5f3-3534-46b5-aca8-647aaa316281","resolution":{"observed_at":"2026-08-07T00:53:51.801241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:51.642111Z","title":"Llm inference unveiled: Survey and roofline model insights, 2024","venue":null,"work_id":"074e787c-25c9-4a8c-a969-845e1ecf884c","year":2024},"citing_paper":{"arxiv_id":"2506.17286","last_updated":"2025-07-23T05:57:32Z","snapshot_observed_at":"2026-08-12T09:56:54.298519Z","submitted_at":"2025-06-15T07:19:33Z","title":"GTA: Grouped-head latenT Attention","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:50.920455Z"},"links":{"citing_paper":"/paper/2506.17286"},"observation_digest":"sha256:a756fe5a2f7121c390a44c0b21ed7e784a52a6a999dd0c236e44b147225eb203","observation_id":"e837571f-512b-4c22-8492-1a7c3854961f","resolution":{"observed_at":"2026-08-07T00:53:51.694951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:51.000364Z","title":"Llamafactory: Unified efficient fine-tuning of 100+ language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17286","last_updated":"2025-07-23T05:57:32Z","snapshot_observed_at":"2026-08-12T09:56:54.298519Z","submitted_at":"2025-06-15T07:19:33Z","title":"GTA: Grouped-head latenT Attention","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:51.000364Z"},"links":{"citing_paper":"/paper/2506.17286"},"observation_digest":"sha256:97a4e29a552b73c6a728daf285a04c8dce3f23b1d639db9dc380f69b80dcdc6d","observation_id":"9aa579f8-cbfa-4cb2-9c23-1a82b430a474","resolution":{"observed_at":"2026-08-07T00:53:51.000364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:51.528304Z","title":"Validation","venue":null,"work_id":"e9206ea2-606e-448c-8114-8435c2062650","year":2024},"citing_paper":{"arxiv_id":"2506.17286","last_updated":"2025-07-23T05:57:32Z","snapshot_observed_at":"2026-08-12T09:56:54.298519Z","submitted_at":"2025-06-15T07:19:33Z","title":"GTA: Grouped-head latenT Attention","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:51.079470Z"},"links":{"citing_paper":"/paper/2506.17286"},"observation_digest":"sha256:5e6183e5355323d55c9cacc41433d104506789976b6e73f28e4bb7d0d6a43d23","observation_id":"4b2d1f06-2342-48e4-9fe5-3cc590977f97","resolution":{"observed_at":"2026-08-07T00:53:51.571847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:53:51.409965Z","title":null,"venue":null,"work_id":"7580db87-870b-4216-b7e3-6dc662183db9","year":null},"citing_paper":{"arxiv_id":"2506.17286","last_updated":"2025-07-23T05:57:32Z","snapshot_observed_at":"2026-08-12T09:56:54.298519Z","submitted_at":"2025-06-15T07:19:33Z","title":"GTA: Grouped-head latenT Attention","version":2},"reference_index":128,"source":"pdf_text","source_observed_at":"2026-08-07T00:53:51.139013Z"},"links":{"citing_paper":"/paper/2506.17286"},"observation_digest":"sha256:7bf05608fb96f3c1468f2da5f3b48d73e5461c88e8063fa4565de45a8792aae6","observation_id":"694255ab-4d01-495d-bdc6-466514bcc0c8","resolution":{"observed_at":"2026-08-07T00:53:51.479020Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.17286","last_updated":"2025-07-23T05:57:32Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-12T09:56:54.298519Z","submitted_at":"2025-06-15T07:19:33Z","title":"GTA: Grouped-head latenT Attention"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":12},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2506.17286."}