{"as_of":"2026-08-20T20:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:da7e79118ac598217b6880da0aa13b14e06922f0c23910ab3645f90b6c41c394","coverage":[{"denominator":123,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T11:44:05.162957Z","state":"measured"},{"denominator":118,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":118,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":18,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:46:37.290952Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T01:46:26.624174Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"cited_work":{"arxiv_id":"2507.22448","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.22448","snapshot_observed_at":"2026-07-02T01:46:26.624174Z","title":"Falcon-h1: A fam- ily of hybrid-head language models redefining efficiency and performance","venue":null,"work_id":"210a0b5b-f245-4f36-b66c-ff37b1c42ad3","year":2025},"citing_paper":{"arxiv_id":"2509.05276","last_updated":"2026-05-08T09:41:26Z","snapshot_observed_at":"2026-08-11T05:30:18.498214Z","submitted_at":"2025-09-05T17:34:00Z","title":"SpikingBrain: Spiking Brain-inspired Large Models","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-18T18:51:06.243305Z"},"links":{"cited_paper":"/paper/2507.22448","citing_paper":"/paper/2509.05276"},"observation_digest":"sha256:f988c0a868bb8dda0f9199fa0e1e5f60d84bd4ad4656c9e85a46e1c5a93b081c","observation_id":"2704d2cb-c3e6-4f6a-be39-29bc7fb70629","resolution":{"observed_at":"2026-05-18T18:51:45.834693Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"cited_work":{"arxiv_id":"2507.22448","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.22448","snapshot_observed_at":"2026-07-02T01:46:26.624174Z","title":"Falcon-h1: A fam- ily of hybrid-head language models redefining efficiency and performance","venue":null,"work_id":"210a0b5b-f245-4f36-b66c-ff37b1c42ad3","year":2025},"citing_paper":{"arxiv_id":"2510.20505","last_updated":"2026-04-23T06:10:19Z","snapshot_observed_at":"2026-08-11T17:29:40.125548Z","submitted_at":"2025-10-23T12:48:18Z","title":"RELOOP: Recursive Retrieval with Multi-Hop Reasoner and Planners for Heterogeneous QA","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-18T04:55:03.309430Z"},"links":{"cited_paper":"/paper/2507.22448","citing_paper":"/paper/2510.20505"},"observation_digest":"sha256:779a7e5b21b3f79d4095f1893f06566704b7392793d5060d2918172085afb008","observation_id":"aef477d0-1c57-42a5-a152-02b5b177e2b9","resolution":{"observed_at":"2026-05-18T04:55:54.139038Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"cited_work":{"arxiv_id":"2507.22448","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.22448","snapshot_observed_at":"2026-07-02T01:46:26.624174Z","title":"Falcon-h1: A fam- ily of hybrid-head language models redefining efficiency and performance","venue":null,"work_id":"210a0b5b-f245-4f36-b66c-ff37b1c42ad3","year":2025},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-08-07T19:30:34.681869Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":129,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2507.22448","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:f4a5b9cc6c46890f40d0f9664689723f249c0ac205501f3a8a65fc4dfde2724d","observation_id":"d605d63f-c9ad-4dfc-ba12-a6fefa308afa","resolution":{"observed_at":"2026-05-13T23:49:10.984633Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.22448","snapshot_observed_at":"2026-08-03T21:20:37.542843Z","title":"Falcon-h1: A family of hybrid-head language models redefining efficiency and performance.arXiv preprint arXiv:2507.22448,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.15927","last_updated":"2026-07-17T11:40:17Z","snapshot_observed_at":"2026-08-19T01:24:17.846553Z","submitted_at":"2025-11-19T23:23:49Z","title":"DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T21:20:37.542843Z"},"links":{"cited_paper":"/paper/2507.22448","citing_paper":"/paper/2511.15927"},"observation_digest":"sha256:c9e340a665330b257c669a41c714b1a2ee7fee02331e9e4e8f7f85cbbe62b75e","observation_id":"73d6e007-626c-440c-acd8-ba40846cb89f","resolution":{"observed_at":"2026-08-03T21:20:37.542843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.22448","snapshot_observed_at":"2026-08-02T17:21:21.494194Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.26556","last_updated":"2026-07-17T10:32:57Z","snapshot_observed_at":"2026-08-17T22:12:53.484781Z","submitted_at":"2026-03-27T16:16:23Z","title":"When Perplexity Lies: Generation-Focused Distillation of Hybrid Sequence Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T17:21:21.494194Z"},"links":{"cited_paper":"/paper/2507.22448","citing_paper":"/paper/2603.26556"},"observation_digest":"sha256:e7bc3e294a6bed43dd1af621007b91fda4cd15986fe69bf53195858a3d50683d","observation_id":"b36332b5-c734-4800-9644-ca9698e276f0","resolution":{"observed_at":"2026-08-02T17:21:21.494194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"cited_work":{"arxiv_id":"2507.22448","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.22448","snapshot_observed_at":"2026-07-02T01:46:26.624174Z","title":"Falcon-h1: A fam- ily of hybrid-head language models redefining efficiency and performance","venue":null,"work_id":"210a0b5b-f245-4f36-b66c-ff37b1c42ad3","year":2025},"citing_paper":{"arxiv_id":"2604.01168","last_updated":"2026-04-03T19:40:10Z","snapshot_observed_at":"2026-08-14T02:45:32.328746Z","submitted_at":"2026-04-01T17:21:15Z","title":"S0 Tuning: Zero-Overhead Adaptation of Hybrid Recurrent-Attention Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T22:20:38.938305Z"},"links":{"cited_paper":"/paper/2507.22448","citing_paper":"/paper/2604.01168"},"observation_digest":"sha256:e7a1de936c6d47969de50df0c3f1f5600ed3cfbb6724a48df71dea38275a4381","observation_id":"17a632e8-d8fe-45da-aa80-d13aa97c9ee9","resolution":{"observed_at":"2026-05-13T22:23:21.391466Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"cited_work":{"arxiv_id":"2507.22448","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.22448","snapshot_observed_at":"2026-07-02T01:46:26.624174Z","title":"Falcon-h1: A fam- ily of hybrid-head language models redefining efficiency and performance","venue":null,"work_id":"210a0b5b-f245-4f36-b66c-ff37b1c42ad3","year":2025},"citing_paper":{"arxiv_id":"2604.19877","last_updated":"2026-04-21T18:00:25Z","snapshot_observed_at":"2026-08-18T11:54:44.667714Z","submitted_at":"2026-04-21T18:00:25Z","title":"Super Apriel: One Checkpoint, Many Speeds","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-10T02:27:11.553553Z"},"links":{"cited_paper":"/paper/2507.22448","citing_paper":"/paper/2604.19877"},"observation_digest":"sha256:0cc4e68c7eac293016ca5cdae00047a082176a039a6f14737f7d39fa854be484","observation_id":"4dcf20f3-d19c-4764-ad29-598907d510cb","resolution":{"observed_at":"2026-05-11T13:01:24.853106Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"cited_work":{"arxiv_id":"2507.22448","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.22448","snapshot_observed_at":"2026-07-02T01:46:26.624174Z","title":"Falcon-h1: A fam- ily of hybrid-head language models redefining efficiency and performance","venue":null,"work_id":"210a0b5b-f245-4f36-b66c-ff37b1c42ad3","year":2025},"citing_paper":{"arxiv_id":"2604.22575","last_updated":"2026-04-24T14:07:54Z","snapshot_observed_at":"2026-08-19T08:51:03.597867Z","submitted_at":"2026-04-24T14:07:54Z","title":"SpikingBrain2.0: Brain-Inspired Foundation Models for Efficient Long-Context and Cross-Platform Inference","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-08T12:18:23.898779Z"},"links":{"cited_paper":"/paper/2507.22448","citing_paper":"/paper/2604.22575"},"observation_digest":"sha256:a36bda38d587a7ca1830ed43315e8cd1cd6768d7eeb8521d35a3e46ea440e179","observation_id":"dbf90b1d-db8e-40bc-ad1d-7030b0754a37","resolution":{"observed_at":"2026-05-11T19:21:06.834096Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"cited_work":{"arxiv_id":"2507.22448","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.22448","snapshot_observed_at":"2026-07-02T01:46:26.624174Z","title":"Falcon-h1: A fam- ily of hybrid-head language models redefining efficiency and performance","venue":null,"work_id":"210a0b5b-f245-4f36-b66c-ff37b1c42ad3","year":2025},"citing_paper":{"arxiv_id":"2605.01106","last_updated":"2026-05-01T21:25:25Z","snapshot_observed_at":"2026-08-16T20:25:16.288133Z","submitted_at":"2026-05-01T21:25:25Z","title":"Component-Aware Self-Speculative Decoding in Hybrid Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-09T18:40:17.017805Z"},"links":{"cited_paper":"/paper/2507.22448","citing_paper":"/paper/2605.01106"},"observation_digest":"sha256:793cec6415e1631bd59c729997c33c9cef12c87e705a1ea014657298c0e30795","observation_id":"509c05d9-b8bf-4656-803c-e219c63b6005","resolution":{"observed_at":"2026-05-11T16:06:40.648369Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"cited_work":{"arxiv_id":"2507.22448","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.22448","snapshot_observed_at":"2026-07-02T01:46:26.624174Z","title":"Falcon-h1: A fam- ily of hybrid-head language models redefining efficiency and performance","venue":null,"work_id":"210a0b5b-f245-4f36-b66c-ff37b1c42ad3","year":2025},"citing_paper":{"arxiv_id":"2605.05662","last_updated":"2026-05-07T04:35:03Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:35:03Z","title":"XL-SafetyBench: A Country-Grounded Cross-Cultural Benchmark for LLM Safety and Cultural Sensitivity","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-08T11:08:22.322879Z"},"links":{"cited_paper":"/paper/2507.22448","citing_paper":"/paper/2605.05662"},"observation_digest":"sha256:35f88d48888e282499b63cff356237557e3a2ca55e3bdbd17d10151f8b0fec27","observation_id":"1f426a32-4a49-41d5-af73-67d496314406","resolution":{"observed_at":"2026-05-11T19:41:11.065650Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"cited_work":{"arxiv_id":"2507.22448","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.22448","snapshot_observed_at":"2026-07-02T01:46:26.624174Z","title":"Falcon-h1: A fam- ily of hybrid-head language models redefining efficiency and performance","venue":null,"work_id":"210a0b5b-f245-4f36-b66c-ff37b1c42ad3","year":2025},"citing_paper":{"arxiv_id":"2605.17653","last_updated":"2026-05-17T21:10:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-17T21:10:54Z","title":"LLMForge: Multi-Backend Hardware-Aware Neural Architecture Search with Infinite-Head Attention for Edge Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-20T13:58:55.899958Z"},"links":{"cited_paper":"/paper/2507.22448","citing_paper":"/paper/2605.17653"},"observation_digest":"sha256:e52bad34f993e3f18517ce5a36a5a1afa1633936d78a2993bee50a8e1abe31b5","observation_id":"22d69211-ca82-44fe-a18e-d700c1bd060d","resolution":{"observed_at":"2026-05-20T14:03:20.524249Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"cited_work":{"arxiv_id":"2507.22448","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.22448","snapshot_observed_at":"2026-07-02T01:46:26.624174Z","title":"Falcon-h1: A fam- ily of hybrid-head language models redefining efficiency and performance","venue":null,"work_id":"210a0b5b-f245-4f36-b66c-ff37b1c42ad3","year":2025},"citing_paper":{"arxiv_id":"2606.02332","last_updated":"2026-06-02T05:51:37Z","snapshot_observed_at":"2026-08-12T12:19:54.312161Z","submitted_at":"2026-06-01T14:42:06Z","title":"Forget Attention: Importance-Aware Attention Is All You Need","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T14:38:40.948032Z"},"links":{"cited_paper":"/paper/2507.22448","citing_paper":"/paper/2606.02332"},"observation_digest":"sha256:13cab8a6c529f2f9ce4e65b82726afb1f6c9b1f84e2a31fc852cefe6788a16c8","observation_id":"7c32fa78-ac57-4f48-8389-41d785d5e3a1","resolution":{"observed_at":"2026-07-01T23:06:21.045608Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"cited_work":{"arxiv_id":"2507.22448","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.22448","snapshot_observed_at":"2026-07-02T01:46:26.624174Z","title":"Falcon-h1: A fam- ily of hybrid-head language models redefining efficiency and performance","venue":null,"work_id":"210a0b5b-f245-4f36-b66c-ff37b1c42ad3","year":2025},"citing_paper":{"arxiv_id":"2606.03014","last_updated":"2026-06-02T01:40:33Z","snapshot_observed_at":"2026-08-18T10:30:51.054620Z","submitted_at":"2026-06-02T01:40:33Z","title":"MOSAIC: Efficient Mixture-of-Agent Scheduling via Adaptive Aggregation and Inference Concurrency","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-28T11:34:24.019560Z"},"links":{"cited_paper":"/paper/2507.22448","citing_paper":"/paper/2606.03014"},"observation_digest":"sha256:a55b9bd46c52c8bf8ff2107f520446f9540ffebdc611eaf348abc538c8627463","observation_id":"1008ae7b-3e77-4e5b-9f84-1fcfff013c6e","resolution":{"observed_at":"2026-07-02T01:46:26.630023Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"cited_work":{"arxiv_id":"2507.22448","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.22448","snapshot_observed_at":"2026-07-02T01:46:26.624174Z","title":"Falcon-h1: A fam- ily of hybrid-head language models redefining efficiency and performance","venue":null,"work_id":"210a0b5b-f245-4f36-b66c-ff37b1c42ad3","year":2025},"citing_paper":{"arxiv_id":"2606.30562","last_updated":"2026-06-29T17:02:34Z","snapshot_observed_at":"2026-08-14T09:50:47.227901Z","submitted_at":"2026-06-29T17:02:34Z","title":"Morphing into Hybrid Attention Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-30T05:56:51.447893Z"},"links":{"cited_paper":"/paper/2507.22448","citing_paper":"/paper/2606.30562"},"observation_digest":"sha256:da353ea45868c991068b8a491875d3a9fe39e4a616dbd172f56187847dcbcc97","observation_id":"4e091ae8-936e-4da1-9189-ce5823b5a42a","resolution":{"observed_at":"2026-06-30T08:44:28.064214Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.22448","snapshot_observed_at":"2026-07-11T10:45:46.618668Z","title":"Falcon-h1: A family of hybrid-head language models redefining efficiency and performance.arXiv preprint arXiv:2507.22448,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04969","last_updated":"2026-07-06T11:57:32Z","snapshot_observed_at":"2026-08-19T15:29:37.706087Z","submitted_at":"2026-07-06T11:57:32Z","title":"Train Smarter, Not Longer: Memorization-Guided Data Reuse for Efficient LLM Training","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-11T10:45:46.618668Z"},"links":{"cited_paper":"/paper/2507.22448","citing_paper":"/paper/2607.04969"},"observation_digest":"sha256:25434674ad3f6e71bff16c5e7b4619a96b6214e82821a1fddb389a37fd2f889d","observation_id":"dff1143d-d849-420a-9631-c9316323ac43","resolution":{"observed_at":"2026-07-11T10:45:46.618668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.22448","snapshot_observed_at":"2026-08-01T02:37:54.548638Z","title":"Falcon-h1: A family of hybrid-head language models redefining efficiency and performance,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25380","last_updated":"2026-07-28T07:34:53Z","snapshot_observed_at":"2026-08-13T04:02:20.179238Z","submitted_at":"2026-07-28T07:34:53Z","title":"Memory for Large Language Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-01T02:37:54.548638Z"},"links":{"cited_paper":"/paper/2507.22448","citing_paper":"/paper/2607.25380"},"observation_digest":"sha256:cdb757cbd8ae0a32e2c4fd04cccb038c7325b1bf484c79e6472e6409d13f0d0f","observation_id":"371f08b4-78ee-45ea-9589-85c464010d0c","resolution":{"observed_at":"2026-08-01T02:37:54.548638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.22448","snapshot_observed_at":"2026-08-12T00:51:15.651274Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10010","last_updated":"2026-08-12T03:58:39Z","snapshot_observed_at":"2026-08-17T09:38:05.904832Z","submitted_at":"2026-08-08T01:55:46Z","title":"CurveFP: Co-Designing Numerical Representation and Product Arithmetic for Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T00:51:15.651274Z"},"links":{"cited_paper":"/paper/2507.22448","citing_paper":"/paper/2608.10010"},"observation_digest":"sha256:8b9932e219fcb35ad1c4d7232d0ff34bcdaf65bca606002b9f1f3bd27e2c6ec8","observation_id":"42ad4e1c-28de-438b-88fe-d1b6f1ef4a65","resolution":{"observed_at":"2026-08-12T00:51:15.651274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.22448","snapshot_observed_at":"2026-08-14T04:46:37.290952Z","title":"13 A Algorithmic Details A.1 Closed-product addressing and accumulator bounds Let g= gcd(p, qK), nx =e xK+k x, nw =e wK+k w, and u=p(n x +n w)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10010","last_updated":"2026-08-12T03:58:39Z","snapshot_observed_at":"2026-08-17T09:38:05.904832Z","submitted_at":"2026-08-08T01:55:46Z","title":"CurveFP: Co-Designing Numerical Representation and Product Arithmetic for Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T04:46:37.290952Z"},"links":{"cited_paper":"/paper/2507.22448","citing_paper":"/paper/2608.10010"},"observation_digest":"sha256:fd0399ad5e6a8052ee6cd5b654cb60c8e6b0c975e9a693ec4dd54dd64b152b96","observation_id":"cbf796e2-675f-4d36-b664-e6d9a6f43f49","resolution":{"observed_at":"2026-08-14T04:46:37.290952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.22448/citation-record","integrity":"/paper/2507.22448/integrity","json":"/paper/2507.22448/citation-record.json","paper":"/paper/2507.22448"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:44:04.541501Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.541501Z"},"links":{"citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:485e0f4e82d637dbe3680d3180471be4894287c58c2298264ef22710804c2534","observation_id":"7f81a9a1-1676-4e54-901d-d3c7eee9c42a","resolution":{"observed_at":"2026-08-06T11:44:04.541501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:44:04.606975Z","title":"https://www.statmt.org/europarl/","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.606975Z"},"links":{"citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:d20de109604340a69902962478ea8c0fbc3502679d2d625ffebc55773911cd40","observation_id":"787993db-06c3-4a91-9758-6f50e2438e57","resolution":{"observed_at":"2026-08-06T11:44:04.606975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:44:04.677129Z","title":"https://www.gutenberg.org/","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.677129Z"},"links":{"citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:17b64b351871b430a7170ea5651d93962b947bb9ecc4d9d54a6437891abdf9fd","observation_id":"8a3a9768-82db-4bd1-9349-8040f2221bfc","resolution":{"observed_at":"2026-08-06T11:44:04.677129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:44:04.793814Z","title":"https://github.com/zeerakahmed/makhzan/","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.793814Z"},"links":{"citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:950daa1915337f609e49525b6181ac865b2d14e607ab962abcfc9241f71e6427","observation_id":"07803083-faf7-4896-9dcc-a03b8ae48083","resolution":{"observed_at":"2026-08-06T11:44:04.793814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:44:04.822822Z","title":"AIME problems and solutions, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.822822Z"},"links":{"citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:693cda869fa1ed71bfaf451bffe2cbd403c034868adce2dfc704a2a70fd16902","observation_id":"ea756849-0f6d-4db2-946f-049bbe8e8fdb","resolution":{"observed_at":"2026-08-06T11:44:04.822822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:44:04.831020Z","title":"GQA : Training generalized multi-query transformer models from multi-head checkpoints","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.831020Z"},"links":{"citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:e2a01b8b841bc8512a646506d77fb7c07112acf9bc07ee713144a65074bce186","observation_id":"bd3c80af-0051-43b2-bec3-13531e1e6a4b","resolution":{"observed_at":"2026-08-06T11:44:04.831020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:44:04.835598Z","title":"M ath QA : Towards interpretable math word problem solving with operation-based formalisms","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.835598Z"},"links":{"citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:b518d3ee0cada80fb647a61a7446d95558becc61ad98e49a3b6babdc9d68bb77","observation_id":"06b68635-1547-49b0-8fe4-e013a0df1ce5","resolution":{"observed_at":"2026-08-06T11:44:04.835598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-15T17:40:38.050939Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-06T11:44:04.839405Z","title":"Program synthesis with large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.839405Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:566e933fafb017d35b16b9d2c2b1548cd62d8179ea944c3f1aa505a632a39ad5","observation_id":"45981a6b-3ee7-4475-b4df-02ec2a67a340","resolution":{"observed_at":"2026-08-06T11:44:04.839405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10631","last_updated":"2024-03-15T19:14:39Z","snapshot_observed_at":"2026-08-16T13:51:18.629241Z","submitted_at":"2023-10-16T17:54:07Z","title":"Llemma: An Open Language Model For Mathematics","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10631","snapshot_observed_at":"2026-08-06T11:44:04.843213Z","title":"Llemma: An open language model for mathematics","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.843213Z"},"links":{"cited_paper":"/paper/2310.10631","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:c03745d31ee39fc2bc40f3037929ec2f06729415c9977012e3961a43f5b0dd05","observation_id":"8e3c9258-662a-477c-938a-ab173b749ebe","resolution":{"observed_at":"2026-08-06T11:44:04.843213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14762","last_updated":"2024-11-05T16:40:21Z","snapshot_observed_at":"2026-08-16T14:16:09.123077Z","submitted_at":"2024-02-22T18:21:59Z","title":"MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14762","snapshot_observed_at":"2026-08-06T11:44:04.847321Z","title":"Mt-bench-101: A fine-grained benchmark for evaluating large language models in multi-turn dialogues","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.847321Z"},"links":{"cited_paper":"/paper/2402.14762","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:5b0bd261088210a25538f8a16a125026d1e63ec35c0e8c1019e9d7d219166cb6","observation_id":"d4ecc412-daae-4138-8cbb-188cac617ada","resolution":{"observed_at":"2026-08-06T11:44:04.847321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00663","last_updated":"2024-12-31T22:32:03Z","snapshot_observed_at":"2026-08-16T10:45:05.594811Z","submitted_at":"2024-12-31T22:32:03Z","title":"Titans: Learning to Memorize at Test Time","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00663","snapshot_observed_at":"2026-08-06T11:44:04.851523Z","title":"Titans: Learning to memorize at test time","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.851523Z"},"links":{"cited_paper":"/paper/2501.00663","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:ebe0ff3e1fa095723e181de1a1f63f89dc817ce34d5bf9373ca2a98327f7efb4","observation_id":"923fb2ac-2821-4365-bf8c-488e325ad290","resolution":{"observed_at":"2026-08-06T11:44:04.851523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:44:04.855073Z","title":"Smollm-corpus, 7 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.855073Z"},"links":{"citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:6d2d4d93f3a33877330921be22b8c0bdf7f8a73cc98f6f0e12fba8aaacaa725d","observation_id":"a309cf25-b72f-439d-b055-ff719114e253","resolution":{"observed_at":"2026-08-06T11:44:04.855073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:44:04.858691Z","title":"Scaling optimal LR across token horizons","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.858691Z"},"links":{"citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:e93b3ef060ec426e48251c9dea3a0faca7ca7e0e0aed94ca397cc92dedd13e9b","observation_id":"f873f7a5-efc8-482e-9fb3-6c593a689fe7","resolution":{"observed_at":"2026-08-06T11:44:04.858691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:44:04.862301Z","title":"Ntk-aware scaled rope allows llama models to have extended (8k+) context size without any fine-tuning and minimal perplexity degradation, 2023 a","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.862301Z"},"links":{"citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:5dbf6f5fef6a219740154e5dd392815f1bd32724f6847ec4e2ec53903aa95079","observation_id":"04e9b964-08d9-4122-8b3f-c58fab1b748f","resolution":{"observed_at":"2026-08-06T11:44:04.862301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:44:04.865621Z","title":"by parts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.865621Z"},"links":{"citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:8db4bc34a6a2fec3e420d16cc8bc6734626e6d36ee70c383cf918f1b2983e3a9","observation_id":"04828cd5-b657-4183-b313-66031bb474b5","resolution":{"observed_at":"2026-08-06T11:44:04.865621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16620","last_updated":"2023-12-08T18:19:44Z","snapshot_observed_at":"2026-08-17T01:46:12.835651Z","submitted_at":"2023-09-28T17:20:50Z","title":"Depthwise Hyperparameter Transfer in Residual Networks: Dynamics and Scaling Limit","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16620","snapshot_observed_at":"2026-08-06T11:44:04.869255Z","title":"Depthwise hyperparameter transfer in residual networks: Dynamics and scaling limit, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.869255Z"},"links":{"cited_paper":"/paper/2309.16620","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:b96ec29c40b4c29d6a545a7dcc06e620d1730a4e46bcf5728b35832846d0a84e","observation_id":"5b43db33-faff-4cf6-95fc-94e02262e82f","resolution":{"observed_at":"2026-08-06T11:44:04.869255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:44:04.872685Z","title":"On the resemblance and containment of documents","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.872685Z"},"links":{"citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:5a99fc20143d0d796bd9ab206adb7eb4634a050ca8ef11d3777d05d807f8aa8f","observation_id":"2a62b25e-3a83-44fe-9c12-9590fa7da06e","resolution":{"observed_at":"2026-08-06T11:44:04.872685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:44:04.875843Z","title":"An investigation of incorporating mamba for speech enhancement","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.875843Z"},"links":{"citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:7065f1bb23bdf672c0ba87c44c9d2d9286a0e7c8436efa962bc0da150d654cfd","observation_id":"2270f3ec-43c5-44bb-b78c-17532c6ab9f2","resolution":{"observed_at":"2026-08-06T11:44:04.875843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02975","last_updated":"2024-12-04T02:37:31Z","snapshot_observed_at":"2026-08-16T01:49:30.312543Z","submitted_at":"2024-12-04T02:37:31Z","title":"Theoretical limitations of multi-layer Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02975","snapshot_observed_at":"2026-08-06T11:44:04.879218Z","title":"Theoretical limitations of multi-layer transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.879218Z"},"links":{"cited_paper":"/paper/2412.02975","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:47e9c7a20aee570431179a22ece7c5b8d23a1103036cbd9448f103a76a8bb935","observation_id":"fea037c4-e0f2-44f6-83db-7d76371b6564","resolution":{"observed_at":"2026-08-06T11:44:04.879218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:44:04.883072Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.883072Z"},"links":{"citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:590bf32757454fd534c916d3de489fffa9c370ca86e1fe2952d9b7db13e838fa","observation_id":"7b7cd417-8c87-453a-a002-534e7b9890dd","resolution":{"observed_at":"2026-08-06T11:44:04.883072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15595","last_updated":"2023-06-28T04:26:05Z","snapshot_observed_at":"2026-08-16T11:24:28.964729Z","submitted_at":"2023-06-27T16:26:26Z","title":"Extending Context Window of Large Language Models via Positional Interpolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15595","snapshot_observed_at":"2026-08-06T11:44:04.886379Z","title":"Extending context window of large language models via positional interpolation, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.886379Z"},"links":{"cited_paper":"/paper/2306.15595","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:e793c8e5c639fded1c4f5fd717244abc32c6feef74869f42a69697e3a0608f21","observation_id":"d9aa81a8-71d8-45f0-9c3e-4771ccd6b90f","resolution":{"observed_at":"2026-08-06T11:44:04.886379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02311","snapshot_observed_at":"2026-08-06T11:44:04.890348Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.890348Z"},"links":{"cited_paper":"/paper/2204.02311","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:d37b74b33c437d3c56b591400961608f216c14f728c13a0c2f08a2bf66378e7b","observation_id":"82a5db4f-5956-4d28-96fa-8824cf701442","resolution":{"observed_at":"2026-08-06T11:44:04.890348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-06T11:44:04.894015Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.894015Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:717d8c4f0f9cc87bd1d76c5e7db6abf49ce664e5d0402b9ec33c10415ee1fef4","observation_id":"c5229a37-a067-42cd-97d4-824e9c69e947","resolution":{"observed_at":"2026-08-06T11:44:04.894015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-06T11:44:04.901334Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.901334Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:0185b83a8737a65e7e34a9c54f7e39f1a20aa1cd879c866a702125e70e289c49","observation_id":"bcc88519-03eb-4b46-9d09-b2208b9b5970","resolution":{"observed_at":"2026-08-06T11:44:04.901334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:44:04.905202Z","title":"Okapi: Instruction-tuned large language models in multiple languages with reinforcement learning from human feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.905202Z"},"links":{"citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:37aa9b311cd3783e56d70bfa1683003f11271a108c16ed8c985958fe6b1c889b","observation_id":"1e6d29a9-05b3-485b-b806-b2725688dee6","resolution":{"observed_at":"2026-08-06T11:44:04.905202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:44:04.908379Z","title":"Unsloth, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.908379Z"},"links":{"citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:48430f0826e80935c0ab027b8fff91917d8c4bb9ebec00cad5f2fce6f2c933e9","observation_id":"1bd4b413-912d-420b-8d04-8d07217651d4","resolution":{"observed_at":"2026-08-06T11:44:04.908379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:44:04.911411Z","title":"we also choose similar dimensions as modern Transformers, e.g. P =64 or P =128","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.911411Z"},"links":{"citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:3c43a8a965e9d5f1a39ea058dd4e9141d369df24410e6da864dba5565a6cc001","observation_id":"f00624e6-5037-4f1b-86ad-17bdf18035b1","resolution":{"observed_at":"2026-08-06T11:44:04.911411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:44:04.915204Z","title":"Flash A ttention-2: Faster attention with better parallelism and work partitioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.915204Z"},"links":{"citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:1ae434384fc375d38fb657d5ea994c37fbc86e6964c95eca4241820a1c258509","observation_id":"06e304bb-56d3-4f34-97ed-cbafdebd8b88","resolution":{"observed_at":"2026-08-06T11:44:04.915204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21060","last_updated":"2024-05-31T17:50:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:50:01Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21060","snapshot_observed_at":"2026-08-06T11:44:04.918746Z","title":"Transformers are ssms: Generalized models and efficient algorithms through structured state space duality","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.918746Z"},"links":{"cited_paper":"/paper/2405.21060","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:009a1626b59f34f6494758895600c76021ce277d444dbd1ae34f9586cffa42e4","observation_id":"d229889f-f8dd-4734-92b5-44010efa1f21","resolution":{"observed_at":"2026-08-06T11:44:04.918746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:44:04.922246Z","title":"causal-conv1d: Causal depthwise conv1d in cuda with a pytorch interface","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.922246Z"},"links":{"citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:80e971e8e07504de1ad60871066cb909b80cce9ce19cf21af19fa58a84539652","observation_id":"157ac2de-34fe-40db-a501-72fb3e3c2c39","resolution":{"observed_at":"2026-08-06T11:44:04.922246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-08-20T11:13:49.127921Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-06T11:44:04.925289Z","title":"Griffin: Mixing gated linear recurrences with local attention for efficient language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.925289Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:d0c996f4d9fb090be88f7e1b5d524509fa634342d9a140f4607d5578c3c47abc","observation_id":"1391d620-ee6f-4a0c-9b19-b0c38e309ee1","resolution":{"observed_at":"2026-08-06T11:44:04.925289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03208","last_updated":"2023-04-06T16:43:16Z","snapshot_observed_at":"2026-08-18T04:17:03.903884Z","submitted_at":"2023-04-06T16:43:16Z","title":"Cerebras-GPT: Open Compute-Optimal Language Models Trained on the Cerebras Wafer-Scale Cluster","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03208","snapshot_observed_at":"2026-08-06T11:44:04.928577Z","title":"Cerebras-gpt: Open compute-optimal language models trained on the cerebras wafer-scale cluster, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.928577Z"},"links":{"cited_paper":"/paper/2304.03208","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:53da8d62d53431c375f026874d13adb507d593797e0a585f2c5655effc871c18","observation_id":"4c52a78a-a6e0-4ad8-a59b-a3e36ad36ad0","resolution":{"observed_at":"2026-08-06T11:44:04.928577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:44:04.932191Z","title":"Don't be lazy: Completep enables compute-efficient deep transformers, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.932191Z"},"links":{"citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:1e5e8f3c4e57a42d9fa7e3d7a358bc7f632e560872c8a2b7741e1d981f1a5189","observation_id":"b4efaa87-1a42-4004-ae5e-3b668982562a","resolution":{"observed_at":"2026-08-06T11:44:04.932191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13676","snapshot_observed_at":"2026-08-06T11:44:04.935445Z","title":"Hymba: A hybrid-head architecture for small language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.935445Z"},"links":{"cited_paper":"/paper/2411.13676","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:559ecc7242e2c3c67d99a282be77d88002bdc2f253959c62ad72d4035a0e26f8","observation_id":"4e4c4713-4027-417f-aa9d-b53bbadf77ac","resolution":{"observed_at":"2026-08-06T11:44:04.935445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:44:04.938969Z","title":"The language model evaluation harness, 07 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.938969Z"},"links":{"citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:5679c6fc7e2a60d25a1872e483924ecebde76bd319d04c7466a08466d6143617","observation_id":"38922801-4411-43c5-927e-eb7106fd46da","resolution":{"observed_at":"2026-08-06T11:44:04.938969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:44:04.942449Z","title":"A curated research corpus for agricultural advisory ai applications, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.942449Z"},"links":{"citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:aec8739dc8bb1abe4d4103b3578017203ca6a97e09271f31f391f1a773c603be","observation_id":"9c271b76-004d-4fa5-af46-b1be1eb89733","resolution":{"observed_at":"2026-08-06T11:44:04.942449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16712","last_updated":"2024-05-26T22:23:02Z","snapshot_observed_at":"2026-08-18T10:18:01.875999Z","submitted_at":"2024-05-26T22:23:02Z","title":"Zamba: A Compact 7B SSM Hybrid Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16712","snapshot_observed_at":"2026-08-06T11:44:04.945779Z","title":"Zamba: A compact 7b ssm hybrid model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.945779Z"},"links":{"cited_paper":"/paper/2405.16712","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:18fadb58077cc775c83e810bf31b10a191f87046da757e05e27ce41543c970cf","observation_id":"4bf17fc8-973d-4244-92be-3a9a39845fa9","resolution":{"observed_at":"2026-08-06T11:44:04.945779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T11:44:04.949357Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.949357Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:33911c0c6a7983bd15428faba1de97db3fe9cab58e148c98745372d6faf5431e","observation_id":"dd845671-dcd8-46fd-b16e-c3a30e1ddd0d","resolution":{"observed_at":"2026-08-06T11:44:04.949357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-08-17T20:47:46.242385Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-06T11:44:04.952490Z","title":"Mamba: Linear-time sequence modeling with selective state spaces","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.952490Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:bc13c697caffd91987118486651d19726b37ea075cf7e8103bad36db21352e60","observation_id":"e2ef3f7b-c574-41f8-8831-2d2905325626","resolution":{"observed_at":"2026-08-06T11:44:04.952490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03065","last_updated":"2024-01-05T20:53:51Z","snapshot_observed_at":"2026-08-17T23:54:36.836170Z","submitted_at":"2024-01-05T20:53:51Z","title":"CRUXEval: A Benchmark for Code Reasoning, Understanding and Execution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03065","snapshot_observed_at":"2026-08-06T11:44:04.955924Z","title":"Cruxeval: A benchmark for code reasoning, understanding and execution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.955924Z"},"links":{"cited_paper":"/paper/2401.03065","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:20ba7c6a06648fd8df1166f4f2b2fca5a039433dd583d02ff44bbab0a4ce5f70","observation_id":"ee6fefc1-2714-422e-8224-7b75061dca0a","resolution":{"observed_at":"2026-08-06T11:44:04.955924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14196","last_updated":"2024-01-26T09:23:11Z","snapshot_observed_at":"2026-08-06T22:40:28.707813Z","submitted_at":"2024-01-25T14:17:53Z","title":"DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14196","snapshot_observed_at":"2026-08-06T11:44:04.959140Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.959140Z"},"links":{"cited_paper":"/paper/2401.14196","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:5ec5f16009e56102820d9824fedacf6219c471761dd4de6b3c9808e71a0aefae","observation_id":"127ac7d5-5f02-4097-9a38-f7504bfa98b5","resolution":{"observed_at":"2026-08-06T11:44:04.959140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12568","last_updated":"2024-09-19T08:41:21Z","snapshot_observed_at":"2026-08-18T03:58:35.192558Z","submitted_at":"2024-09-19T08:41:21Z","title":"InfiMM-WebMath-40B: Advancing Multimodal Pre-Training for Enhanced Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12568","snapshot_observed_at":"2026-08-06T11:44:04.962316Z","title":"Infimm-webmath-40b: Advancing multimodal pre-training for enhanced mathematical reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.962316Z"},"links":{"cited_paper":"/paper/2409.12568","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:c76a36674a97eef9b5110ae387438f5190943f1742cf03d0f95c880684d08a20","observation_id":"d58e7aae-90d8-4b57-8062-6f5f412e00bc","resolution":{"observed_at":"2026-08-06T11:44:04.962316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:44:04.965689Z","title":"Simplifying transformer blocks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.965689Z"},"links":{"citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:20ae0bc4341d24ff0d2ccb5f486bb3a933f92aff2438773c7e8384b414abbe1a","observation_id":"ed0ee3a1-2d80-46c4-bc31-51183a07b4ef","resolution":{"observed_at":"2026-08-06T11:44:04.965689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-06T11:44:04.968529Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.968529Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:12d725f16353b29500d65c726d03e2eff4f41b4a069dc237aacca1b0d1cbd6ac","observation_id":"6b820cea-be7f-49d1-a52d-49bc826f2736","resolution":{"observed_at":"2026-08-06T11:44:04.968529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-06T11:44:04.975054Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.975054Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:6490611050f8cfdf8a4e09a4420aa2f84dcd443187773d0a6d446d5418c8f49a","observation_id":"1878db44-e39a-4c0f-8f6a-b08417fa6a1b","resolution":{"observed_at":"2026-08-06T11:44:04.975054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:44:04.978039Z","title":"Clarification on how to interpret kernel size for conv1d (\\#523)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.978039Z"},"links":{"citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:ebcafc29ef9cc693f1759e2f5b32690c2bb00e8e49cbe31648fa119a09a5bcd5","observation_id":"4a6864a5-2df0-47a7-ae38-1afc831a6766","resolution":{"observed_at":"2026-08-06T11:44:04.978039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-08-12T13:10:06.472493Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-06T11:44:04.981140Z","title":"Minicpm: Unveiling the potential of small language models with scalable training strategies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.981140Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:a758cc680be19f692b19171e200784db3792c663aff831eb209174f79b98f18b","observation_id":"f805150e-b425-4e6a-8802-56ddae5ce0c8","resolution":{"observed_at":"2026-08-06T11:44:04.981140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17743","last_updated":"2024-12-24T16:07:47Z","snapshot_observed_at":"2026-08-16T08:15:47.006654Z","submitted_at":"2024-12-23T17:47:53Z","title":"YuLan-Mini: An Open Data-efficient Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.17743","snapshot_observed_at":"2026-08-06T11:44:04.984553Z","title":"Yulan-mini: An open data-efficient language model, dec 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.984553Z"},"links":{"cited_paper":"/paper/2412.17743","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:78202dd851eca8906f9436cf6efc997b7c623831132491e4ae4451ca1cb8d175","observation_id":"0f838f95-5254-4696-9768-1be08b293133","resolution":{"observed_at":"2026-08-06T11:44:04.984553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04905","last_updated":"2025-03-20T03:28:56Z","snapshot_observed_at":"2026-08-16T13:02:01.818557Z","submitted_at":"2024-11-07T17:47:25Z","title":"OpenCoder: The Open Cookbook for Top-Tier Code Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04905","snapshot_observed_at":"2026-08-06T11:44:04.991100Z","title":"Opencoder: The open cookbook for top-tier code large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.991100Z"},"links":{"cited_paper":"/paper/2411.04905","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:8714d6306364ccc347028a4f44f884dd167034766c662fe77fc777255f6c31e8","observation_id":"53049af4-bf01-4546-936b-d8c846683af7","resolution":{"observed_at":"2026-08-06T11:44:04.991100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-08-06T11:44:04.994063Z","title":"Qwen2.5-coder technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.994063Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:46da1de8b863219dad7ab199a755753bbe3845cfe9ea259f5bcc495da347bedd","observation_id":"eb15ca1f-8ad2-468d-8ac3-0005d335c76d","resolution":{"observed_at":"2026-08-06T11:44:04.994063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:44:04.998003Z","title":"Teknium\"","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.998003Z"},"links":{"citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:9ab6849725bed80f646343b708c834c9a1b2d8e1b4231997fc7422da1c59ef55","observation_id":"bc91d04e-28eb-4365-be2d-33df4ebe6f42","resolution":{"observed_at":"2026-08-06T11:44:04.998003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-08-16T07:05:57.323612Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-06T11:44:05.001113Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:05.001113Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:cb2e81e22fffa914fedf86e55d1e4658c9c407b83a278759d4bb9aff8171b05e","observation_id":"d8989f89-5508-4755-ae7f-836d9061607a","resolution":{"observed_at":"2026-08-06T11:44:05.001113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T20:30:34.016254Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-06T11:44:05.004353Z","title":"Mistral 7b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:05.004353Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:f65b6be236e822e5c81eba57f23e79836fb855c7709d858fb83f40d2fe9efddc","observation_id":"6780996f-4641-4c02-9c4d-7db16feb3695","resolution":{"observed_at":"2026-08-06T11:44:05.004353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:44:05.007650Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:05.007650Z"},"links":{"citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:ff76dd496664719beefae394c8a79bb80c2202e654cb91cee2cdaba24d6bb486","observation_id":"a94679ca-e4e1-4ee7-9121-f3b037feeb46","resolution":{"observed_at":"2026-08-06T11:44:05.007650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:44:05.010727Z","title":"Math-Verify: Math Verification Library","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:05.010727Z"},"links":{"citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:068083c0350523269fe2bcdfd4f92ac148d8e529357eafa7a7a9ada4a8f250af","observation_id":"d60ab944-798a-43bc-a94f-7113a955211a","resolution":{"observed_at":"2026-08-06T11:44:05.010727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-17T14:11:00.232598Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-06T11:44:05.013872Z","title":"Tulu 3: Pushing frontiers in open language model post-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:05.013872Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:071f15576755baf0fdf66b83582866de4ea4c93bef5b4fe41e1a4f18be3cb11e","observation_id":"f912cf6d-c2b4-4759-8e22-6ebfd0f9a369","resolution":{"observed_at":"2026-08-06T11:44:05.013872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:44:05.017009Z","title":"Hashimoto","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:05.017009Z"},"links":{"citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:bb36c1786a85a799f82004c927d9cb9d9d866a8f2dacd562a104ca5a01149284","observation_id":"ea05661e-d601-4855-8b72-48d053029e9c","resolution":{"observed_at":"2026-08-06T11:44:05.017009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19887","last_updated":"2024-07-03T14:30:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-28T23:55:06Z","title":"Jamba: A Hybrid Transformer-Mamba Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19887","snapshot_observed_at":"2026-08-06T11:44:05.020186Z","title":"Jamba: A hybrid transformer-mamba language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:05.020186Z"},"links":{"cited_paper":"/paper/2403.19887","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:d04c32e6168184a98bbd7ee4d0d37eed385e8ee172b1930529f5c4a4970d366b","observation_id":"49962145-2704-4fcb-b1ef-4c39b15acc6b","resolution":{"observed_at":"2026-08-06T11:44:05.020186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-17T09:42:34.746112Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-06T11:44:05.023784Z","title":"Let's verify step by step","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:05.023784Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:814ceac181003a6f12ceefc21e7ba368ad0aed33c8a76f121fb62a31f164093e","observation_id":"01664cc4-cee7-4a14-b022-1c5cbf4ad88d","resolution":{"observed_at":"2026-08-06T11:44:05.023784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.07958","last_updated":"2022-05-08T02:43:02Z","snapshot_observed_at":"2026-08-03T16:26:48.747700Z","submitted_at":"2021-09-08T17:15:27Z","title":"TruthfulQA: Measuring How Models Mimic Human Falsehoods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.07958","snapshot_observed_at":"2026-08-06T11:44:05.026994Z","title":"Truthfulqa: Measuring how models mimic human falsehoods","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:05.026994Z"},"links":{"cited_paper":"/paper/2109.07958","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:0d0413098b2fb54a62b8b03ba5f400531dc043ff11fc9f57033b2a70d9a20d5b","observation_id":"0934111e-4d85-49e3-b35b-19a2fbaa5ee2","resolution":{"observed_at":"2026-08-06T11:44:05.026994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-06T11:44:05.030425Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:05.030425Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:cf8a8ddfb1d651a2e864b675b1e6509f5bbeed29767875870107366401b16484","observation_id":"a9d9cc21-269b-4277-b869-987e90b27225","resolution":{"observed_at":"2026-08-06T11:44:05.030425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-18T18:18:37.449517Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T11:44:05.033930Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:05.033930Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:09c4ecca2097bc3332b91c55b1295123d9cff18b9ff43cd7856c3d4137a9a52a","observation_id":"79f08128-3994-4a5e-9648-a943ce076329","resolution":{"observed_at":"2026-08-06T11:44:05.033930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01889","last_updated":"2023-11-27T06:38:47Z","snapshot_observed_at":"2026-08-14T10:14:18.862721Z","submitted_at":"2023-10-03T08:44:50Z","title":"Ring Attention with Blockwise Transformers for Near-Infinite Context","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01889","snapshot_observed_at":"2026-08-06T11:44:05.037477Z","title":"Ring attention with blockwise transformers for near-infinite context, 2023 a","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:05.037477Z"},"links":{"cited_paper":"/paper/2310.01889","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:d02e51b076c6cbf0ac3f5210566432d52f2092058d5ce8f9ea8b710a458a44a3","observation_id":"d56803e7-77f7-436f-9dee-bbdfa96710ff","resolution":{"observed_at":"2026-08-06T11:44:05.037477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:44:05.040804Z","title":"Is your code generated by chat GPT really correct? rigorous evaluation of large language models for code generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:05.040804Z"},"links":{"citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:7abe0b6dd3d0898d03b8cefe145bcf93813558ae397e8996109ea36aa681a898","observation_id":"cff6b3fb-6a55-4bcd-94d8-8c1b63903a09","resolution":{"observed_at":"2026-08-06T11:44:05.040804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07747","last_updated":"2024-09-06T10:19:10Z","snapshot_observed_at":"2026-08-16T14:10:31.218022Z","submitted_at":"2024-03-12T15:32:39Z","title":"FineMath: A Fine-Grained Mathematical Evaluation Benchmark for Chinese Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07747","snapshot_observed_at":"2026-08-06T11:44:05.044254Z","title":"Finemath: A fine-grained mathematical evaluation benchmark for chinese large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:05.044254Z"},"links":{"cited_paper":"/paper/2403.07747","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:6864234b398456abfc0f43bfe6c6168bc5cab07b1ed904f7d7a227e5d79b6ded","observation_id":"0b2cedc9-0998-4925-83ba-95eb4ff1793a","resolution":{"observed_at":"2026-08-06T11:44:05.044254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10166","last_updated":"2024-12-29T14:57:13Z","snapshot_observed_at":"2026-08-17T14:56:56.233298Z","submitted_at":"2024-01-18T17:55:39Z","title":"VMamba: Visual State Space Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10166","snapshot_observed_at":"2026-08-06T11:44:05.048052Z","title":"Vmamba: Visual state space model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:05.048052Z"},"links":{"cited_paper":"/paper/2401.10166","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:9d44b39e20171854d8b64200a8d544319d0bb96cc38ead84330f7c9d992993cc","observation_id":"45e7d6d2-774f-4515-9039-37326b740c80","resolution":{"observed_at":"2026-08-06T11:44:05.048052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06550","last_updated":"2023-12-11T17:39:00Z","snapshot_observed_at":"2026-08-18T18:39:12.910411Z","submitted_at":"2023-12-11T17:39:00Z","title":"LLM360: Towards Fully Transparent Open-Source LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06550","snapshot_observed_at":"2026-08-06T11:44:05.051705Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:05.051705Z"},"links":{"cited_paper":"/paper/2312.06550","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:1d9ccb5b28dccdaf136df508911fae0926ea68337389bceaa8acb72b5d387626","observation_id":"db1ac445-930a-4684-bbd8-88b298153cf6","resolution":{"observed_at":"2026-08-06T11:44:05.051705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15084","last_updated":"2025-01-17T07:12:55Z","snapshot_observed_at":"2026-08-15T17:39:14.326195Z","submitted_at":"2024-12-19T17:29:44Z","title":"AceMath: Advancing Frontier Math Reasoning with Post-Training and Reward Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15084","snapshot_observed_at":"2026-08-06T11:44:05.055041Z","title":"Acemath: Advancing frontier math reasoning with post-training and reward modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:05.055041Z"},"links":{"cited_paper":"/paper/2412.15084","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:3a274bfb118528b3200ec605557fd0d1cffa2dd5c0f1a6b8205961936a1107fd","observation_id":"2831f5a5-a1e4-45f5-803c-555773a4587d","resolution":{"observed_at":"2026-08-06T11:44:05.055041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10559","last_updated":"2025-05-15T17:59:22Z","snapshot_observed_at":"2026-08-17T21:49:01.820313Z","submitted_at":"2025-05-15T17:59:22Z","title":"Neural Thermodynamic Laws for Large Language Model Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.10559","snapshot_observed_at":"2026-08-06T11:44:05.058346Z","title":"Neural thermodynamic laws for large language model training, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:05.058346Z"},"links":{"cited_paper":"/paper/2505.10559","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:ffba5bd55e99358a2926ece5cf1cfa6a3d40cdf20151ef7215a031fa806535c1","observation_id":"b88f9cc7-7416-4d8d-b8e8-91e37a2868d3","resolution":{"observed_at":"2026-08-06T11:44:05.058346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19173","last_updated":"2024-02-29T13:53:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T13:53:35Z","title":"StarCoder 2 and The Stack v2: The Next Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19173","snapshot_observed_at":"2026-08-06T11:44:05.061741Z","title":"Starcoder 2 and the stack v2: The next generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:05.061741Z"},"links":{"cited_paper":"/paper/2402.19173","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:533b1ad2a8af06e00951e339524bc6f978079813012ee3f58d020f961ecfdc68","observation_id":"40fde3dc-73f3-4bf5-9b93-b0b98a2a431c","resolution":{"observed_at":"2026-08-06T11:44:05.061741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:44:05.064835Z","title":"Finefineweb: A comprehensive study on fine-grained domain web corpus, December 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:05.064835Z"},"links":{"citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:3353debcb3c37532ade2e2bb534dea5b45f57fb1c22d64d6bda41f67d8dc543c","observation_id":"9cebfcdc-1343-469b-9dbd-f933aebb1960","resolution":{"observed_at":"2026-08-06T11:44:05.064835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14885","last_updated":"2024-07-20T14:23:15Z","snapshot_observed_at":"2026-08-20T04:14:57.055075Z","submitted_at":"2024-07-20T14:23:15Z","title":"Falcon2-11B Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14885","snapshot_observed_at":"2026-08-06T11:44:05.068137Z","title":"Falcon2-11b technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:05.068137Z"},"links":{"cited_paper":"/paper/2407.14885","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:32c78a11b8d95599f52a468906de06f55157b047c6309e27b70eb331c2f770f7","observation_id":"dc8be85c-b023-4bc2-a14e-d76ee16e124c","resolution":{"observed_at":"2026-08-06T11:44:05.068137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:44:05.071691Z","title":"On the SDE s and scaling rules for adaptive gradient algorithms","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:05.071691Z"},"links":{"citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:0a641d02e8aa1cfd524d6cf218f7c0b8d78b56aad8f90c9f9bfdd1fd32aa3d66","observation_id":"69aa7760-f631-4154-b6de-07e7b3a8a88f","resolution":{"observed_at":"2026-08-06T11:44:05.071691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:44:05.074866Z","title":"Peft: State-of-the-art parameter-efficient fine-tuning methods","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:05.074866Z"},"links":{"citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:5ee2a497d1690710b1beed2926a2335baf1f1463f6d1d4673849d5ae542073fe","observation_id":"8c31e340-b16d-4dd4-b068-15b4ee7a6e5d","resolution":{"observed_at":"2026-08-06T11:44:05.074866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2507.12442","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:44:05.344654Z","title":"Characterizing state space model (ssm) and ssm-transformer hybrid language model performance with long context length","venue":null,"work_id":"96f0ad53-47fc-439f-a7d2-2d9c8e79d997","year":2025},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:05.078266Z"},"links":{"citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:d318f6402a777ed1103cf77bec36b7c21d27001326400b2f03ec0bcc55c5ff68","observation_id":"ed2b363a-ac4b-4071-95f6-97eae5fb1bbc","resolution":{"observed_at":"2026-08-06T11:44:05.348325Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:44:05.081530Z","title":"Gptqmodel","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:05.081530Z"},"links":{"citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:7a54b21674b0278dddd99472d85a5cf629b6cd0546fde1d2c9c3d2e4f055576a","observation_id":"a30eb55a-7539-45c5-be7e-bccbcc2c6261","resolution":{"observed_at":"2026-08-06T11:44:05.081530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:44:05.084768Z","title":"Oumi: an Open, End-to-end Platform for Building Large Foundation Models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:05.084768Z"},"links":{"citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:9b8815805cfc7f5599a9bd1f0236a29b874d3ac6c4422fc12d61629c5fb7803b","observation_id":"fb7f6932-7122-4815-8adb-464c7b092de9","resolution":{"observed_at":"2026-08-06T11:44:05.084768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:44:05.088041Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:05.088041Z"},"links":{"citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:6df6a70f843114a11c3ca32a35d6f3481c65cb9f2081c04580a30029989997e5","observation_id":"d36d9ee2-e91b-4eb7-85c4-9bd8479c654c","resolution":{"observed_at":"2026-08-06T11:44:05.088041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06786","last_updated":"2023-10-10T16:57:28Z","snapshot_observed_at":"2026-08-18T23:26:43.616423Z","submitted_at":"2023-10-10T16:57:28Z","title":"OpenWebMath: An Open Dataset of High-Quality Mathematical Web Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06786","snapshot_observed_at":"2026-08-06T11:44:05.091402Z","title":"Openwebmath: An open dataset of high-quality mathematical web text","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:05.091402Z"},"links":{"cited_paper":"/paper/2310.06786","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:3fd3f8e247247abdbd85d4f0283f680b3d73243ed0f2a6afab30b9aa3c74c175","observation_id":"e41e80a7-9063-4176-bbee-9d575dc0f2fa","resolution":{"observed_at":"2026-08-06T11:44:05.091402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13230","last_updated":"2025-04-09T19:05:31Z","snapshot_observed_at":"2026-08-16T12:27:08.648377Z","submitted_at":"2025-01-22T21:30:49Z","title":"Let SSMs be ConvNets: State-space Modeling with Optimal Tensor Contractions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13230","snapshot_observed_at":"2026-08-06T11:44:05.094528Z","title":"Let ssms be convnets: State-space modeling with optimal tensor contractions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:05.094528Z"},"links":{"cited_paper":"/paper/2501.13230","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:57d2c2a3bb3ae5de4ca66e83afd1f4af30062ba66b8e888b736bb7cfb0e8b8ca","observation_id":"c51db2a0-4b10-4fc2-8c76-e60b3f0a74db","resolution":{"observed_at":"2026-08-06T11:44:05.094528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01116","last_updated":"2023-06-01T20:03:56Z","snapshot_observed_at":"2026-08-20T04:37:17.931952Z","submitted_at":"2023-06-01T20:03:56Z","title":"The RefinedWeb Dataset for Falcon LLM: Outperforming Curated Corpora with Web Data, and Web Data Only","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01116","snapshot_observed_at":"2026-08-06T11:44:05.098462Z","title":"The refinedweb dataset for falcon llm: outperforming curated corpora with web data, and web data only","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:05.098462Z"},"links":{"cited_paper":"/paper/2306.01116","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:1412a8cc03735ffc1e99962771fd0371582558455f16ce3dccc4094741be0e3a","observation_id":"c8b09cda-0096-4a24-ba43-7a0e6b81e328","resolution":{"observed_at":"2026-08-06T11:44:05.098462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17557","last_updated":"2024-10-31T11:37:49Z","snapshot_observed_at":"2026-08-20T16:41:47.138179Z","submitted_at":"2024-06-25T13:50:56Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17557","snapshot_observed_at":"2026-08-06T11:44:05.101847Z","title":"The fineweb datasets: Decanting the web for the finest text data at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:05.101847Z"},"links":{"cited_paper":"/paper/2406.17557","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:c7b1281dab3f01650210c006cc0c5be07deba3886320dda75ea97af946fb8f60","observation_id":"3ee2a1ea-c56f-4a81-8837-99ad2a41e8ec","resolution":{"observed_at":"2026-08-06T11:44:05.101847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:44:05.105443Z","title":"Fineweb2: A sparkling update with 1000s of languages, 12 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:05.105443Z"},"links":{"citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:80aa41517200884db0c5cb47dd3b239adb4feca8bb489d0c449911a08f6dd1bb","observation_id":"fa35d1c4-b80f-4b2a-8389-9444c428bcb2","resolution":{"observed_at":"2026-08-06T11:44:05.105443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13048","last_updated":"2023-12-11T03:58:56Z","snapshot_observed_at":"2026-08-17T17:58:38.402665Z","submitted_at":"2023-05-22T13:57:41Z","title":"RWKV: Reinventing RNNs for the Transformer Era","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13048","snapshot_observed_at":"2026-08-06T11:44:05.108362Z","title":"Rwkv: Reinventing rnns for the transformer era","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:05.108362Z"},"links":{"cited_paper":"/paper/2305.13048","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:1ac0bfc6bd8ed2e1876526fca67d069ec07526bb0babdc4f88faeacbbccd835c","observation_id":"bda3d50e-9dc8-42be-85d5-2a7da09f17c0","resolution":{"observed_at":"2026-08-06T11:44:05.108362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:44:05.111733Z","title":"Evalchemy , 6 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:05.111733Z"},"links":{"citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:e138d52cffcdd13b91e094f2ce1cbd634899182d8460e9174adb7d5abc036a7d","observation_id":"e01bc0f2-1fd3-4b6b-b4e3-f924a2f083cb","resolution":{"observed_at":"2026-08-06T11:44:05.111733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-18T14:12:03.598270Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-06T11:44:05.114869Z","title":"Gpqa: A graduate-level google-proof q&a benchmark","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:05.114869Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:36d790679bd6987ad2900f7a9b092a0ad034ef28d82a71d080e8621657639605","observation_id":"777610d2-4d3d-4562-a9c8-911ec6890b5e","resolution":{"observed_at":"2026-08-06T11:44:05.114869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07522","last_updated":"2025-02-28T02:20:49Z","snapshot_observed_at":"2026-08-16T13:44:03.977685Z","submitted_at":"2024-06-11T17:50:51Z","title":"Samba: Simple Hybrid State Space Models for Efficient Unlimited Context Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07522","snapshot_observed_at":"2026-08-06T11:44:05.118331Z","title":"Samba: Simple hybrid state space models for efficient unlimited context language modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:05.118331Z"},"links":{"cited_paper":"/paper/2406.07522","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:344d9c83c3c66554f2bf8e97de79ed5de7517bbed0f8bbc73226a3cb46c2262a","observation_id":"393867cb-602c-4308-bba1-113d0c510b64","resolution":{"observed_at":"2026-08-06T11:44:05.118331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:44:05.121691Z","title":"Winogrande: An adversarial winograd schema challenge at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:05.121691Z"},"links":{"citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:cf69b54a66aab931303bd93964f49b716a268beaa2b8ad2fbbf73047018a9987","observation_id":"422be3ea-4046-47a7-a9ff-428f7ff8a7db","resolution":{"observed_at":"2026-08-06T11:44:05.121691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:44:05.124645Z","title":"Analysing mathematical reasoning abilities of neural models","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:05.124645Z"},"links":{"citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:787e5865b11ce995fed366fe4a266af9202abab91e3856b0d51023654703af50","observation_id":"956151ee-d073-4565-a981-b1e217ec2aca","resolution":{"observed_at":"2026-08-06T11:44:05.124645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1508.07909","last_updated":"2016-06-10T14:45:08Z","snapshot_observed_at":"2026-08-17T07:28:37.146698Z","submitted_at":"2015-08-31T16:37:31Z","title":"Neural Machine Translation of Rare Words with Subword Units","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1508.07909","snapshot_observed_at":"2026-08-06T11:44:05.127589Z","title":"Neural machine translation of rare words with subword units, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:05.127589Z"},"links":{"cited_paper":"/paper/1508.07909","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:cc504bf22c823d1debc28b059099bbede3d21823c2cf8756d4fbdf9debbc9b3c","observation_id":"3628a4b7-7c89-44b7-9eca-a15340f7c846","resolution":{"observed_at":"2026-08-06T11:44:05.127589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T11:44:05.130974Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:05.130974Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:4b9a3677b8f84c4a9255806ceed1145be53c241a344d1720021ee7bb53b6a2d9","observation_id":"ec2cd26a-f6b6-43d5-984b-ed53622262a9","resolution":{"observed_at":"2026-08-06T11:44:05.130974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13359","last_updated":"2024-09-11T20:48:05Z","snapshot_observed_at":"2026-08-16T13:24:13.755592Z","submitted_at":"2024-08-23T20:22:20Z","title":"Power Scheduler: A Batch Size and Token Number Agnostic Learning Rate Scheduler","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13359","snapshot_observed_at":"2026-08-06T11:44:05.134546Z","title":"Cox, and Rameswar Panda","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:05.134546Z"},"links":{"cited_paper":"/paper/2408.13359","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:3ee86d210d8c76857455c4ba873d1694e3114f30501ff854cfdb627eeefaa7b0","observation_id":"0716ce06-0ba2-4ab1-9c3d-1ae8f576fd1f","resolution":{"observed_at":"2026-08-06T11:44:05.134546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03057","last_updated":"2022-10-06T17:03:34Z","snapshot_observed_at":"2026-07-06T14:00:37.875054Z","submitted_at":"2022-10-06T17:03:34Z","title":"Language Models are Multilingual Chain-of-Thought Reasoners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03057","snapshot_observed_at":"2026-08-06T11:44:05.138083Z","title":"Language models are multilingual chain-of-thought reasoners","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:05.138083Z"},"links":{"cited_paper":"/paper/2210.03057","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:89a9ca6c191b3c9a156a86d63fbda9e214d04afa197602dd89d1c847d046e3d3","observation_id":"ba6ed58d-d837-4a17-8923-0b9b59c9016d","resolution":{"observed_at":"2026-08-06T11:44:05.138083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14903","last_updated":"2024-02-22T18:14:09Z","snapshot_observed_at":"2026-08-18T14:23:11.964976Z","submitted_at":"2024-02-22T18:14:09Z","title":"Tokenization counts: the impact of tokenization on arithmetic in frontier LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14903","snapshot_observed_at":"2026-08-06T11:44:05.142116Z","title":"Singh and DJ Strouse","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:05.142116Z"},"links":{"cited_paper":"/paper/2402.14903","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:e8e7a748e3ab5da7802cf8396471189f81aac204115acdfcc9cb6fc4cfc443d7","observation_id":"a3304daf-b9de-49a4-9691-3c7c562a0ade","resolution":{"observed_at":"2026-08-06T11:44:05.142116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s41598-024-71678-8","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Learning long sequences in spiking neural networks","venue":"Scientific Reports","work_id":"60bd1ad3-18f2-4f55-a667-00396a4d8db4","year":2024},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:05.145500Z"},"links":{"citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:f4e40beb82c4854c373dd50a0ffd928524369063a79c08d1e34294d7d643218e","observation_id":"1141e35b-26e3-42e9-a0df-5200cd6e93fb","resolution":{"observed_at":"2026-08-06T11:44:05.272456Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02595","last_updated":"2025-05-30T20:49:42Z","snapshot_observed_at":"2026-08-20T01:15:45.865236Z","submitted_at":"2024-12-03T17:28:50Z","title":"Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02595","snapshot_observed_at":"2026-08-06T11:44:05.149322Z","title":"Nemotron-cc: Transforming common crawl into a refined long-horizon pretraining dataset, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:05.149322Z"},"links":{"cited_paper":"/paper/2412.02595","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:33ed677eea7ceec2893f8f3fa74a942cf54bcb01a03fc81d4ec7b0bdec04dfa0","observation_id":"e5ef4d0e-37f8-4d08-be1a-0cac25f6b8e1","resolution":{"observed_at":"2026-08-06T11:44:05.149322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09261","last_updated":"2022-10-17T17:08:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-17T17:08:26Z","title":"Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09261","snapshot_observed_at":"2026-08-06T11:44:05.152682Z","title":"Challenging big-bench tasks and whether chain-of-thought can solve them","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:05.152682Z"},"links":{"cited_paper":"/paper/2210.09261","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:31d68d96339aeb150f4aa8f13256607bc2206e3081fd3f6894878386f8dfe9dd","observation_id":"d4d23035-cd8a-407e-9ca3-fd4b89f1c9d1","resolution":{"observed_at":"2026-08-06T11:44:05.152682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13623","last_updated":"2024-11-01T02:41:36Z","snapshot_observed_at":"2026-08-16T13:33:00.004600Z","submitted_at":"2024-07-18T15:58:54Z","title":"Scaling Laws with Vocabulary: Larger Models Deserve Larger Vocabularies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13623","snapshot_observed_at":"2026-08-06T11:44:05.155947Z","title":"Scaling laws with vocabulary: Larger models deserve larger vocabularies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:05.155947Z"},"links":{"cited_paper":"/paper/2407.13623","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:a453395cc44cfb45ffebdef9d8c7d7a14148ce70202b7cc69f73d3f212b59164","observation_id":"03cfb998-cc4a-40a3-b94f-f28f502efd42","resolution":{"observed_at":"2026-08-06T11:44:05.155947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:44:05.159813Z","title":"The falcon 3 family of open models, December 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:05.159813Z"},"links":{"citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:2fb025a5be4cb5023cc4015423b3f874b5855e4854d30cb05fe36f5cc3a482b0","observation_id":"d187b681-39aa-4295-ba20-317f44cfdbb6","resolution":{"observed_at":"2026-08-06T11:44:05.159813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-06T11:44:05.162957Z","title":"Gemma 3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":103,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:05.162957Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:b06f481658b378de0c94cb7caac4ac50e5f2a262886c8724a507d238d3fd136e","observation_id":"8978e1ff-d78c-423b-87e2-f5b82d67a399","resolution":{"observed_at":"2026-08-06T11:44:05.162957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":98,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":123},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 100 of 123 outbound references and 18 inbound Pith citation observations for arXiv:2507.22448."}