{"as_of":"2026-08-11T04:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d62c4aeaf3760f53d41eb50c6a77ed244980d1a63a5eaa4cbc8fe2a04c6e9d6c","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:13:28.835572Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T10:18:54.163862Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T09:47:59.879253Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-09T15:26:51.425515Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"cited_work":{"arxiv_id":"2505.22425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22425","snapshot_observed_at":"2026-07-03T09:47:59.879253Z","title":"Scaling reasoning without attention","venue":null,"work_id":"f934bbdf-5415-4a38-891a-acbf9062586b","year":2025},"citing_paper":{"arxiv_id":"2507.11687","last_updated":"2026-08-09T10:08:31Z","snapshot_observed_at":"2026-08-11T04:16:09.841840Z","submitted_at":"2025-07-15T19:44:20Z","title":"MetaLint: Easy-to-Hard Generalization for Code Linting","version":4},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-19T04:07:31.283348Z"},"links":{"cited_paper":"/paper/2505.22425","citing_paper":"/paper/2507.11687"},"observation_digest":"sha256:29364b43bb4aca48fe5499ba5189fcb163605bd230ca42329298700a3d08e213","observation_id":"38fd6968-c2b3-4337-9c67-ebb554f29524","resolution":{"observed_at":"2026-05-19T04:12:02.876223Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-09T15:26:51.425515Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"cited_work":{"arxiv_id":"2505.22425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22425","snapshot_observed_at":"2026-07-03T09:47:59.879253Z","title":"Scaling reasoning without attention","venue":null,"work_id":"f934bbdf-5415-4a38-891a-acbf9062586b","year":2025},"citing_paper":{"arxiv_id":"2606.11634","last_updated":"2026-06-10T03:56:03Z","snapshot_observed_at":"2026-08-02T13:37:43.737297Z","submitted_at":"2026-06-10T03:56:03Z","title":"Architecture-Aware Reinforcement Learning Makes Sliding-Window Attention Competitive in Math Reasoning","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-06-27T10:18:54.163862Z"},"links":{"cited_paper":"/paper/2505.22425","citing_paper":"/paper/2606.11634"},"observation_digest":"sha256:d2a81ab5b60184419cbeef49445dbf2be74e8c0787a7522356937ffd02ab9e93","observation_id":"176b3fa8-1938-42be-a182-b772f314f799","resolution":{"observed_at":"2026-07-03T09:47:59.880509Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.22425/citation-record","integrity":"/paper/2505.22425/integrity","json":"/paper/2505.22425/citation-record.json","paper":"/paper/2505.22425"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T13:13:26.227804Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-09T15:26:51.425515Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:26.227804Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:dbb6d952d0d278ec2bb126bf0adee637570837d60b3d5f393dbf3c479a3058fd","observation_id":"2e310493-4137-4ef4-ae9d-4c5f6eff8019","resolution":{"observed_at":"2026-08-07T13:13:26.227804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:26.415360Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-09T15:26:51.425515Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:26.415360Z"},"links":{"citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:81bb0985d427b1b4959ecb17bd9cb72367badbad324c76e8114353d36f54cdf7","observation_id":"8cc3dbb4-c48c-4a46-a9f4-ec87798285cb","resolution":{"observed_at":"2026-08-07T13:13:26.415360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T13:13:26.648195Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-09T15:26:51.425515Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:26.648195Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:10476393b27b8094c903d50607951a5b7fecb7d4818fcb8c180a4e787f315746","observation_id":"9fc8e080-b323-42ca-86af-59ed924e7fd5","resolution":{"observed_at":"2026-08-07T13:13:26.648195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-07T13:13:26.740105Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-09T15:26:51.425515Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:26.740105Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:4094388e8b7d8a42378182c4107f108015a8200f76c481b9300a7b26ffd3959a","observation_id":"69b356c1-0c92-4468-8a44-12d431ded2d3","resolution":{"observed_at":"2026-08-07T13:13:26.740105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-07T13:13:26.815329Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-09T15:26:51.425515Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:26.815329Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:563ec137eb4481e3bd6c08ad9dd0aa5f3aa72942eed1d37cfe18000c4b357be7","observation_id":"fd5febec-8819-4651-ae3e-7af956b07aed","resolution":{"observed_at":"2026-08-07T13:13:26.815329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-08-10T03:07:35.408836Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-07T13:13:26.947907Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-09T15:26:51.425515Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:26.947907Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:28b03a6f61524717e7d29f0adba045df0eafe4e18c91441658ec7b838c89e904","observation_id":"709c1181-f750-43e5-a30e-b624d8459e01","resolution":{"observed_at":"2026-08-07T13:13:26.947907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:30.310294Z","title":"9 Aitor Lewkowycz, Anders Andreassen, David Dohan, Ethan Dyer, Henryk Michalewski, Vinay Ra- masesh, Ambrose Slone, Cem Anil, Imanol Schlag, Theo Gutman-Solo, et al","venue":null,"work_id":"04c1d06d-41a7-4ff4-9295-f8a26e1d775d","year":2025},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-09T15:26:51.425515Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:27.038519Z"},"links":{"citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:8a4db9d011398e0b1d32c2bbebd7b6a396c3d00e3cc63d436982ae5c5031892a","observation_id":"c66d47db-93db-46ff-988f-a33b0611c00b","resolution":{"observed_at":"2026-08-07T13:13:30.398256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-05T13:11:04.104454Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-07T13:13:27.137705Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-09T15:26:51.425515Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:27.137705Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:8329f6873a10250ab9579256b8af22ec1400687df2b761b06c8eaa9ce47ee776","observation_id":"1bab0e03-c8d6-4045-b22f-7be5514dbfe3","resolution":{"observed_at":"2026-08-07T13:13:27.137705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16891","last_updated":"2025-04-23T17:13:04Z","snapshot_observed_at":"2026-08-07T15:59:48.302908Z","submitted_at":"2025-04-23T17:13:04Z","title":"AIMO-2 Winning Solution: Building State-of-the-Art Mathematical Reasoning Models with OpenMathReasoning dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16891","snapshot_observed_at":"2026-08-07T13:13:27.227849Z","title":"Aimo-2 winning solution: Building state-of-the-art mathematical reasoning models with openmathreasoning dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-09T15:26:51.425515Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:27.227849Z"},"links":{"cited_paper":"/paper/2504.16891","citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:3660e83f49ead3e830168c9b7032cb7021c1f661d336234545b4ac714dc38b16","observation_id":"64cbe68b-78ec-4b6c-a9c0-6af0de2e2f80","resolution":{"observed_at":"2026-08-07T13:13:27.227849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-07T13:13:27.340471Z","title":"s1: Simple test-time scaling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-09T15:26:51.425515Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:27.340471Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:c8f0a83246cd76a7a6df0389dca563b72949adca5da8f02ca037fa8f3326cf29","observation_id":"c9926482-f297-4aa8-b329-8cf8c955e4f4","resolution":{"observed_at":"2026-08-07T13:13:27.340471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13048","last_updated":"2023-12-11T03:58:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T13:57:41Z","title":"RWKV: Reinventing RNNs for the Transformer Era","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13048","snapshot_observed_at":"2026-08-07T13:13:27.469238Z","title":"Rwkv: Reinventing rnns for the transformer era","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-09T15:26:51.425515Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:27.469238Z"},"links":{"cited_paper":"/paper/2305.13048","citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:64fec8b46b2d3d671f6e73fe9ac1ef8e4d5b6c810f191c57b0dd08a887a115c9","observation_id":"ab333d8c-9054-4dee-be5f-ae0b0743df95","resolution":{"observed_at":"2026-08-07T13:13:27.469238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08621","last_updated":"2023-08-09T08:53:08Z","snapshot_observed_at":"2026-08-02T13:21:32.251959Z","submitted_at":"2023-07-17T16:40:01Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08621","snapshot_observed_at":"2026-08-07T13:13:27.624874Z","title":"Retentive network: A successor to transformer for large language models.arXiv preprint arXiv:2307.08621,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-09T15:26:51.425515Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:27.624874Z"},"links":{"cited_paper":"/paper/2307.08621","citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:15b3527cc16826c1cc1c5220ffdf56819627986049076d370faf2f8067ed4cec","observation_id":"bb416504-5ae1-4418-bd1e-c5e554c7af25","resolution":{"observed_at":"2026-08-07T13:13:27.624874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-07T13:13:27.735999Z","title":"Gemma 3 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-09T15:26:51.425515Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:27.735999Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:2fdb831f73e6012c9eb51b5f45db5ca5876174a841f2f47618f904a0c6e15390","observation_id":"5d3c91fc-0bb1-4550-a45f-cd0a3c0f3b01","resolution":{"observed_at":"2026-08-07T13:13:27.735999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10449","last_updated":"2025-09-09T04:52:25Z","snapshot_observed_at":"2026-08-07T16:05:47.222775Z","submitted_at":"2025-04-14T17:38:25Z","title":"M1: Towards Scalable Test-Time Compute with Mamba Reasoning Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10449","snapshot_observed_at":"2026-08-07T13:13:27.861259Z","title":"NovaSky Team","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-09T15:26:51.425515Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:27.861259Z"},"links":{"cited_paper":"/paper/2504.10449","citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:626781a389a4a6a00317755499322a25b4fe6fba94898f3f03855217e3d2330c","observation_id":"6d6a2ed3-9257-4b80-8998-86bac1a0fbbb","resolution":{"observed_at":"2026-08-07T13:13:27.861259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-07T13:13:27.970162Z","title":"Self-consistency improves chain of thought reasoning in language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-09T15:26:51.425515Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:27.970162Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:e4cd99748671b3a21391b9eb4b774862e4f78fd618e1b014393ab5c766fe5e6c","observation_id":"11a2ed28-ce7e-4a00-9c4d-92da4a5d57b2","resolution":{"observed_at":"2026-08-07T13:13:27.970162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06484","last_updated":"2025-01-15T10:41:40Z","snapshot_observed_at":"2026-08-06T05:53:13.494942Z","submitted_at":"2024-06-10T17:24:42Z","title":"Parallelizing Linear Transformers with the Delta Rule over Sequence Length","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06484","snapshot_observed_at":"2026-08-07T13:13:28.091568Z","title":"Parallelizing linear transformers with the delta rule over sequence length","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-09T15:26:51.425515Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:28.091568Z"},"links":{"cited_paper":"/paper/2406.06484","citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:9f09d5a0a7fac0498673e248a09db85525b8e9e241b5be5cda8a47ca85f50efc","observation_id":"232cce74-e538-4a71-8cb9-6ad92e78a480","resolution":{"observed_at":"2026-08-07T13:13:28.091568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05653","last_updated":"2023-10-03T02:48:42Z","snapshot_observed_at":"2026-08-07T14:43:09.380195Z","submitted_at":"2023-09-11T17:47:22Z","title":"MAmmoTH: Building Math Generalist Models through Hybrid Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05653","snapshot_observed_at":"2026-08-07T13:13:28.195543Z","title":"Mammoth: Building math generalist models through hybrid instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-09T15:26:51.425515Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:28.195543Z"},"links":{"cited_paper":"/paper/2309.05653","citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:69b2766a6ced2daf319a356f8cfd9aec7a6ebe10a4c3e8051da217d83dbf4107","observation_id":"49190441-b27f-4683-bd0b-ae4a2a8fc160","resolution":{"observed_at":"2026-08-07T13:13:28.195543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03548","last_updated":"2024-05-23T16:34:35Z","snapshot_observed_at":"2026-08-10T09:54:53.085558Z","submitted_at":"2024-05-06T15:11:38Z","title":"MAmmoTH2: Scaling Instructions from the Web","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03548","snapshot_observed_at":"2026-08-07T13:13:28.299855Z","title":"Mammoth2: Scaling instructions from the web","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-09T15:26:51.425515Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:28.299855Z"},"links":{"cited_paper":"/paper/2405.03548","citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:96f6a271ea9886447a1cde53ab7ab85b1718fd2bf574372aa0233ea4595c3813","observation_id":"cf98c9ff-b42a-496e-9dde-b54d27aff825","resolution":{"observed_at":"2026-08-07T13:13:28.299855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12960","last_updated":"2023-10-19T17:56:40Z","snapshot_observed_at":"2026-08-10T07:40:37.602520Z","submitted_at":"2023-10-19T17:56:40Z","title":"SEGO: Sequential Subgoal Optimization for Mathematical Problem-Solving","version":1},"cited_work":{"arxiv_id":"2310.12960","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.12960","snapshot_observed_at":"2026-08-07T13:13:29.203918Z","title":"SEGO: Sequential Subgoal Optimization for Mathematical Problem-Solving","venue":"cs.CL","work_id":"6ff808a7-21ac-4752-8951-f4a1d37e786b","year":2023},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-09T15:26:51.425515Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:28.389604Z"},"links":{"cited_paper":"/paper/2310.12960","citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:d111347504d5c5f4e73f21dc2b6145323d2ac9cda2344d9acaa10ffbed59f9da","observation_id":"a25caafe-4ae7-4836-a253-4895d8bf899e","resolution":{"observed_at":"2026-08-07T13:13:29.309591Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11172","last_updated":"2024-08-20T20:10:53Z","snapshot_observed_at":"2026-08-04T23:58:13.073385Z","submitted_at":"2024-08-20T20:10:53Z","title":"SubgoalXL: Subgoal-based Expert Learning for Theorem Proving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11172","snapshot_observed_at":"2026-08-07T13:13:28.536244Z","title":"Subgoalxl: Subgoal-based expert learning for theorem proving","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-09T15:26:51.425515Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:28.536244Z"},"links":{"cited_paper":"/paper/2408.11172","citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:9a9e2e59a5331bb2d7beabf1664b148b77665c4ec1746d7f786163c9947e9870","observation_id":"fb20beab-3a9c-40c7-b91c-7a9042483b9c","resolution":{"observed_at":"2026-08-07T13:13:28.536244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:28.644116Z","title":"Promptcot: Synthesizing olympiad-level problems for mathematical reasoning in large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-09T15:26:51.425515Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:28.644116Z"},"links":{"citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:e909bd7bccd0477480614c066cf8289fa283d4b439b8bb729a8b014b13b87493","observation_id":"de3232c6-d290-402a-ba76-56aadcff66ee","resolution":{"observed_at":"2026-08-07T13:13:28.644116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04542","last_updated":"2023-02-09T10:16:20Z","snapshot_observed_at":"2026-08-09T07:28:17.257102Z","submitted_at":"2023-02-09T10:16:20Z","title":"Efficient Attention via Control Variates","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.04542","snapshot_observed_at":"2026-08-07T13:13:28.758966Z","title":"Efficient attention via control variates","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-09T15:26:51.425515Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:28.758966Z"},"links":{"cited_paper":"/paper/2302.04542","citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:a06fe791e3c7c0484e68394de085d8992e4fac28c4bdde2c127f1b6d023fe655","observation_id":"8832bc9f-8306-48f5-bb41-1d515f79f604","resolution":{"observed_at":"2026-08-07T13:13:28.758966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10625","last_updated":"2023-04-16T22:08:08Z","snapshot_observed_at":"2026-08-06T09:00:42.886249Z","submitted_at":"2022-05-21T15:34:53Z","title":"Least-to-Most Prompting Enables Complex Reasoning in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.10625","snapshot_observed_at":"2026-08-07T13:13:28.835572Z","title":"Least-to-most prompting enables complex reasoning in large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-09T15:26:51.425515Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:28.835572Z"},"links":{"cited_paper":"/paper/2205.10625","citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:89a7994408f64aac7317128cea4905a01542c394cadbfc3c0d3dda325f3bceaa","observation_id":"069d62ff-3531-4f02-a1b6-9827a79ec468","resolution":{"observed_at":"2026-08-07T13:13:28.835572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-07T13:13:26.496858Z","title":"Evaluating large language models trained on code","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-09T15:26:51.425515Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:26.496858Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:d4110ff8017a1061bf7d9f8cf087c559e097afa1663ce63a3327569f2cf0681c","observation_id":"946022f1-e3eb-409b-a108-8f113b4e3add","resolution":{"observed_at":"2026-08-07T13:13:26.496858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T13:13:26.876946Z","title":"Openai o1 system card.arXiv preprint arXiv:2412.16720,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-09T15:26:51.425515Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:26.876946Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:4b26e694a14b229ad61e4f6271d20fcde71cd826d45149ef9a045b768c488d10","observation_id":"377417d6-7b14-47eb-95d5-5826c4681d22","resolution":{"observed_at":"2026-08-07T13:13:26.876946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06635","last_updated":"2024-08-27T01:27:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-11T18:51:59Z","title":"Gated Linear Attention Transformers with Hardware-Efficient Training","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06635","snapshot_observed_at":"2026-08-07T13:13:28.038685Z","title":"Gated linear attention transformers with hardware-efficient training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-09T15:26:51.425515Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:28.038685Z"},"links":{"cited_paper":"/paper/2312.06635","citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:8590c07df423f8a233459fece5f9d0e11e4f7e11c0f784cfeb5ab4a4e894d833","observation_id":"0379efc3-ba6b-4810-8651-41a7ca3c7fc3","resolution":{"observed_at":"2026-08-07T13:13:28.038685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01943","last_updated":"2025-08-07T23:04:55Z","snapshot_observed_at":"2026-08-08T04:08:24.938705Z","submitted_at":"2025-04-02T17:50:31Z","title":"OpenCodeReasoning: Advancing Data Distillation for Competitive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01943","snapshot_observed_at":"2026-08-07T13:13:26.292420Z","title":"Opencodereasoning: Advancing data distillation for competitive coding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-09T15:26:51.425515Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:26.292420Z"},"links":{"cited_paper":"/paper/2504.01943","citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:e2b6cd7171b92f4e87ea72a56aa61d8b12d9d73d8d85beb3c00fa5221f5387b6","observation_id":"f7c5e5c4-6f0a-43ba-9152-fe1d4437403c","resolution":{"observed_at":"2026-08-07T13:13:26.292420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-07T13:13:26.570912Z","title":"mlr.press/v235/dao24a.html","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-09T15:26:51.425515Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:26.570912Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:9e4c9bec35bb7d6dd57bf0692706988cc975982b22ddf5065d5cd9f1f4b5d33b","observation_id":"48ba9ba7-0e97-42a7-afe2-ebc9327e91a6","resolution":{"observed_at":"2026-08-07T13:13:26.570912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03624","last_updated":"2025-09-05T17:58:38Z","snapshot_observed_at":"2026-08-09T11:20:42.068658Z","submitted_at":"2025-04-04T17:41:58Z","title":"Nemotron-H: A Family of Accurate and Efficient Hybrid Mamba-Transformer Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.03624","snapshot_observed_at":"2026-08-07T13:13:26.357993Z","title":"https://huggingface.co/datasets/ai-mo/aimo-validation-aime","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-09T15:26:51.425515Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:26.357993Z"},"links":{"cited_paper":"/paper/2504.03624","citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:2f794665fe7253d3482d16ea9d74c484a8bfdea15b2c3c2bcf28f4e82d1f3540","observation_id":"ea777f1a-5425-4c36-a710-89fe317673d3","resolution":{"observed_at":"2026-08-07T13:13:26.357993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T15:26:51.425515Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":1,"verified_fuzzy":1},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 2 inbound Pith citation observations for arXiv:2505.22425."}