{"as_of":"2026-08-11T08:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e6ba88b59be8a53405c33397cfdbbaa6f126361226f24d4c682381d5cc36d40d","coverage":[{"denominator":19,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T17:52:36.115298Z","state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2604.06799/citation-record","integrity":"/paper/2604.06799/integrity","json":"/paper/2604.06799/citation-record.json","paper":"/paper/2604.06799"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.20131","last_updated":"2024-10-25T14:50:45Z","snapshot_observed_at":"2026-08-01T18:24:13.057707Z","submitted_at":"2024-05-30T15:10:37Z","title":"Language Models Need Inductive Biases to Count Inductively","version":2},"cited_work":{"arxiv_id":"2405.20131","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20131","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language models need inductive biases to count inductively.arXiv preprint arXiv:2405.20131","venue":null,"work_id":"cb533193-0eec-4615-9318-51f376824ef2","year":null},"citing_paper":{"arxiv_id":"2604.06799","last_updated":"2026-04-08T08:12:45Z","snapshot_observed_at":"2026-08-11T07:26:29.146558Z","submitted_at":"2026-04-08T08:12:45Z","title":"Beyond Accuracy: Diagnosing Algebraic Reasoning Failures in LLMs Across Nine Complexity Dimensions","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T17:52:36.115298Z"},"links":{"cited_paper":"/paper/2405.20131","citing_paper":"/paper/2604.06799"},"observation_digest":"sha256:5aae5d6974837983cb0d2fcb91e9ec7f234a121de135443c1745e96067646561","observation_id":"3b660930-8769-4b52-99a5-1a9888d23838","resolution":{"observed_at":"2026-05-11T05:55:59.082961Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2604.06799","last_updated":"2026-04-08T08:12:45Z","snapshot_observed_at":"2026-08-11T07:26:29.146558Z","submitted_at":"2026-04-08T08:12:45Z","title":"Beyond Accuracy: Diagnosing Algebraic Reasoning Failures in LLMs Across Nine Complexity Dimensions","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T17:52:36.115298Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2604.06799"},"observation_digest":"sha256:523a4b48f60e428f31bf7b614c88bac24158c937e13de3533eae9af2fbe9bbe1","observation_id":"8974e614-cc8a-43a8-9191-896c620aebc9","resolution":{"observed_at":"2026-05-11T05:55:59.127342Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10715","last_updated":"2024-11-16T20:50:11Z","snapshot_observed_at":"2026-08-09T09:57:53.258062Z","submitted_at":"2024-09-16T20:38:35Z","title":"Self-Attention Limits Working Memory Capacity of Transformer-Based Models","version":2},"cited_work":{"arxiv_id":"2409.10715","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.10715","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Self-attention limits working memory capacity of transformer-based models.arXiv preprint arXiv:2409.10715","venue":null,"work_id":"42aee13a-7a56-484e-a66f-42bb560d50d8","year":null},"citing_paper":{"arxiv_id":"2604.06799","last_updated":"2026-04-08T08:12:45Z","snapshot_observed_at":"2026-08-11T07:26:29.146558Z","submitted_at":"2026-04-08T08:12:45Z","title":"Beyond Accuracy: Diagnosing Algebraic Reasoning Failures in LLMs Across Nine Complexity Dimensions","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T17:52:36.115298Z"},"links":{"cited_paper":"/paper/2409.10715","citing_paper":"/paper/2604.06799"},"observation_digest":"sha256:b72b046bb0bd67db842760614de62a21b8785d278c3b9ea0af05ae1ee8b9295e","observation_id":"8ee06ef5-5ea1-4cd1-8bbb-6d305c95c92b","resolution":{"observed_at":"2026-05-11T05:55:59.076245Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":"2103.03874","doi":"10.48550/arxiv.2103.03874","metadata_source":"pith","pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","venue":"cs.LG","work_id":"50652ac6-fb7c-4675-a2c2-159c241feb17","year":2021},"citing_paper":{"arxiv_id":"2604.06799","last_updated":"2026-04-08T08:12:45Z","snapshot_observed_at":"2026-08-11T07:26:29.146558Z","submitted_at":"2026-04-08T08:12:45Z","title":"Beyond Accuracy: Diagnosing Algebraic Reasoning Failures in LLMs Across Nine Complexity Dimensions","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T17:52:36.115298Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2604.06799"},"observation_digest":"sha256:2f948ebf4f1f63e1367eb238973cf2498664963bf0f2725f216c34e34b7bd1de","observation_id":"33a3090b-baa9-4e31-810a-7bfecc3a770c","resolution":{"observed_at":"2026-05-11T05:55:59.133983Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07313","last_updated":"2025-07-09T22:22:49Z","snapshot_observed_at":"2026-08-09T14:54:40.708162Z","submitted_at":"2025-07-09T22:22:49Z","title":"Frontier LLMs Still Struggle with Simple Reasoning Tasks","version":1},"cited_work":{"arxiv_id":"2507.07313","doi":"10.48550/arxiv.2507.07313","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.07313","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Frontier LLMs still struggle with simple reasoning tasks","venue":"ArXiv.org","work_id":"ed7e4e30-9693-44ef-848c-f6af51c05ca1","year":2025},"citing_paper":{"arxiv_id":"2604.06799","last_updated":"2026-04-08T08:12:45Z","snapshot_observed_at":"2026-08-11T07:26:29.146558Z","submitted_at":"2026-04-08T08:12:45Z","title":"Beyond Accuracy: Diagnosing Algebraic Reasoning Failures in LLMs Across Nine Complexity Dimensions","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T17:52:36.115298Z"},"links":{"cited_paper":"/paper/2507.07313","citing_paper":"/paper/2604.06799"},"observation_digest":"sha256:a069a4d4c723de267396ba392f3f6e8f54115f3f5ea69108866315af6fae9c4f","observation_id":"7cc24919-6d76-4a51-b211-0e9d5f4796c1","resolution":{"observed_at":"2026-05-11T05:55:59.149749Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07923","last_updated":"2024-04-11T18:03:53Z","snapshot_observed_at":"2026-08-02T23:51:22.170619Z","submitted_at":"2023-10-11T22:35:18Z","title":"The Expressive Power of Transformers with Chain of Thought","version":5},"cited_work":{"arxiv_id":"2310.07923","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.07923","snapshot_observed_at":"2026-07-10T22:47:37.037905Z","title":"and Sabharwal, A","venue":"cs.LG","work_id":"63096903-9f44-418b-b53b-f7debf28d7a9","year":2023},"citing_paper":{"arxiv_id":"2604.06799","last_updated":"2026-04-08T08:12:45Z","snapshot_observed_at":"2026-08-11T07:26:29.146558Z","submitted_at":"2026-04-08T08:12:45Z","title":"Beyond Accuracy: Diagnosing Algebraic Reasoning Failures in LLMs Across Nine Complexity Dimensions","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T17:52:36.115298Z"},"links":{"cited_paper":"/paper/2310.07923","citing_paper":"/paper/2604.06799"},"observation_digest":"sha256:208eaa72885ac38953691c3cfc8c1271f0eb38cb52f9a513fa5ff0d1d2c7bf3f","observation_id":"4144f919-67f1-4c8e-bb90-85359ecc43c1","resolution":{"observed_at":"2026-05-11T05:55:59.122059Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11357","last_updated":"2024-07-23T14:39:06Z","snapshot_observed_at":"2026-08-07T15:31:32.195607Z","submitted_at":"2024-05-18T18:08:58Z","title":"Large Language Models Lack Understanding of Character Composition of Words","version":3},"cited_work":{"arxiv_id":"2405.11357","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.11357","snapshot_observed_at":"2026-07-04T09:59:44.971467Z","title":"Large language models lack understanding of character composition of words","venue":null,"work_id":"0c0e2b89-aafc-49c9-93a3-431259517c3c","year":2024},"citing_paper":{"arxiv_id":"2604.06799","last_updated":"2026-04-08T08:12:45Z","snapshot_observed_at":"2026-08-11T07:26:29.146558Z","submitted_at":"2026-04-08T08:12:45Z","title":"Beyond Accuracy: Diagnosing Algebraic Reasoning Failures in LLMs Across Nine Complexity Dimensions","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T17:52:36.115298Z"},"links":{"cited_paper":"/paper/2405.11357","citing_paper":"/paper/2604.06799"},"observation_digest":"sha256:8958e2a094a12769b1d461ccb96ed1945122a76a06dad8050e8e739afbd9c152","observation_id":"ba0c836a-8f1f-4685-a613-70f026f3163d","resolution":{"observed_at":"2026-05-11T05:55:59.113748Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v26i1.8341","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Peiyang Song, Pengrui Han, and Noah Goodman","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"8b0048bc-c0cf-403b-9e3c-924c2ebd56ff","year":null},"citing_paper":{"arxiv_id":"2604.06799","last_updated":"2026-04-08T08:12:45Z","snapshot_observed_at":"2026-08-11T07:26:29.146558Z","submitted_at":"2026-04-08T08:12:45Z","title":"Beyond Accuracy: Diagnosing Algebraic Reasoning Failures in LLMs Across Nine Complexity Dimensions","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T17:52:36.115298Z"},"links":{"citing_paper":"/paper/2604.06799"},"observation_digest":"sha256:32e24075efb916b0b2bc7d9107fe7a6d4255bfaaec4761a0275a89fb89e807f6","observation_id":"b3264002-5dc6-4572-a12b-776207149d8b","resolution":{"observed_at":"2026-05-10T20:40:48.461191Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02884","last_updated":"2024-03-05T11:42:59Z","snapshot_observed_at":"2026-08-09T12:20:46.679035Z","submitted_at":"2024-03-05T11:42:59Z","title":"MathScale: Scaling Instruction Tuning for Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":"2403.02884","doi":"10.48550/arxiv.2403.02884","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.02884","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mathscale: Scaling instruction tuning for mathematical reasoning","venue":"arXiv (Cornell University)","work_id":"450d5342-49ed-44d9-85e1-41826683418c","year":2024},"citing_paper":{"arxiv_id":"2604.06799","last_updated":"2026-04-08T08:12:45Z","snapshot_observed_at":"2026-08-11T07:26:29.146558Z","submitted_at":"2026-04-08T08:12:45Z","title":"Beyond Accuracy: Diagnosing Algebraic Reasoning Failures in LLMs Across Nine Complexity Dimensions","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T17:52:36.115298Z"},"links":{"cited_paper":"/paper/2403.02884","citing_paper":"/paper/2604.06799"},"observation_digest":"sha256:63b199ff83b304ff7b6dfbe18402eaed48e88a5289b6f7f590a2bd84b379a922","observation_id":"69a39fdc-d15c-4e4d-8c96-8b06b782605c","resolution":{"observed_at":"2026-05-11T05:55:59.090715Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.17083/ijsg.v8i2","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"168ba77e-a8a6-4534-97b8-028fb5a39733","year":null},"citing_paper":{"arxiv_id":"2604.06799","last_updated":"2026-04-08T08:12:45Z","snapshot_observed_at":"2026-08-11T07:26:29.146558Z","submitted_at":"2026-04-08T08:12:45Z","title":"Beyond Accuracy: Diagnosing Algebraic Reasoning Failures in LLMs Across Nine Complexity Dimensions","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T17:52:36.115298Z"},"links":{"citing_paper":"/paper/2604.06799"},"observation_digest":"sha256:c62ab1d14234878eb2a1707bef0d003c712f97b7522934a8d9e2f65ebb6db1be","observation_id":"f5a7bd6f-6c00-4c59-ab5d-4f55df683567","resolution":{"observed_at":"2026-05-10T20:40:48.458547Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19730","last_updated":"2024-10-29T03:48:33Z","snapshot_observed_at":"2026-08-07T22:21:22.429314Z","submitted_at":"2024-10-25T17:56:24Z","title":"Counting Ability of Large Language Models and Impact of Tokenization","version":2},"cited_work":{"arxiv_id":"2410.19730","doi":"10.48550/arxiv.2410.19730","metadata_source":"pith","pith_arxiv_id":"2410.19730","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2410.19730 , year =","venue":"cs.CL","work_id":"03adbc37-2463-4298-b12c-afa9344ad2de","year":2024},"citing_paper":{"arxiv_id":"2604.06799","last_updated":"2026-04-08T08:12:45Z","snapshot_observed_at":"2026-08-11T07:26:29.146558Z","submitted_at":"2026-04-08T08:12:45Z","title":"Beyond Accuracy: Diagnosing Algebraic Reasoning Failures in LLMs Across Nine Complexity Dimensions","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T17:52:36.115298Z"},"links":{"cited_paper":"/paper/2410.19730","citing_paper":"/paper/2604.06799"},"observation_digest":"sha256:f822e683e94e70c7229cb5d5dee9ace35993d3aa3abcc4b6a12cd29249b55a6d","observation_id":"eb2e858a-e109-4447-9ace-b35ccb5d74b0","resolution":{"observed_at":"2026-05-11T05:55:59.098180Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploring the compositional deficiency of large language models in mathematical reasoning through trap problems","venue":null,"work_id":"63b17f71-7617-4ee2-af03-f57fccf59b0e","year":2024},"citing_paper":{"arxiv_id":"2604.06799","last_updated":"2026-04-08T08:12:45Z","snapshot_observed_at":"2026-08-11T07:26:29.146558Z","submitted_at":"2026-04-08T08:12:45Z","title":"Beyond Accuracy: Diagnosing Algebraic Reasoning Failures in LLMs Across Nine Complexity Dimensions","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T17:52:36.115298Z"},"links":{"citing_paper":"/paper/2604.06799"},"observation_digest":"sha256:6b47abe42057f38414b2af6bfdc37dc49ec09a2777ba69fe116debb2a1c3c0fa","observation_id":"373c800c-4ca0-4eab-8384-39a7ab62c9f6","resolution":{"observed_at":"2026-05-17T08:31:39.807249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Each line corresponds to one of the seven models, traced across increasing complexity levels from left to right","venue":null,"work_id":"af30bff3-4624-4f94-8d32-fe9b856f56f6","year":2026},"citing_paper":{"arxiv_id":"2604.06799","last_updated":"2026-04-08T08:12:45Z","snapshot_observed_at":"2026-08-11T07:26:29.146558Z","submitted_at":"2026-04-08T08:12:45Z","title":"Beyond Accuracy: Diagnosing Algebraic Reasoning Failures in LLMs Across Nine Complexity Dimensions","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T17:52:36.115298Z"},"links":{"citing_paper":"/paper/2604.06799"},"observation_digest":"sha256:2af1e5361f5047d2f0ba7c65b5ee8323da10c6291fc1d0e5aefad3266d3adc7b","observation_id":"522a8c51-570c-419a-883b-a4a9199058b6","resolution":{"observed_at":"2026-05-17T08:31:39.775289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transformer attention has no explicit register mechanism for this","venue":null,"work_id":"3116f311-39b7-420a-a37d-b4d334589e5f","year":2026},"citing_paper":{"arxiv_id":"2604.06799","last_updated":"2026-04-08T08:12:45Z","snapshot_observed_at":"2026-08-11T07:26:29.146558Z","submitted_at":"2026-04-08T08:12:45Z","title":"Beyond Accuracy: Diagnosing Algebraic Reasoning Failures in LLMs Across Nine Complexity Dimensions","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T17:52:36.115298Z"},"links":{"citing_paper":"/paper/2604.06799"},"observation_digest":"sha256:3c70eb6e27c0050b301bff4f21a8a3c05e1dfa40024ac8fee1dfa22bfa7a6e11","observation_id":"fde1a1ed-02f9-4c18-b778-f5056ea116d8","resolution":{"observed_at":"2026-05-17T08:31:39.798210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The steep cliff structure — not a gradual fade, confirms that models possess discrete working memory limits rather than capacity degradation","venue":null,"work_id":"5cbe243d-9b41-4a4b-bac8-dbfe524d2e59","year":2026},"citing_paper":{"arxiv_id":"2604.06799","last_updated":"2026-04-08T08:12:45Z","snapshot_observed_at":"2026-08-11T07:26:29.146558Z","submitted_at":"2026-04-08T08:12:45Z","title":"Beyond Accuracy: Diagnosing Algebraic Reasoning Failures in LLMs Across Nine Complexity Dimensions","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T17:52:36.115298Z"},"links":{"citing_paper":"/paper/2604.06799"},"observation_digest":"sha256:451ea7288f115c35d4448cc457c7098513ebad157d2a756195a2e2a951ba99e0","observation_id":"aaa6f490-fbec-4161-a86d-8cd11f98cad3","resolution":{"observed_at":"2026-05-17T08:31:39.788018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"This is a hard internal limit","venue":null,"work_id":"8bb3634c-c1c8-4496-915c-4195ed733a48","year":2026},"citing_paper":{"arxiv_id":"2604.06799","last_updated":"2026-04-08T08:12:45Z","snapshot_observed_at":"2026-08-11T07:26:29.146558Z","submitted_at":"2026-04-08T08:12:45Z","title":"Beyond Accuracy: Diagnosing Algebraic Reasoning Failures in LLMs Across Nine Complexity Dimensions","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T17:52:36.115298Z"},"links":{"citing_paper":"/paper/2604.06799"},"observation_digest":"sha256:48ca06f8e84d6b6c2bf4e821fe9b4cb4bfd82c07bc8ca67984caa622a7158dbd","observation_id":"863c7966-853c-4dd1-943d-d8979ae7b49c","resolution":{"observed_at":"2026-05-17T08:31:39.791600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The rightmost zone (steps 10–12) is uniformly zero across all models","venue":null,"work_id":"102d3a8f-73a7-4edc-a29b-45cd2655936f","year":2026},"citing_paper":{"arxiv_id":"2604.06799","last_updated":"2026-04-08T08:12:45Z","snapshot_observed_at":"2026-08-11T07:26:29.146558Z","submitted_at":"2026-04-08T08:12:45Z","title":"Beyond Accuracy: Diagnosing Algebraic Reasoning Failures in LLMs Across Nine Complexity Dimensions","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T17:52:36.115298Z"},"links":{"citing_paper":"/paper/2604.06799"},"observation_digest":"sha256:47076cc2fbc6e456d77702edeaf4ef0314ddb5de31785cc9d8caf95c50501ace","observation_id":"1aa744f2-3bbc-4780-a761-a099dd612b6c","resolution":{"observed_at":"2026-05-17T08:31:39.802626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"All other models drop dramatically at K=25 or K=60","venue":null,"work_id":"13eea35e-d19d-4e6d-b0ff-082178e2b710","year":2024},"citing_paper":{"arxiv_id":"2604.06799","last_updated":"2026-04-08T08:12:45Z","snapshot_observed_at":"2026-08-11T07:26:29.146558Z","submitted_at":"2026-04-08T08:12:45Z","title":"Beyond Accuracy: Diagnosing Algebraic Reasoning Failures in LLMs Across Nine Complexity Dimensions","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T17:52:36.115298Z"},"links":{"citing_paper":"/paper/2604.06799"},"observation_digest":"sha256:bb2cad2f0e11b240825d9be905ab31b89752aa325b359ff005a23bf88f22eeb4","observation_id":"6e9dd9d6-2e5e-4c39-b499-0ed2728b17e6","resolution":{"observed_at":"2026-05-17T08:31:39.780034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Instead, it amplifies D3 via the O(n) vs O(n2) distinction","venue":null,"work_id":"5541e003-76a3-4c77-9ed5-eedb19f0f436","year":2024},"citing_paper":{"arxiv_id":"2604.06799","last_updated":"2026-04-08T08:12:45Z","snapshot_observed_at":"2026-08-11T07:26:29.146558Z","submitted_at":"2026-04-08T08:12:45Z","title":"Beyond Accuracy: Diagnosing Algebraic Reasoning Failures in LLMs Across Nine Complexity Dimensions","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T17:52:36.115298Z"},"links":{"citing_paper":"/paper/2604.06799"},"observation_digest":"sha256:a2d17447b5fdcaeee13a130a0aad4c03342cbe8acc1eb260c35ce591ab61d9ae","observation_id":"b7f26133-478c-45e0-b28e-cc37165e6742","resolution":{"observed_at":"2026-05-17T08:31:39.783989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.06799","last_updated":"2026-04-08T08:12:45Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-11T07:26:29.146558Z","submitted_at":"2026-04-08T08:12:45Z","title":"Beyond Accuracy: Diagnosing Algebraic Reasoning Failures in LLMs Across Nine Complexity Dimensions"},"reference_resolution":{"displayed":19,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":10,"verified_fuzzy":8},"total_outbound_references":19},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 19 of 19 outbound references and 0 inbound Pith citation observations for arXiv:2604.06799."}