{"as_of":"2026-08-13T22:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:027b6bd00904f2e81273f2b78adfc5bec30b5513151cbcfce93164b5a100018a","coverage":[{"denominator":71,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:46:40.614748Z","state":"measured"},{"denominator":82,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":82,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:34:15.603859Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T14:33:30.598717Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23683","snapshot_observed_at":"2026-08-06T21:34:15.603859Z","title":"Learn- ing compositional functions with transformers from easy-to-hard data.arXiv preprint arXiv:2505.23683,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23908","last_updated":"2025-06-30T14:37:50Z","snapshot_observed_at":"2026-08-10T22:47:17.106060Z","submitted_at":"2025-06-30T14:37:50Z","title":"Beyond Statistical Learning: Exact Learning Is Essential for General Intelligence","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:15.603859Z"},"links":{"cited_paper":"/paper/2505.23683","citing_paper":"/paper/2506.23908"},"observation_digest":"sha256:ae5f2343c67b839a97649974404800fbcc8444ac5f581d472d8bd2865e7f0260","observation_id":"1e43c969-1d4f-439d-8343-a97345183408","resolution":{"observed_at":"2026-08-06T21:34:15.603859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"cited_work":{"arxiv_id":"2505.23683","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23683","snapshot_observed_at":"2026-06-29T14:33:30.598717Z","title":"Lee, and Denny Wu","venue":null,"work_id":"45352772-aa21-408e-b9bd-690072865f73","year":2025},"citing_paper":{"arxiv_id":"2510.25741","last_updated":"2026-07-01T23:25:58Z","snapshot_observed_at":"2026-08-04T07:30:51.188041Z","submitted_at":"2025-10-29T17:45:42Z","title":"Scaling Latent Reasoning via Looped Language Models","version":4},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-15T07:43:11.620446Z"},"links":{"cited_paper":"/paper/2505.23683","citing_paper":"/paper/2510.25741"},"observation_digest":"sha256:0f46f25f95ba9030d40b35da30e8bb12d3ba8bd482f306f4ef703ebb69b8df2e","observation_id":"67828437-2bbd-46e5-b46c-cd501bce0c1b","resolution":{"observed_at":"2026-05-15T07:43:11.763654Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23683","snapshot_observed_at":"2026-08-04T07:31:49.270195Z","title":"Learning compositional functions with transformers from easy-to-hard data.arXiv preprint arXiv:2505.23683, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.25741","last_updated":"2026-07-01T23:25:58Z","snapshot_observed_at":"2026-08-04T07:30:51.188041Z","submitted_at":"2025-10-29T17:45:42Z","title":"Scaling Latent Reasoning via Looped Language Models","version":5},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-04T07:31:49.270195Z"},"links":{"cited_paper":"/paper/2505.23683","citing_paper":"/paper/2510.25741"},"observation_digest":"sha256:4980ab655538db8f7fd7e8dd100173f41474be7f33916e335ce2b2fd01217cd8","observation_id":"feed43f0-78ec-4421-a44f-ce39f10e4457","resolution":{"observed_at":"2026-08-04T07:31:49.270195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"cited_work":{"arxiv_id":"2505.23683","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23683","snapshot_observed_at":"2026-06-29T14:33:30.598717Z","title":"Lee, and Denny Wu","venue":null,"work_id":"45352772-aa21-408e-b9bd-690072865f73","year":2025},"citing_paper":{"arxiv_id":"2510.26745","last_updated":"2026-05-18T17:56:38Z","snapshot_observed_at":"2026-08-12T19:37:17.044745Z","submitted_at":"2025-10-30T17:40:22Z","title":"Deep sequence models tend to memorize geometrically; it is unclear why","version":3},"reference_index":186,"source":"pdf_text","source_observed_at":"2026-05-21T20:38:18.005002Z"},"links":{"cited_paper":"/paper/2505.23683","citing_paper":"/paper/2510.26745"},"observation_digest":"sha256:2c522f993b46cf9db7b720856e5d56d86d848ce45e5d54a33fb18ca0dc116383","observation_id":"7ff28ce0-6fcb-4a8c-accc-578779f06471","resolution":{"observed_at":"2026-05-21T20:40:36.310219Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23683","snapshot_observed_at":"2026-08-03T20:57:12.841539Z","title":"Lee, and Denny Wu","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.17852","last_updated":"2026-08-06T09:30:47Z","snapshot_observed_at":"2026-08-09T23:09:22.568411Z","submitted_at":"2025-11-22T00:38:43Z","title":"Transformers with RL or SFT Provably Learn Sparse Boolean Functions, But Differently","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-03T20:57:12.841539Z"},"links":{"cited_paper":"/paper/2505.23683","citing_paper":"/paper/2511.17852"},"observation_digest":"sha256:3d3366439cd050c01ba63e9d77151b087e89c07821bb4870822f95efb8cb4f10","observation_id":"0b1e143f-b234-4151-8cd5-0c79778c1c00","resolution":{"observed_at":"2026-08-03T20:57:12.841539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23683","snapshot_observed_at":"2026-08-03T05:27:44.481599Z","title":"Learning compositional functions with transformers from easy-to-hard data.arXiv preprint arXiv:2505.23683,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02470","last_updated":"2026-05-31T23:31:59Z","snapshot_observed_at":"2026-08-11T18:49:22.228732Z","submitted_at":"2026-02-02T18:50:57Z","title":"Breaking the Reversal Curse in Autoregressive Language Models via Identity Bridge","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T05:27:44.481599Z"},"links":{"cited_paper":"/paper/2505.23683","citing_paper":"/paper/2602.02470"},"observation_digest":"sha256:2310f31cb797f1a55dd28d4b50c485f789b1996030e393050af668939b921d08","observation_id":"3340179c-4d68-4d1f-8b84-d172d3085ec2","resolution":{"observed_at":"2026-08-03T05:27:44.481599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"cited_work":{"arxiv_id":"2505.23683","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23683","snapshot_observed_at":"2026-06-29T14:33:30.598717Z","title":"Lee, and Denny Wu","venue":null,"work_id":"45352772-aa21-408e-b9bd-690072865f73","year":2025},"citing_paper":{"arxiv_id":"2603.26554","last_updated":"2026-04-28T07:36:37Z","snapshot_observed_at":"2026-08-12T21:25:25.540841Z","submitted_at":"2026-03-27T16:13:18Z","title":"Sharp Capacity Scaling of Spectral Optimizers in Learning Associative Memory","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-14T23:37:33.106390Z"},"links":{"cited_paper":"/paper/2505.23683","citing_paper":"/paper/2603.26554"},"observation_digest":"sha256:d09f33f4480a80d84346be5f8f59d816293dbd5ff5d0349e29121a95592883e3","observation_id":"c1fafadd-a6b4-4052-9480-75040c60f282","resolution":{"observed_at":"2026-05-14T23:38:16.390943Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"cited_work":{"arxiv_id":"2505.23683","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23683","snapshot_observed_at":"2026-06-29T14:33:30.598717Z","title":"Lee, and Denny Wu","venue":null,"work_id":"45352772-aa21-408e-b9bd-690072865f73","year":2025},"citing_paper":{"arxiv_id":"2604.22951","last_updated":"2026-07-08T19:29:03Z","snapshot_observed_at":"2026-08-11T11:16:51.301799Z","submitted_at":"2026-04-24T18:49:08Z","title":"The Power of Power Law: Asymmetry Enables Compositional Reasoning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-08T11:49:49.787123Z"},"links":{"cited_paper":"/paper/2505.23683","citing_paper":"/paper/2604.22951"},"observation_digest":"sha256:47a7b1e29829807b890b19653ab2283328e6f53fe53fe8a879972100942da86a","observation_id":"2e0e0277-07c5-4180-b57c-d9ec1f0787ec","resolution":{"observed_at":"2026-05-11T19:31:08.436718Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23683","snapshot_observed_at":"2026-07-12T18:26:05.728364Z","title":"D., and Wu, D","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.22951","last_updated":"2026-07-08T19:29:03Z","snapshot_observed_at":"2026-08-11T11:16:51.301799Z","submitted_at":"2026-04-24T18:49:08Z","title":"The Power of Power Law: Asymmetry Enables Compositional Reasoning","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-07-12T18:26:05.728364Z"},"links":{"cited_paper":"/paper/2505.23683","citing_paper":"/paper/2604.22951"},"observation_digest":"sha256:5e07507a9d2012b1662671e2669b5853259769ad527762ca08d80c6c0a66ba72","observation_id":"26962014-0ff3-463c-a610-90aef65b491b","resolution":{"observed_at":"2026-07-12T18:26:05.728364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"cited_work":{"arxiv_id":"2505.23683","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23683","snapshot_observed_at":"2026-06-29T14:33:30.598717Z","title":"Lee, and Denny Wu","venue":null,"work_id":"45352772-aa21-408e-b9bd-690072865f73","year":2025},"citing_paper":{"arxiv_id":"2605.06609","last_updated":"2026-05-07T17:27:55Z","snapshot_observed_at":"2026-08-11T17:19:29.725852Z","submitted_at":"2026-05-07T17:27:55Z","title":"Transformers Efficiently Perform In-Context Logistic Regression via Normalized Gradient Descent","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-08T12:22:27.265973Z"},"links":{"cited_paper":"/paper/2505.23683","citing_paper":"/paper/2605.06609"},"observation_digest":"sha256:0a7cec78a28b25939a9b2451212c7a68d2e1c580d9ee99fa42ffdb5b39ed895e","observation_id":"7a4a587c-aaa8-4cc0-8415-c2fd22c76ffe","resolution":{"observed_at":"2026-05-11T19:16:09.597626Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"cited_work":{"arxiv_id":"2505.23683","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23683","snapshot_observed_at":"2026-06-29T14:33:30.598717Z","title":"Lee, and Denny Wu","venue":null,"work_id":"45352772-aa21-408e-b9bd-690072865f73","year":2025},"citing_paper":{"arxiv_id":"2605.28600","last_updated":"2026-05-27T15:17:06Z","snapshot_observed_at":"2026-08-05T23:04:48.328422Z","submitted_at":"2026-05-27T15:17:06Z","title":"Transformers Provably Learn to Internalize Chain-of-Thought","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-06-29T14:29:10.010212Z"},"links":{"cited_paper":"/paper/2505.23683","citing_paper":"/paper/2605.28600"},"observation_digest":"sha256:326364ebd899f0fbb09bba07dce400eefe4538a33ef3f19c969b63bc3a6d80c9","observation_id":"3836b10a-2e80-4a5b-9cc5-52054adc3b64","resolution":{"observed_at":"2026-06-29T14:33:30.600195Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.23683/citation-record","integrity":"/paper/2505.23683/integrity","json":"/paper/2505.23683/citation-record.json","paper":"/paper/2505.23683"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:32.494326Z","title":"The staircase property: How hierarchical structure can guide deep learning.Advances in Neural Information Processing Systems, 34:26989–27002, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:32.494326Z"},"links":{"citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:e302b1de3082391b3123ce0402d62575e57caa77895ba5b1e0d838571620a051","observation_id":"c791e2bc-b13d-47aa-97a8-afcc6650bf6b","resolution":{"observed_at":"2026-08-07T12:46:32.494326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:48.382543Z","title":"The merged-staircase property: a necessary and nearly sufficient condition for sgd learning of sparse functions on two-layer neural networks","venue":null,"work_id":"9c9cded5-71bf-4a73-80b1-6b32e534b4f9","year":2022},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:32.596789Z"},"links":{"citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:12754cf03036c8acbaaa4d9c27f9d88fb7dc4f918584b89558e4ac1bc30ac5a7","observation_id":"ddd8ead5-d8c7-406c-80cd-4067f3f7b8da","resolution":{"observed_at":"2026-08-07T12:46:48.442515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:32.708882Z","title":"Provable advantage of curriculum learning on parity targets with mixed inputs.Advances in Neural Information Processing Systems, 36:24291–24321, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:32.708882Z"},"links":{"citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:d2766ba4ecb4d4939b9d177e17a3d89afd90933cbac7d277c9b40d96c416d9dd","observation_id":"a03d8f2f-fec3-480a-9a4c-524dcb10114c","resolution":{"observed_at":"2026-08-07T12:46:32.708882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:48.231301Z","title":"How far can transformers reason? The locality barrier and inductive scratchpad","venue":null,"work_id":"2e181ed6-40c6-43b6-9820-c123eb996ba6","year":2024},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:32.865237Z"},"links":{"citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:6e26954c2c2fcdb1d6ccd50c561ddfe41eff18bb53880bd39581001d3ceea9f6","observation_id":"831013f1-6797-4024-ab3a-b34907bde771","resolution":{"observed_at":"2026-08-07T12:46:48.275011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:48.116791Z","title":"Transformers learn to implement preconditioned gradient descent for in-context learning","venue":null,"work_id":"0ca66b11-b83d-468f-a591-99f0b334dbe1","year":2024},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:32.939839Z"},"links":{"citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:b9287a33ad1e5d627c11a8466295b6eca7dd89922eedfc18b61400fd16df142e","observation_id":"773f1920-9aa9-4517-95ed-c7f90f9bde19","resolution":{"observed_at":"2026-08-07T12:46:48.160610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:47.962312Z","title":"Graph streaming lower bounds for parameter estimation and property testing via a streaming xor lemma","venue":null,"work_id":"a962437c-d0a8-499b-a03b-85b142323898","year":2021},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:33.040341Z"},"links":{"citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:98ef5ca6cd35ce95972ca10f3609a542ba6fbbf6f859d8b675a74f15b21cf067","observation_id":"c86c7eff-538c-4a24-8d82-21a2ad229fac","resolution":{"observed_at":"2026-08-07T12:46:48.033495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:47.833698Z","title":"The pitfalls of next-token prediction","venue":null,"work_id":"03916866-aa49-4631-822c-b1e1f3abfe28","year":2024},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:33.173794Z"},"links":{"citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:9743f43895bd3b7d75e609cec2327eb146647d9912e8c5d95c26c596337110b9","observation_id":"4ab05c7b-4394-466c-b552-cbf39e6178de","resolution":{"observed_at":"2026-08-07T12:46:47.870785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:33.334050Z","title":"Curriculum learning","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:33.334050Z"},"links":{"citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:2f104dc1243020dd87379e0d6e2f96c43ffd98378d86c76bd2d2b06235b2a9f0","observation_id":"b6ed973d-856d-422d-89bd-59af7f89cea5","resolution":{"observed_at":"2026-08-07T12:46:33.334050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09347","last_updated":"2024-06-13T17:31:30Z","snapshot_observed_at":"2026-08-12T23:43:21.256413Z","submitted_at":"2024-06-13T17:31:30Z","title":"Separations in the Representational Capabilities of Transformers and Recurrent Architectures","version":1},"cited_work":{"arxiv_id":"2406.09347","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.09347","snapshot_observed_at":"2026-08-07T12:46:42.732602Z","title":"Separations in the Representational Capabilities of Transformers and Recurrent Architectures","venue":"cs.LG","work_id":"babf7f3e-a0be-400a-8031-f13aefc7af27","year":2024},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:33.485218Z"},"links":{"cited_paper":"/paper/2406.09347","citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:5a91d782e04db9dc86446d91acfc9035bb5f995863ca2320efd51442d2578de2","observation_id":"36d3242c-1566-4cde-b737-5d22627eb4f5","resolution":{"observed_at":"2026-08-07T12:46:42.789421Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:47.697791Z","title":"Birth of a transformer: A memory viewpoint","venue":null,"work_id":"3cd3cabc-1f77-48b7-9d39-83ed32434be8","year":2023},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:33.649966Z"},"links":{"citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:397c82f3c5a47585ff0b0457e4a9aa3058e911de99b4691947f19ee4d7e74dc4","observation_id":"ccb8cf36-5b8b-4f33-a4be-6228c304285c","resolution":{"observed_at":"2026-08-07T12:46:47.760483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:47.562298Z","title":"Data distributional properties drive emergent in-context learning in transformers","venue":null,"work_id":"5d24d5c8-aab9-43db-b7d9-f857b99e4a64","year":2022},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:33.769852Z"},"links":{"citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:3d2bf7bc75d38faa257a0778a73190e8c68304be2c5bb2ebfb0dc8a41f8a3710","observation_id":"c834b064-facb-4bf2-9fb7-c7c5926c5ae1","resolution":{"observed_at":"2026-08-07T12:46:47.608752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02975","last_updated":"2024-12-04T02:37:31Z","snapshot_observed_at":"2026-08-12T01:18:31.774514Z","submitted_at":"2024-12-04T02:37:31Z","title":"Theoretical limitations of multi-layer Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02975","snapshot_observed_at":"2026-08-07T12:46:33.978754Z","title":"Theoretical limitations of multi-layer transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:33.978754Z"},"links":{"cited_paper":"/paper/2412.02975","citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:204e6b826ea53e67fb2ea10b95b54b720a40e7d40f9624c3c7d0485ea2a7fe7c","observation_id":"23b29014-a63e-4589-8fc7-e3563d33c822","resolution":{"observed_at":"2026-08-07T12:46:33.978754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19442","last_updated":"2024-06-10T17:18:07Z","snapshot_observed_at":"2026-08-13T04:06:49.870982Z","submitted_at":"2024-02-29T18:43:52Z","title":"Training Dynamics of Multi-Head Softmax Attention for In-Context Learning: Emergence, Convergence, and Optimality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19442","snapshot_observed_at":"2026-08-07T12:46:34.110434Z","title":"Training dynamics of multi- head softmax attention for in-context learning: Emergence, convergence, and optimality.arXiv preprint arXiv:2402.19442, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:34.110434Z"},"links":{"cited_paper":"/paper/2402.19442","citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:26331ba4018d0d3df3b478b197990f0cae8c7a6969efffdd1994e15fedaf107a","observation_id":"a597f3a7-8913-43cb-bfa4-167279020fab","resolution":{"observed_at":"2026-08-07T12:46:34.110434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10559","last_updated":"2024-09-09T18:10:26Z","snapshot_observed_at":"2026-08-13T00:46:28.411325Z","submitted_at":"2024-09-09T18:10:26Z","title":"Unveiling Induction Heads: Provable Training Dynamics and Feature Learning in Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10559","snapshot_observed_at":"2026-08-07T12:46:34.250512Z","title":"Unveiling induction heads: Provable training dynamics and feature learning in transformers.arXiv preprint arXiv:2409.10559, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:34.250512Z"},"links":{"cited_paper":"/paper/2409.10559","citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:2b6568d9cf93fb71a610eb51a19d04ddfc418de380b3d51427fc28cb227b11fa","observation_id":"b134bc0c-7e37-4fb7-824d-df2c5462488e","resolution":{"observed_at":"2026-08-07T12:46:34.250512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08414","last_updated":"2024-10-10T23:09:08Z","snapshot_observed_at":"2026-08-12T22:25:52.444759Z","submitted_at":"2024-10-10T23:09:08Z","title":"Understanding the Interplay between Parametric and Contextual Knowledge for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08414","snapshot_observed_at":"2026-08-07T12:46:34.394535Z","title":"Understand- ing the interplay between parametric and contextual knowledge for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:34.394535Z"},"links":{"cited_paper":"/paper/2410.08414","citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:522c942e40202da936577e0e850f2f544c685033dbf71c877a7ba18a84e5748b","observation_id":"3ed040cd-8986-4385-b60e-f88d2bf4c500","resolution":{"observed_at":"2026-08-07T12:46:34.394535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:34.489754Z","title":"Neural networks can learn represen- tations with gradient descent","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:34.489754Z"},"links":{"citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:a9fb64f7624d3994bf4d973e67d73be3920824b2e1dc85fbcead6576b37eb5f2","observation_id":"8bde2b42-80a5-4895-a919-a11e66fefed9","resolution":{"observed_at":"2026-08-07T12:46:34.489754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14838","last_updated":"2024-05-23T17:54:14Z","snapshot_observed_at":"2026-07-06T18:18:51.814306Z","submitted_at":"2024-05-23T17:54:14Z","title":"From Explicit CoT to Implicit CoT: Learning to Internalize CoT Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14838","snapshot_observed_at":"2026-08-07T12:46:34.662611Z","title":"From explicit cot to implicit cot: Learning to internalize cot step by step.arXiv preprint arXiv:2405.14838, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:34.662611Z"},"links":{"cited_paper":"/paper/2405.14838","citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:0fb737d4e2093e6ac19a598e24c722d259c30ebdfe76a91b22e7664ab7651f0b","observation_id":"b5054e96-626f-42fc-be1a-26f48263814f","resolution":{"observed_at":"2026-08-07T12:46:34.662611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T12:46:34.805557Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:34.805557Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:b11c5e6d948da7d177044c3bca9c6359cd6f44f4082515eef185d16af5f808db","observation_id":"9bfa3d55-b086-4846-a561-d6cee1fbf8ce","resolution":{"observed_at":"2026-08-07T12:46:34.805557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18654","last_updated":"2023-10-31T16:35:07Z","snapshot_observed_at":"2026-08-13T11:29:54.889059Z","submitted_at":"2023-05-29T23:24:14Z","title":"Faith and Fate: Limits of Transformers on Compositionality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18654","snapshot_observed_at":"2026-08-07T12:46:34.917688Z","title":"Hwang, Soumya Sanyal, Sean Welleck, Xiang Ren, Allyson Ettinger, Zaid Harchaoui, and Yejin Choi","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:34.917688Z"},"links":{"cited_paper":"/paper/2305.18654","citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:04e57592a22946ae5867e85dfb5e28179ca8e14986d512cc6d53a283406ca2d7","observation_id":"c841ccb3-8b76-48cc-a404-53bbb7898b27","resolution":{"observed_at":"2026-08-07T12:46:34.917688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:35.061289Z","title":"Learning and development in neural networks: The importance of starting small.Cognition, 48(1):71–99, 1993","venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:35.061289Z"},"links":{"citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:628be2d7659f2b4f7d9a973dcbf879b5743ddf50cdb0771f3c5b293cbc203f15","observation_id":"e4bc1d60-d879-4948-895a-d503ea825cc7","resolution":{"observed_at":"2026-08-07T12:46:35.061289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:47.304248Z","title":"Towards revealing the mystery behind chain of thought: a theoretical perspective.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"09451864-ed34-4c5c-95ab-0ae5bf7a354b","year":2024},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:35.155644Z"},"links":{"citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:9ee2758c7324d2d4a33ef24735ebdcd400d86b7d19720d6d61ff8eec6e8c035b","observation_id":"b543bd7a-7bda-4750-b189-27547524ec73","resolution":{"observed_at":"2026-08-07T12:46:47.382613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23610","last_updated":"2024-10-31T03:51:39Z","snapshot_observed_at":"2026-08-12T22:11:11.576656Z","submitted_at":"2024-10-31T03:51:39Z","title":"Global Convergence in Training Large-Scale Transformers","version":1},"cited_work":{"arxiv_id":"2410.23610","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.23610","snapshot_observed_at":"2026-08-07T12:46:42.215835Z","title":"Global Convergence in Training Large-Scale Transformers","venue":"stat.ML","work_id":"6bb78b2d-93c5-4565-9c15-09a6e6ebed95","year":2024},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:35.278042Z"},"links":{"cited_paper":"/paper/2410.23610","citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:93f2fc0e17060009c8343232091c4b72d1a3d78f299419a2ba39806bbc8e66a8","observation_id":"2ef8ca9c-4295-4c58-b682-80c33d7bab6e","resolution":{"observed_at":"2026-08-07T12:46:42.265485Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19737","last_updated":"2024-04-30T17:33:57Z","snapshot_observed_at":"2026-08-12T13:06:04.804423Z","submitted_at":"2024-04-30T17:33:57Z","title":"Better & Faster Large Language Models via Multi-token Prediction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19737","snapshot_observed_at":"2026-08-07T12:46:35.454047Z","title":"Better & faster large language models via multi-token prediction.arXiv preprint arXiv:2404.19737, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:35.454047Z"},"links":{"cited_paper":"/paper/2404.19737","citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:9e99a5438da04c6740023d652059085869da687d82f14da21fececaccf9c28fd","observation_id":"d40ad934-5101-49d1-ae2f-38f0ad56451f","resolution":{"observed_at":"2026-08-07T12:46:35.454047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:47.147483Z","title":"Interleaved group products.SIAM Journal on Computing, 48(2):554–580, 2019","venue":null,"work_id":"884c357e-d237-4e59-8202-974842953464","year":2019},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:35.554837Z"},"links":{"citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:104637e7e714357ed3bcc8267c26659e977d99eed51518652f6e112a9a008042","observation_id":"732e7025-32e6-4375-a0f9-6c2d23667c6c","resolution":{"observed_at":"2026-08-07T12:46:47.203328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21212","last_updated":"2025-02-28T16:40:38Z","snapshot_observed_at":"2026-08-11T08:11:30.798496Z","submitted_at":"2025-02-28T16:40:38Z","title":"Transformers Learn to Implement Multi-step Gradient Descent with Chain of Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.21212","snapshot_observed_at":"2026-08-07T12:46:35.648813Z","title":"Transformers learn to implement multi-step gradient descent with chain of thought.arXiv preprint arXiv:2502.21212, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:35.648813Z"},"links":{"cited_paper":"/paper/2502.21212","citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:955f9f322dd3aacb1d0e10a5ab7f067aa701e43544332b6689e88af11b0d94dd","observation_id":"9fb45c7f-1a84-423b-a32d-f6bf87f6f129","resolution":{"observed_at":"2026-08-07T12:46:35.648813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05249","last_updated":"2023-10-08T17:55:33Z","snapshot_observed_at":"2026-08-13T05:54:25.212862Z","submitted_at":"2023-10-08T17:55:33Z","title":"In-Context Convergence of Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05249","snapshot_observed_at":"2026-08-07T12:46:35.756325Z","title":"In-context convergence of transformers.arXiv preprint arXiv:2310.05249, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:35.756325Z"},"links":{"cited_paper":"/paper/2310.05249","citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:e3252cbbf6afac42809868c4b33996d91dc4d330dd4bfe5e12caff7eb01c2fe5","observation_id":"7a1ba3e9-0933-4e24-b9c2-4b1e1948cc63","resolution":{"observed_at":"2026-08-07T12:46:35.756325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:46.987861Z","title":"Mas- sively parallel computation: Algorithms and applications.Foundations and Trends® in Optimization, 5(4):340–417, 2023","venue":null,"work_id":"b573fab7-9a09-4e97-8458-fc8801bf5ef6","year":2023},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:35.878834Z"},"links":{"citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:7fb79a0c5ee221371fbab8b43f01b1ef41754d59d71d218438e35fd1d6eedf58","observation_id":"dcb56841-e383-407a-af90-d80388e83cbe","resolution":{"observed_at":"2026-08-07T12:46:47.058801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:46.857656Z","title":"Vision transformers provably learn spatial structure","venue":null,"work_id":"fae076ae-4acd-4466-85f8-c44c101b7ba8","year":2022},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:36.025687Z"},"links":{"citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:5bdc66d99b6c657faea703d0e970ed12af32bf8b358701ac070e4dcfcaf31c12","observation_id":"ccca6d86-49a0-4459-8eea-37c03d64ca10","resolution":{"observed_at":"2026-08-07T12:46:46.916436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-13T04:28:50.810145Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-08-07T12:46:36.145807Z","title":"Repeat after me: Transformers are better than state space models at copying.arXiv preprint arXiv:2402.01032, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:36.145807Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:74df7f19c11fab0e2d9a57eb6bad039f32e8428acd5be8bd93e6818a4262af56","observation_id":"7d3ab2f4-6822-4c76-afe7-47e5270748c0","resolution":{"observed_at":"2026-08-07T12:46:36.145807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:46.721846Z","title":"Efficient noise-tolerant learning from statistical queries.J","venue":null,"work_id":"22189f1d-1cdf-4ef2-ac48-ce65c92cab7f","year":1998},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:36.275561Z"},"links":{"citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:1a65db3a3e3e2b3deb67ea8a7c5c35c21c71643a7fb862ab7d6c18ef918a579b","observation_id":"99bacc77-02fd-418d-9507-034ef2093aaf","resolution":{"observed_at":"2026-08-07T12:46:46.776875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08633","last_updated":"2025-03-11T14:26:41Z","snapshot_observed_at":"2026-08-12T22:25:38.835973Z","submitted_at":"2024-10-11T08:55:17Z","title":"Transformers Provably Solve Parity Efficiently with Chain of Thought","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08633","snapshot_observed_at":"2026-08-07T12:46:36.416475Z","title":"Transformers provably solve parity efficiently with chain of thought.arXiv preprint arXiv:2410.08633, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:36.416475Z"},"links":{"cited_paper":"/paper/2410.08633","citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:0aaff65347051005e9f89e9c104d7c4d4aa207e926a85298ad8d08e3b09cd0ba","observation_id":"2322fda7-1f28-4a84-bb51-4dec2ba0ffc8","resolution":{"observed_at":"2026-08-07T12:46:36.416475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T12:46:36.536688Z","title":"Adam: A method for stochastic optimization.arXiv preprint arXiv:1412.6980, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:36.536688Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:739d5c274cf473c8ce07a55415d502c6002a3c9cc847f912828d94ca7598c81b","observation_id":"dd18b5f5-62d5-4173-bc4b-3b016e719ba7","resolution":{"observed_at":"2026-08-07T12:46:36.536688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:46.589489Z","title":"Learning to reason and memorize with self-notes","venue":null,"work_id":"717587c6-e97a-477b-8dac-24980c1d1ed1","year":2024},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:36.648732Z"},"links":{"citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:00197035b52792c0520f03448ff5547bfe50e8ebc0574e670f759b250340a69e","observation_id":"be79f8cf-1577-4a53-8f21-a77e162349bc","resolution":{"observed_at":"2026-08-07T12:46:46.652195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:46.462294Z","title":"Solving quantitative reasoning problems with language models","venue":null,"work_id":"af7003d8-c0b1-4df8-98c8-7d1b9f3e4047","year":2022},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:36.789484Z"},"links":{"citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:449e3f1f114f9e5708305c60cc65ab91b53278117e3fead56abe35a020a29936","observation_id":"070b5a5f-cc81-49cf-bbce-bb5df2caf729","resolution":{"observed_at":"2026-08-07T12:46:46.509475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:46.299123Z","title":"How do transformers learn topic structure: Towards a mechanistic understanding","venue":null,"work_id":"aa8e5693-83f0-4f00-98b2-0fa5a2e7a735","year":2023},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:36.913612Z"},"links":{"citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:a822d5dab7320978e5a92f96e6a3e068fe875f313e4ceb41e265f7447abe9a39","observation_id":"a1257c2b-f6eb-4450-91f6-91492b32782b","resolution":{"observed_at":"2026-08-07T12:46:46.366060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12875","last_updated":"2024-09-21T06:48:45Z","snapshot_observed_at":"2026-08-13T04:14:39.684680Z","submitted_at":"2024-02-20T10:11:03Z","title":"Chain of Thought Empowers Transformers to Solve Inherently Serial Problems","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12875","snapshot_observed_at":"2026-08-07T12:46:37.044242Z","title":"Chain of thought empowers transformers to solve inherently serial problems.arXiv preprint arXiv:2402.12875, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:37.044242Z"},"links":{"cited_paper":"/paper/2402.12875","citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:90eb1cb965e728d3e49e9616d690896838344c9a3bedcf2d98c3c78488b80406","observation_id":"a5719318-da93-4fef-a358-989d748c5d6b","resolution":{"observed_at":"2026-08-07T12:46:37.044242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-11T17:22:43.545531Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-07T12:46:37.158871Z","title":"Let’s verify step by step.arXiv preprint arXiv:2305.20050, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:37.158871Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:be0662b60d221e6d6d668b5ad1914a237fc734b8dbde59d1fbc8eb3b88c1e3a3","observation_id":"4d5d60aa-d7d8-4822-99a7-c91d5121ced5","resolution":{"observed_at":"2026-08-07T12:46:37.158871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-11T01:48:59.557045Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T12:46:37.256187Z","title":"Deepseek-v3 technical report.arXiv preprint arXiv:2412.19437, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:37.256187Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:1a8be654afcca6ce38be7b35e6a38baa23c8c47cb88ade3005a244f4682b3fd6","observation_id":"e23e46eb-224b-41a4-8744-80dcfddca948","resolution":{"observed_at":"2026-08-07T12:46:37.256187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:46.104561Z","title":"Ash, Surbhi Goel, Akshay Krishnamurthy, and Cyril Zhang","venue":null,"work_id":"bc90a45a-d368-4ba0-abb3-f35756d6750e","year":2023},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:37.413474Z"},"links":{"citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:463e73fc7cf1e4861b79cdb7dee71932099200ecf21367e118a66dea7a69b48f","observation_id":"d5258745-2be9-4dfb-b9d2-4182af1f2f97","resolution":{"observed_at":"2026-08-07T12:46:46.210499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01492","last_updated":"2025-01-23T17:35:43Z","snapshot_observed_at":"2026-08-12T23:31:04.473877Z","submitted_at":"2024-07-01T17:31:03Z","title":"RegMix: Data Mixture as Regression for Language Model Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01492","snapshot_observed_at":"2026-08-07T12:46:37.549144Z","title":"Regmix: Data mixture as regression for language model pre-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:37.549144Z"},"links":{"cited_paper":"/paper/2407.01492","citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:44ce0de8a699dd2564a5141550deaf5c24da0b452010b312024ca63537549a4b","observation_id":"dedc056e-1367-4bac-a297-f4259dc3a96f","resolution":{"observed_at":"2026-08-07T12:46:37.549144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07923","last_updated":"2024-04-11T18:03:53Z","snapshot_observed_at":"2026-08-13T05:51:44.514933Z","submitted_at":"2023-10-11T22:35:18Z","title":"The Expressive Power of Transformers with Chain of Thought","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07923","snapshot_observed_at":"2026-08-07T12:46:37.657775Z","title":"The expresssive power of transformers with chain of thought.arXiv preprint arXiv:2310.07923, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:37.657775Z"},"links":{"cited_paper":"/paper/2310.07923","citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:bbbeb7f3660f01e884d397b2010a51628382869c4e6d284ebae1bbc853c3d21c","observation_id":"a805c674-e3e4-496c-b700-826fa40ccb80","resolution":{"observed_at":"2026-08-07T12:46:37.657775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:37.789402Z","title":"The parallelism tradeoff: Limitations of log-precision transformers.Transactions of the Association for Computational Linguistics, 11:531–545, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:37.789402Z"},"links":{"citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:5ff35afb4ee5fad04cd5357202bb3e5f601e8b8e7d73c124cb49692570a97706","observation_id":"ba40d699-5080-47eb-b246-71d1a32e7455","resolution":{"observed_at":"2026-08-07T12:46:37.789402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:45.892242Z","title":"How transformers learn causal structure with gradient descent","venue":null,"work_id":"2179cd22-c268-49e5-8ac3-40b0e45696c5","year":2024},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:37.884202Z"},"links":{"citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:46dfbd34cddd6330b26d79e088322be104ff2978971bc79e442d444d5737712f","observation_id":"5255c7ec-42a6-43ae-b389-7051503a870d","resolution":{"observed_at":"2026-08-07T12:46:45.972428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06538","last_updated":"2024-12-09T14:48:14Z","snapshot_observed_at":"2026-08-12T09:37:42.654252Z","submitted_at":"2024-12-09T14:48:14Z","title":"Understanding Factual Recall in Transformers via Associative Memories","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06538","snapshot_observed_at":"2026-08-07T12:46:38.010378Z","title":"Understanding factual recall in transformers via associative memories.arXiv preprint arXiv:2412.06538, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:38.010378Z"},"links":{"cited_paper":"/paper/2412.06538","citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:f1592a735382da8291d280ae12b73864de03f09b440fd35addd5dc0a76d40553","observation_id":"d36466a5-8576-412c-b84a-5474d5d7895d","resolution":{"observed_at":"2026-08-07T12:46:38.010378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1137/0222016","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Rounds in communication complexity revisited.SIAM Journal on Computing, 22(1):211–219, 1993","venue":"SIAM Journal on Computing","work_id":"167cc153-0611-40ff-838b-42fdd0043eed","year":1993},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:38.136778Z"},"links":{"citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:8f0289138a9fa4a26f3c49edf67792f4d6dde67ae6fa1943a427a36bc5cfeb99","observation_id":"367d7a22-b668-4a37-b725-678b2bc061ab","resolution":{"observed_at":"2026-08-07T12:46:40.801870Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00114","last_updated":"2021-11-30T21:32:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-11-30T21:32:46Z","title":"Show Your Work: Scratchpads for Intermediate Computation with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.00114","snapshot_observed_at":"2026-08-07T12:46:38.260594Z","title":"Show your work: scratchpads for intermediate computation with language models.arXiv preprint arXiv:2112.00114, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:38.260594Z"},"links":{"cited_paper":"/paper/2112.00114","citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:1bcac6d53912a86c6432741a9b068ccef7797c013aee026e5da941b0e382f3ff","observation_id":"45205473-97b1-49c4-b5fb-f8495ed7503f","resolution":{"observed_at":"2026-08-07T12:46:38.260594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:45.679101Z","title":"In-context learning and induction heads.Transformer Cir- cuits Thread, 2022","venue":null,"work_id":"b967a7e7-0e18-485d-a28b-621c76b1cd32","year":2022},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:38.397937Z"},"links":{"citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:991e9557b1a69e5aaba2d75857bd44bfa09fb3d1423a0a6c41c69bee9f423d80","observation_id":"53ea21a2-0bc5-4f93-9ba7-922355824d0e","resolution":{"observed_at":"2026-08-07T12:46:45.790112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05464","last_updated":"2024-10-07T19:49:24Z","snapshot_observed_at":"2026-08-12T22:28:47.258345Z","submitted_at":"2024-10-07T19:49:24Z","title":"Progressive distillation induces an implicit curriculum","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05464","snapshot_observed_at":"2026-08-07T12:46:38.497645Z","title":"Pro- gressive distillation induces an implicit curriculum.arXiv preprint arXiv:2410.05464, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:38.497645Z"},"links":{"cited_paper":"/paper/2410.05464","citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:1916e8040253c717d0fcca2917dd3c114da108033d91dffb8048a432ccc98aaf","observation_id":"ffc1f16e-3425-486b-bab0-270f6c72b8ff","resolution":{"observed_at":"2026-08-07T12:46:38.497645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:38.611842Z","title":"Papadimitriou and Michael Sipser","venue":null,"work_id":null,"year":1984},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:38.611842Z"},"links":{"citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:5b5e3ad51caaa08d6b68d1eb2c5c858c370c0d951fecbe5a6ab42e13bc4db534","observation_id":"de5a35ec-1470-4b72-9c7b-c858563207da","resolution":{"observed_at":"2026-08-07T12:46:38.611842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:45.509397Z","title":"On limitations of the trans- former architecture","venue":null,"work_id":"bc2dbefb-ea41-446b-a780-706cd75af67b","year":2024},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:38.755935Z"},"links":{"citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:85e9e3adcddc47ec9e576361b5b2012bcec15644aa5f6995a5337444c760f0e5","observation_id":"e56752ed-55ec-4177-885f-087b1798635a","resolution":{"observed_at":"2026-08-07T12:46:45.565431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:45.349560Z","title":"Learning and transferring sparse contextual bi- grams with linear transformers","venue":null,"work_id":"7db83c9c-031f-42b8-97e0-bb96244da6c5","year":2024},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:38.862958Z"},"links":{"citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:eb7cffc23810f6675390e3177ce70b5df6c17f887b5b0d1eaf4168cd5d0cab61","observation_id":"8f8dcf86-ec50-4dfd-8d3c-c5265be5cb83","resolution":{"observed_at":"2026-08-07T12:46:45.433429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:45.165341Z","title":"Representational strengths and limitations of transformers","venue":null,"work_id":"a5f89b58-3624-4e1b-87c2-6e6f30de885a","year":2023},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:38.989395Z"},"links":{"citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:a22adf0bc13bce0862806dad16e201419d8d9c04419f70a6710f4ee8670ad761","observation_id":"a0aaa9a3-4f95-4cec-b64e-24a101960671","resolution":{"observed_at":"2026-08-07T12:46:45.235854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18512","last_updated":"2024-05-28T18:31:14Z","snapshot_observed_at":"2026-08-12T23:55:48.932051Z","submitted_at":"2024-05-28T18:31:14Z","title":"Understanding Transformer Reasoning Capabilities via Graph Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18512","snapshot_observed_at":"2026-08-07T12:46:39.144554Z","title":"Understanding transformer reasoning capabilities via graph algorithms.arXiv preprint arXiv:2405.18512, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:39.144554Z"},"links":{"cited_paper":"/paper/2405.18512","citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:bd6498ec6df95e3dc0c8fc842c5d93f9d5789f0e16ee763c51359c564c911c11","observation_id":"f8097cbb-e197-4a3b-b5ea-cb4eb9dceede","resolution":{"observed_at":"2026-08-07T12:46:39.144554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:45.000543Z","title":"Transformers, parallel computation, and logarithmic depth","venue":null,"work_id":"27722c83-fd17-4559-bfa9-c7f0445892aa","year":2024},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:39.220249Z"},"links":{"citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:665462873cbf129e8f731845d30d17f4d1932e90449aa56606dc1bd85808d56f","observation_id":"e1f0a159-eac9-4ca1-8d46-d41662a12b6f","resolution":{"observed_at":"2026-08-07T12:46:45.078056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:44.828495Z","title":"End-to-end memory networks","venue":null,"work_id":"e2b0ee9a-4102-4fcf-ab23-bf2ccc38821c","year":2015},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:39.313177Z"},"links":{"citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:5009d7306ccafb94a9ec6951c53abfd78dee485f205c6bf970e1b1e2060effff","observation_id":"9792657b-2058-465f-9fe8-172cdcf3327b","resolution":{"observed_at":"2026-08-07T12:46:44.894174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:44.688776Z","title":"Characterizing statistical query learning: simplified notions and proofs","venue":null,"work_id":"e2062b82-a25a-474a-9763-6f7f0a586c33","year":2009},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:39.420028Z"},"links":{"citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:8511254d7171d996e129216b12c6224779286cb8275aa37533fc140018eebddc","observation_id":"19db7bda-130f-4046-83f8-0764f09a3f47","resolution":{"observed_at":"2026-08-07T12:46:44.758978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:44.529410Z","title":"Scan and snap: Understanding training dynamics and token composition in 1-layer transformer","venue":null,"work_id":"1b0656c9-bdfc-481f-895c-849fdda24850","year":2023},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:39.519276Z"},"links":{"citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:4ec491559d4d7aaaca08c8bf2f3d2ec522ef63ef4fa195ce3f71e5c2360f1470","observation_id":"36aa5752-892f-40e3-ba6c-081c9d010c5c","resolution":{"observed_at":"2026-08-07T12:46:44.593968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-08-07T12:46:39.598022Z","title":"Solving math word problems with process-and outcome-based feedback.arXiv preprint arXiv:2211.14275, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:39.598022Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:80448420ebf935bbce46189d2ea553fba136ae0d930a604fb49bf6ea3f1e9efb","observation_id":"22e35c1f-1df0-4579-a963-34b49678ef39","resolution":{"observed_at":"2026-08-07T12:46:39.598022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:44.336402Z","title":null,"venue":null,"work_id":"dc5ac843-097d-4394-8f93-2380c8d296e3","year":2024},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:39.698128Z"},"links":{"citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:5f60c88395f1b4ec627e0afb82ca2c6c006e93e079830943bba5d2f0d0b633dc","observation_id":"2259d854-e282-4a79-aa47-a6c1ad55e9a9","resolution":{"observed_at":"2026-08-07T12:46:44.399090Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:44.163129Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":"75b03315-6df6-488c-8e89-b3b5f15ef34b","year":2022},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:39.771667Z"},"links":{"citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:74c9a21a7fe5f61f0c6f7c6f46f26ddd6a41648c4ccde193681b94124ad5abec","observation_id":"0da4c9a8-52a1-46f5-aef6-94ee1512ebdf","resolution":{"observed_at":"2026-08-07T12:46:44.220213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05459","last_updated":"2025-03-05T13:57:56Z","snapshot_observed_at":"2026-08-12T22:28:46.973067Z","submitted_at":"2024-10-07T19:45:09Z","title":"From Sparse Dependence to Sparse Attention: Unveiling How Chain-of-Thought Enhances Transformer Sample Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05459","snapshot_observed_at":"2026-08-07T12:46:39.840714Z","title":"From sparse dependence to sparse attention: unveiling how chain-of-thought enhances transformer sample efficiency","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:39.840714Z"},"links":{"cited_paper":"/paper/2410.05459","citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:255f3ff9b714d067269fd65b640b373f01c065f8aaa1350f3239a37e1d098487","observation_id":"4c59a0ee-c65c-4fe3-8215-7a17f3099a43","resolution":{"observed_at":"2026-08-07T12:46:39.840714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1410.3916","last_updated":"2015-11-29T07:00:41Z","snapshot_observed_at":"2026-08-07T01:31:18.205506Z","submitted_at":"2014-10-15T03:13:18Z","title":"Memory Networks","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1410.3916","snapshot_observed_at":"2026-08-07T12:46:39.905563Z","title":"Memory networks.arXiv preprint arXiv:1410.3916, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:39.905563Z"},"links":{"cited_paper":"/paper/1410.3916","citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:ee5224c8fb801fb10e5e6d4d04b264e549ebfe026886bc54d2bb1066c5b0eb1f","observation_id":"b7d6e0cb-cbc7-4f78-99c0-39d9167d5ef4","resolution":{"observed_at":"2026-08-07T12:46:39.905563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1502.05698","last_updated":"2015-12-31T13:08:14Z","snapshot_observed_at":"2026-07-06T04:09:45.600447Z","submitted_at":"2015-02-19T20:46:10Z","title":"Towards AI-Complete Question Answering: A Set of Prerequisite Toy Tasks","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.05698","snapshot_observed_at":"2026-08-07T12:46:39.984911Z","title":"Towards ai-complete question answering: A set of prerequisite toy tasks.arXiv preprint arXiv:1502.05698, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:39.984911Z"},"links":{"cited_paper":"/paper/1502.05698","citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:8462c35aee37c5963010646a9282af5dd7e877f6b3fd7a841d513dc49030b5de","observation_id":"02cb2c74-8a26-46ff-a8aa-d8384dd7a2a4","resolution":{"observed_at":"2026-08-07T12:46:39.984911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:43.969223Z","title":"Doremi: Optimizing data mixtures speeds up language model pretraining","venue":null,"work_id":"d60ea539-5fdd-4338-8f50-4c7163afd262","year":2024},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:40.056872Z"},"links":{"citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:eb31135f793c3f486c492282fa426ef8bd726a3440ab9842c1a8f1910adfcfc4","observation_id":"d0bcd8b8-c830-42e1-9a0c-ce3c25732862","resolution":{"observed_at":"2026-08-07T12:46:44.044810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16837","last_updated":"2025-05-31T11:20:49Z","snapshot_observed_at":"2026-08-13T04:09:47.164921Z","submitted_at":"2024-02-26T18:57:54Z","title":"Do Large Language Models Latently Perform Multi-Hop Reasoning?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16837","snapshot_observed_at":"2026-08-07T12:46:40.093818Z","title":"Do large language models latently perform multi-hop reasoning?arXiv preprint arXiv:2402.16837, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:40.093818Z"},"links":{"cited_paper":"/paper/2402.16837","citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:6c2e4e56f84b6f5cf28943d8a3f53b505cdd154a13bd6abb027b53ed103b5b9c","observation_id":"2f6f0c7b-8d67-432a-b51b-fb187d7f4894","resolution":{"observed_at":"2026-08-07T12:46:40.093818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:43.767861Z","title":"Tree of thoughts: deliberate problem solving with large language models","venue":null,"work_id":"1ff03bdf-854d-418d-8ca4-e432231d3ee2","year":2024},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:40.210788Z"},"links":{"citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:73092714a1ea9fddb02e17f321c1a7458a4da9e9b80d8eb389d4eb9c18cbaa9c","observation_id":"6a3e5602-bead-4bd9-99ca-23dab1739c35","resolution":{"observed_at":"2026-08-07T12:46:43.858525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:43.566125Z","title":"Pointer chasing via triangular discrimination.Combinatorics, Probability and Computing, 29(4):485–494, 2020","venue":null,"work_id":"c423adfe-cc25-4255-8980-ca8d304c9991","year":2020},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:40.299772Z"},"links":{"citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:4002b15daf3fbdca0f771c5a2f9c604504cc1a1298b59954abfbadac7d7be47c","observation_id":"3c0f99ec-21a5-482c-b5d4-71d77c1f7c13","resolution":{"observed_at":"2026-08-07T12:46:43.665821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09927","last_updated":"2023-10-19T20:31:32Z","snapshot_observed_at":"2026-08-13T16:43:30.991301Z","submitted_at":"2023-06-16T15:50:03Z","title":"Trained Transformers Learn Linear Models In-Context","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09927","snapshot_observed_at":"2026-08-07T12:46:40.385953Z","title":"exact gradients","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:40.385953Z"},"links":{"cited_paper":"/paper/2306.09927","citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:8e0bcff42109d1b665fbbd450a4e4d9d17ee74a02c9709c404f676652bf6c248","observation_id":"b2fc7f14-4432-4a2a-a85f-c240aa9b09e9","resolution":{"observed_at":"2026-08-07T12:46:40.385953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:43.429643Z","title":null,"venue":null,"work_id":"3ccbd87f-d05b-4f61-81a3-854bc210130e","year":null},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:40.475130Z"},"links":{"citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:028aeca14eaca4734a4910ceccae8f3de178d9a387908a642bb987864b3d31a2","observation_id":"48c3ed10-53dd-4f8b-98cf-3c616de2aa69","resolution":{"observed_at":"2026-08-07T12:46:43.471531Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:43.303862Z","title":"Since the softmax in layer ℓ is nearly saturated and thus close to one-hot, the update norm is very small and can be bounded as noise terms","venue":null,"work_id":"deb662b7-76e2-4931-b829-de4deeaea8b7","year":null},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:40.545158Z"},"links":{"citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:d30aaeb51dad2769e00801b04f694ad6f1aa678be0d54aab7a3394256933f6d2","observation_id":"6efa7547-edbe-489e-869f-cbc4f2d7184a","resolution":{"observed_at":"2026-08-07T12:46:43.368846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:46:43.108767Z","title":"That means in the tth gradient step, there will be some small gradient updates for later layersℓ′ ≥t introduced by the perturbation","venue":null,"work_id":"cc5ff84c-93fc-48cb-ac3f-60eaebca3365","year":null},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:40.614748Z"},"links":{"citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:837430269fc6960b778568d692abf805aa5798f2f6d9fae1e31f63a1b90e006c","observation_id":"192e0eaa-499b-4984-bd8d-e32f3cb90dc2","resolution":{"observed_at":"2026-08-07T12:46:43.194198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data"},"reference_resolution":{"displayed":71,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":3,"verified_fuzzy":31},"total_outbound_references":71},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 71 of 71 outbound references and 11 inbound Pith citation observations for arXiv:2505.23683."}