{"as_of":"2026-08-19T08:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:942d343db1157f6b1bf64c451f4510296082600e628221db5e95ae046b96dff8","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T22:33:21.786029Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:57:49.743234Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T03:49:29.556892Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-18T09:47:29.994030Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07067","snapshot_observed_at":"2026-08-07T14:57:49.743234Z","title":"Learning curves theory for hierarchi- cally compositional data with power-law distributed features","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16959","last_updated":"2025-09-01T20:18:07Z","snapshot_observed_at":"2026-08-18T01:17:00.160548Z","submitted_at":"2025-05-22T17:40:08Z","title":"Bigger Isn't Always Memorizing: Early Stopping Overparameterized Diffusion Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:57:49.743234Z"},"links":{"cited_paper":"/paper/2505.07067","citing_paper":"/paper/2505.16959"},"observation_digest":"sha256:9eb3ea8f164c34bc40f397849134225d06824f5ee46dc726bd5206b5df240211","observation_id":"996bb69f-a046-4837-84ee-6a7fa91a1359","resolution":{"observed_at":"2026-08-07T14:57:49.743234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-18T09:47:29.994030Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"cited_work":{"arxiv_id":"2505.07067","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.07067","snapshot_observed_at":"2026-07-04T03:49:29.556892Z","title":"Learning curves theory for hierarchi- cally compositional data with power-law distributed features","venue":null,"work_id":"18775316-eb10-4f0a-9db0-e4971a7724d0","year":2025},"citing_paper":{"arxiv_id":"2604.21691","last_updated":"2026-04-23T13:58:12Z","snapshot_observed_at":"2026-08-02T12:48:50.592713Z","submitted_at":"2026-04-23T13:58:12Z","title":"There Will Be a Scientific Theory of Deep Learning","version":1},"reference_index":249,"source":"arxiv_source","source_observed_at":"2026-05-09T20:11:17.616190Z"},"links":{"cited_paper":"/paper/2505.07067","citing_paper":"/paper/2604.21691"},"observation_digest":"sha256:dbdb65659ef999dbc0b6c02ba6eaabf8d38c3afd7997dbcb036f5ab4c8add7bc","observation_id":"80e5ba8a-a8a2-4eef-9c91-01084d4e394a","resolution":{"observed_at":"2026-05-11T15:21:08.888651Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-18T09:47:29.994030Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"cited_work":{"arxiv_id":"2505.07067","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.07067","snapshot_observed_at":"2026-07-04T03:49:29.556892Z","title":"Learning curves theory for hierarchi- cally compositional data with power-law distributed features","venue":null,"work_id":"18775316-eb10-4f0a-9db0-e4971a7724d0","year":2025},"citing_paper":{"arxiv_id":"2605.10395","last_updated":"2026-05-11T11:39:03Z","snapshot_observed_at":"2026-08-11T16:49:13.188695Z","submitted_at":"2026-05-11T11:39:03Z","title":"Sharp feature-learning transitions and Bayes-optimal neural scaling laws in extensive-width networks","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T02:55:52.782619Z"},"links":{"cited_paper":"/paper/2505.07067","citing_paper":"/paper/2605.10395"},"observation_digest":"sha256:075b6abca9bdbc894b7e850de5c736a47dfc30162c1bdc9e3b99c46cd73efe3e","observation_id":"3fb4679a-96b0-4403-9111-35b2b192ddfa","resolution":{"observed_at":"2026-05-12T02:56:18.758324Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-18T09:47:29.994030Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"cited_work":{"arxiv_id":"2505.07067","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.07067","snapshot_observed_at":"2026-07-04T03:49:29.556892Z","title":"Learning curves theory for hierarchi- cally compositional data with power-law distributed features","venue":null,"work_id":"18775316-eb10-4f0a-9db0-e4971a7724d0","year":2025},"citing_paper":{"arxiv_id":"2606.20347","last_updated":"2026-06-18T15:15:57Z","snapshot_observed_at":"2026-08-14T03:12:45.990611Z","submitted_at":"2026-06-18T15:15:57Z","title":"Critical Percolation as a Synthetic Data Model for Interpretability","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T17:41:29.317167Z"},"links":{"cited_paper":"/paper/2505.07067","citing_paper":"/paper/2606.20347"},"observation_digest":"sha256:f6e8523a8133719db6c3b11863b8bcda1aa56b93c2100f1f43d45cc34e8b25bb","observation_id":"b683e84a-5e00-46a0-a04f-3400ca996521","resolution":{"observed_at":"2026-07-04T03:49:29.559329Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.07067/citation-record","integrity":"/paper/2505.07067/integrity","json":"/paper/2505.07067/citation-record.json","paper":"/paper/2505.07067"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:21.621381Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-18T09:47:29.994030Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.621381Z"},"links":{"citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:500d38e33075cb0e592cdade0ebe1b8b0a68e3a39f7fccb145ff1dcb2b38333a","observation_id":"10b05bb5-9278-47e7-a693-a4a1b7ce7783","resolution":{"observed_at":"2026-08-15T22:33:21.621381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16367","last_updated":"2025-03-16T05:23:12Z","snapshot_observed_at":"2026-08-16T13:58:00.214064Z","submitted_at":"2024-04-25T07:10:29Z","title":"Learning Syntax Without Planting Trees: Understanding Hierarchical Generalization in Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16367","snapshot_observed_at":"2026-08-15T22:33:21.626412Z","title":"A., Goyal, N., and Tsvetkov, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-18T09:47:29.994030Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.626412Z"},"links":{"cited_paper":"/paper/2404.16367","citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:c6ef2a1d5e327a3e195e7a19780cd39f7216a05ae3675c76b44c2de789eb7f49","observation_id":"7d1f0b21-312f-49f7-8ef0-6563f8a4bedf","resolution":{"observed_at":"2026-08-15T22:33:21.626412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13673","last_updated":"2025-05-19T11:12:27Z","snapshot_observed_at":"2026-08-18T16:00:47.608550Z","submitted_at":"2023-05-23T04:28:16Z","title":"Physics of Language Models: Part 1, Learning Hierarchical Language Structures","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13673","snapshot_observed_at":"2026-08-15T22:33:21.630841Z","title":"and Li, Y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-18T09:47:29.994030Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.630841Z"},"links":{"cited_paper":"/paper/2305.13673","citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:c787b723dd35ef9ea98383dba26a884c5de6d94bd1a2fd19da407873c27d53cf","observation_id":"f5f9aac2-dfa6-42fc-b4d1-68495d63d4e8","resolution":{"observed_at":"2026-08-15T22:33:21.630841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.06701","last_updated":"2024-04-29T00:55:09Z","snapshot_observed_at":"2026-08-16T18:45:54.659137Z","submitted_at":"2021-02-12T18:57:46Z","title":"Explaining Neural Scaling Laws","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.06701","snapshot_observed_at":"2026-08-15T22:33:21.635325Z","title":"Explaining neural scaling laws","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-18T09:47:29.994030Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.635325Z"},"links":{"cited_paper":"/paper/2102.06701","citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:a908c338d7e3d5425e1207634437af886bdc6adcf72330d823199a12003f6089","observation_id":"037ed2ad-2136-4a5f-b09c-45bde0bcaf27","resolution":{"observed_at":"2026-08-15T22:33:21.635325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:21.639290Z","title":"Spectrum dependent learning curves in kernel regression and wide neural networks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-18T09:47:29.994030Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.639290Z"},"links":{"citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:46544265e1efffdae3fb04e1d0624eb8bd2a4ab5b6eca6b3acc75e10ab975221","observation_id":"e59f5920-8f88-4760-9ad3-a088a3847748","resolution":{"observed_at":"2026-08-15T22:33:21.639290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:22.320875Z","title":"A dynamical model of neural scaling laws","venue":null,"work_id":"b65d63ea-d3d8-4e77-b312-a04d178e7071","year":2024},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-18T09:47:29.994030Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.643090Z"},"links":{"citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:b784cfd8810bd81105ed0c009b0b5556be1427451bab7a621707efbfc344fb27","observation_id":"b71dd437-dc7f-4389-aea9-f726af0449a0","resolution":{"observed_at":"2026-08-15T22:33:22.325482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04289","last_updated":"2025-01-12T15:43:54Z","snapshot_observed_at":"2026-08-16T13:45:25.885980Z","submitted_at":"2024-06-06T17:34:24Z","title":"What Languages are Easy to Language-Model? A Perspective from Learning Probabilistic Regular Languages","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04289","snapshot_observed_at":"2026-08-15T22:33:21.646947Z","title":"What languages are easy to language-model? a perspective from learning probabilistic regular languages","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-18T09:47:29.994030Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.646947Z"},"links":{"cited_paper":"/paper/2406.04289","citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:23d8dc794aa36183ee46ff1913292b6c968ed37f69104eef3638c5ccec8a3ac0","observation_id":"3df813e5-f6cd-4bfd-a157-de6127eafb5d","resolution":{"observed_at":"2026-08-15T22:33:21.646947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:22.307450Z","title":"and Wyart, M","venue":null,"work_id":"8185f28a-c3ba-419e-b30f-49abd592fec2","year":2024},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-18T09:47:29.994030Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.651058Z"},"links":{"citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:1472e984ec01452e31285a030a364c087c363f02331591d636278dcbe32b38ad","observation_id":"e81647df-8698-4fd6-9a52-03e932a0ecd9","resolution":{"observed_at":"2026-08-15T22:33:22.312126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:22.293369Z","title":"What can be learnt with wide convolutional neural networks? In International Conference on Machine Learning, pp.\\ 3347--3379","venue":null,"work_id":"a56fa799-8dbd-41e2-8805-6fc5b0a8cb4c","year":2023},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-18T09:47:29.994030Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.654722Z"},"links":{"citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:4f2a00cc74c2c0e7df82f504cc29dc0dc04469a7da2a6eaf704442740923dca3","observation_id":"3ee2626b-7ca6-4dc3-a36f-7db5a3e3e51b","resolution":{"observed_at":"2026-08-15T22:33:22.298937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:21.658118Z","title":"M., Favero, A., and Wyart, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-18T09:47:29.994030Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.658118Z"},"links":{"citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:daabdabf41dfc539d23e8b60a484d07a383766629ff16352f6c72710a6e70a58","observation_id":"7d312aba-cf20-408d-a688-63570fdaa7bf","resolution":{"observed_at":"2026-08-15T22:33:21.658118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:21.662069Z","title":"and De Vito, E","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-18T09:47:29.994030Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.662069Z"},"links":{"citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:a46a6bc2586b758c4eae7e4426d80d8500ec5b0641ed0e4c7f122d7d93ead577","observation_id":"6e7d163a-4b86-4cc4-b6db-a5070029889d","resolution":{"observed_at":"2026-08-15T22:33:21.662069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1371/journal.pone.0129031","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:21.861921Z","title":"Zipf’s law for word frequencies: Word forms versus lemmas in long texts","venue":null,"work_id":"1b2ca444-8abb-4a03-b50b-00116d11bfc4","year":2015},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-18T09:47:29.994030Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.665654Z"},"links":{"citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:d63762365e890fb1a27f866f2a4d1bffe94bc07cc859c0598b42c8947bc3173a","observation_id":"f99e74f8-8108-47f4-ae79-f1df47b86236","resolution":{"observed_at":"2026-08-15T22:33:21.867235Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:22.271760Z","title":"Locality defeats the curse of dimensionality in convolutional teacher-student scenarios","venue":null,"work_id":"320fc6d2-7f9c-4b48-9c63-49d1e2603cc1","year":2021},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-18T09:47:29.994030Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.669334Z"},"links":{"citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:1de1002efdc6013bcf2a4b90966e6476702be475df1d3adbb839ec6912ec2242","observation_id":"9553ab42-fbec-48b6-85c4-91460344687c","resolution":{"observed_at":"2026-08-15T22:33:22.277673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15138","last_updated":"2025-06-10T08:51:44Z","snapshot_observed_at":"2026-08-16T13:23:27.707681Z","submitted_at":"2024-08-27T15:23:09Z","title":"How transformers learn structured data: insights from hierarchical filtering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15138","snapshot_observed_at":"2026-08-15T22:33:21.672915Z","title":"How transformers learn structured data: insights from hierarchical filtering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-18T09:47:29.994030Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.672915Z"},"links":{"cited_paper":"/paper/2408.15138","citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:4f5ef9f719e180d1539c4cca67e8eb0736f0b989632b00b7a05ddb513a1d8b6b","observation_id":"17eda9c2-8e77-4052-b51b-a098b7afc779","resolution":{"observed_at":"2026-08-15T22:33:21.672915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-08-14T02:46:56.838057Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-08-15T22:33:21.676902Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-18T09:47:29.994030Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.676902Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:62bc515dfcfe34ec865cb00f2ed1ebef59a507d6315c0495512d9265574e540b","observation_id":"59d1cce2-4e93-4010-8629-dfccf3baa106","resolution":{"observed_at":"2026-08-15T22:33:21.676902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:21.680716Z","title":"A., Welbl, J., Clark, A., Hennigan, T., Noland, E., Millican, K., van den Driessche, G., Damoc, B., Guy, A., Osindero, S., Simonyan, K., Elsen, E., Vinyals, O., Rae, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-18T09:47:29.994030Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.680716Z"},"links":{"citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:231e9a46e730ce5402f47433cf0dffdaf5ec6e80e856f02021a677e50a093990","observation_id":"370b3d2d-f89b-46a9-8f55-9b007661bd15","resolution":{"observed_at":"2026-08-15T22:33:21.680716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.04074","last_updated":"2021-02-08T09:25:31Z","snapshot_observed_at":"2026-08-16T18:47:05.682706Z","submitted_at":"2021-02-08T09:25:31Z","title":"Learning Curve Theory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.04074","snapshot_observed_at":"2026-08-15T22:33:21.684571Z","title":"Learning curve theory","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-18T09:47:29.994030Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.684571Z"},"links":{"cited_paper":"/paper/2102.04074","citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:82cbe0774817ffe1e7ba616024e7d2a6ecd7cb72416ea23c776a705c93a4e0fe","observation_id":"26c4e34b-b196-48fc-9500-941d088d144d","resolution":{"observed_at":"2026-08-15T22:33:21.684571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:22.250613Z","title":null,"venue":null,"work_id":"6f6463f4-cf0e-48db-9278-5799d7dabc88","year":1985},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-18T09:47:29.994030Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.688223Z"},"links":{"citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:26018045255a61db63174c890abbaa9d14095986eccd7e5dd0f216b805fe4f44","observation_id":"00377fe1-9ad3-4ca0-828a-47d2366ee67b","resolution":{"observed_at":"2026-08-15T22:33:22.255926Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-15T22:33:21.692038Z","title":"B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J., and Amodei, D","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-18T09:47:29.994030Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.692038Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:5e6a51d18988f72a36e897b54f018f488d749415b7973a12c8217d9616833c51","observation_id":"344c551c-6508-4443-a88d-4c89244988f1","resolution":{"observed_at":"2026-08-15T22:33:21.692038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:22.235159Z","title":null,"venue":null,"work_id":"995058d7-1cba-4cf7-8fe2-aa87141c17c9","year":1968},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-18T09:47:29.994030Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.696428Z"},"links":{"citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:e1656d63fc2b5559b8aafef8fb098d87d001e32367dc81eadcf8b5011245ea89","observation_id":"2faad500-454a-4815-abbc-1ca034d6d395","resolution":{"observed_at":"2026-08-15T22:33:22.239729Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:22.221937Z","title":"M., Bartlett, P., and Lee, J","venue":null,"work_id":"ace54b62-745f-4b1a-bda1-c6e04e926d6c","year":2024},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-18T09:47:29.994030Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.700945Z"},"links":{"citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:8a4aa1303336ca2c9f0ba083e4dac4ba24213ae0577813c86c6f1605bf55ffc0","observation_id":"526fac67-a2a3-477e-8339-0cb338ee8372","resolution":{"observed_at":"2026-08-15T22:33:22.226848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.09522","last_updated":"2018-06-24T13:55:48Z","snapshot_observed_at":"2026-08-14T19:32:30.606890Z","submitted_at":"2018-03-26T11:48:14Z","title":"A Provably Correct Algorithm for Deep Learning that Actually Works","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.09522","snapshot_observed_at":"2026-08-15T22:33:21.704619Z","title":"and Shalev-Shwartz, S","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-18T09:47:29.994030Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.704619Z"},"links":{"cited_paper":"/paper/1803.09522","citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:ffdd557462dcb298be3fdc04705dd71f1296274c5a7a43e3e743e45e3c4529fb","observation_id":"a7494ae6-3f48-43ab-832f-548a891ec17a","resolution":{"observed_at":"2026-08-15T22:33:21.704619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:22.208501Z","title":"and Shalev-Shwartz, S","venue":null,"work_id":"6f29618d-60fd-41f6-afe3-c228f1a55cdc","year":2020},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-18T09:47:29.994030Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.708371Z"},"links":{"citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:0311d3fff2c9be22e65eeec76c4ff9115419459c1da47e4c0944cd3e6b61619c","observation_id":"c0288d79-3763-4f99-9567-bb8ea117fa41","resolution":{"observed_at":"2026-08-15T22:33:22.213232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.16859","last_updated":"2022-10-30T15:13:18Z","snapshot_observed_at":"2026-08-17T11:15:48.593128Z","submitted_at":"2022-10-30T15:13:18Z","title":"A Solvable Model of Neural Scaling Laws","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.16859","snapshot_observed_at":"2026-08-15T22:33:21.711932Z","title":"A., and Sully, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-18T09:47:29.994030Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.711932Z"},"links":{"cited_paper":"/paper/2210.16859","citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:6a1613c6bfdd3ab03011483ad7f4fd1abc7f0a395357892418d94a9889125140","observation_id":"82a2769b-26e2-4607-b9fd-bf50baff3df2","resolution":{"observed_at":"2026-08-15T22:33:21.711932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:21.715596Z","title":"T., Frank, R., and Linzen, T","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-18T09:47:29.994030Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.715596Z"},"links":{"citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:b52364355cb9f32eb3c8a43558c404213452b34aacaaa5bbba4a00dd36ed1984","observation_id":"a8b46bfd-db3d-4b03-8e6d-bcff458efff3","resolution":{"observed_at":"2026-08-15T22:33:21.715596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18444","last_updated":"2024-05-01T16:49:57Z","snapshot_observed_at":"2026-08-17T20:34:03.038727Z","submitted_at":"2024-04-29T05:57:03Z","title":"U-Nets as Belief Propagation: Efficient Classification, Denoising, and Diffusion in Generative Hierarchical Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18444","snapshot_observed_at":"2026-08-15T22:33:21.719274Z","title":"U-nets as belief propagation: Efficient classification, denoising, and diffusion in generative hierarchical models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-18T09:47:29.994030Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.719274Z"},"links":{"cited_paper":"/paper/2404.18444","citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:4661b9c19ab0e28e068b21ed2ad63a4d9204abb61f939bc9bae8049029e5462a","observation_id":"a750fd93-4be7-42e3-aae3-39acc916f719","resolution":{"observed_at":"2026-08-15T22:33:21.719274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:22.194933Z","title":"J., Liu, Z., Girit, U., and Tegmark, M","venue":null,"work_id":"3c66015b-85d6-46e8-ba20-0e2055e99667","year":2023},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-18T09:47:29.994030Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.723088Z"},"links":{"citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:beba2cbcb524479e8fcfec000e48a54f13c07728cab474351f6ab763b1149546","observation_id":"002f735f-b218-4ea6-a091-03778be8fc09","resolution":{"observed_at":"2026-08-15T22:33:22.200022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:22.181945Z","title":"Understanding transformers via n-gram statistics","venue":null,"work_id":"3dd30e0c-9c96-4844-a6aa-9eec895f435c","year":2024},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-18T09:47:29.994030Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.726568Z"},"links":{"citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:12a603e99aef4205eefd6dc9a55581c14c77e2e128e97fe2eacc4c876c6e9605","observation_id":"43469283-6cab-4aa1-9a9f-35fabda7b813","resolution":{"observed_at":"2026-08-15T22:33:22.186965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:21.729984Z","title":"A statistical theory of contrastive pre-training and multimodal generative ai","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-18T09:47:29.994030Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.729984Z"},"links":{"citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:d85d3c40c02abeb1309a416edbfb65b5e062229b7ee5b8901ef79768721047f0","observation_id":"f2bd2139-fad6-46f7-becf-3e5a7e6be9d6","resolution":{"observed_at":"2026-08-15T22:33:21.729984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:21.733749Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-18T09:47:29.994030Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.733749Z"},"links":{"citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:8229bfa99eced824a60d354ca0936143788565dec3c0601dea463d0f01f0e576","observation_id":"a6e8fa48-33dc-40b6-b9c6-c15c7fc41ea0","resolution":{"observed_at":"2026-08-15T22:33:21.733749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:22.161651Z","title":"PyTorch : An Imperative Style , High - Performance Deep Learning Library","venue":null,"work_id":"7aa634a0-bf30-4c1e-a303-84dc1727f3d6","year":2019},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-18T09:47:29.994030Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.737115Z"},"links":{"citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:b70fa637d89155a1805968883427dd466399f601c9cc2a9e391e8ea66c53cf4d","observation_id":"406f6694-edd0-449c-91e6-3b3a697f4588","resolution":{"observed_at":"2026-08-15T22:33:22.166353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/bf00360802","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-18T11:03:46.223893Z","title":null,"venue":"Linguistics and Philosophy","work_id":"5acd0c57-7e05-4610-9d59-9f3a79e988da","year":1982},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-18T09:47:29.994030Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.740406Z"},"links":{"citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:2e804715d96e1e7cd94e92de72686e5e74f0399c7704b80879239951660ebd38","observation_id":"b7eb5af7-3fb6-4a0e-bac1-e90d66f5a477","resolution":{"observed_at":"2026-08-15T22:33:21.845584Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:21.744124Z","title":"and Salomaa, A","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-18T09:47:29.994030Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.744124Z"},"links":{"citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:f3e682a6d4106e2a3df08022e3bc0060192e0286dee81ccc832869bb06c881dc","observation_id":"9ecbca3a-1e5e-4147-b1f6-446b449c637a","resolution":{"observed_at":"2026-08-15T22:33:21.744124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13770","last_updated":"2025-02-28T20:28:34Z","snapshot_observed_at":"2026-08-18T13:08:11.736281Z","submitted_at":"2024-10-17T17:08:39Z","title":"Probing the Latent Hierarchical Structure of Data via Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13770","snapshot_observed_at":"2026-08-15T22:33:21.747702Z","title":"I., and Wyart, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-18T09:47:29.994030Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.747702Z"},"links":{"cited_paper":"/paper/2410.13770","citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:b3e589d9d5a4ec674a051ca9a710939004056bfebcfb9586747f35f896970c16","observation_id":"318b528d-244a-4bb5-8c78-91e935f01511","resolution":{"observed_at":"2026-08-15T22:33:21.747702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:21.752658Z","title":"A phase transition in diffusion models reveals the hierarchical nature of data","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-18T09:47:29.994030Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.752658Z"},"links":{"citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:2b1eb23a6e6167775152e1d29c65ef19af599349c8f926b9d277a071a3e18082","observation_id":"32494d23-33d0-450a-82d6-50bc6b53c0cb","resolution":{"observed_at":"2026-08-15T22:33:21.752658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15943","last_updated":"2025-02-04T03:38:57Z","snapshot_observed_at":"2026-08-16T13:49:35.878650Z","submitted_at":"2024-05-24T21:14:10Z","title":"Transformers represent belief state geometry in their residual stream","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15943","snapshot_observed_at":"2026-08-15T22:33:21.756480Z","title":"S., Marzen, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-18T09:47:29.994030Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.756480Z"},"links":{"cited_paper":"/paper/2405.15943","citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:c7f332416f0bc22d9a0a8084f82e76a7af5285d4937174f7c45f7e81a13a3d2e","observation_id":"f2dc5578-d7d1-4ee9-8051-2987a6d05091","resolution":{"observed_at":"2026-08-15T22:33:21.756480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:22.146469Z","title":"Asymptotic learning curves of kernel methods: empirical data versus teacher–student paradigm","venue":null,"work_id":"f4f221e3-e00e-4e43-b7ff-43cf444ce972","year":2020},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-18T09:47:29.994030Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.760130Z"},"links":{"citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:5f1c881515ad0a5690ef30bbb5cb7e0f67400deb889075bc67064ab6046749c1","observation_id":"e1294578-c4e2-4381-aa2d-151441bdc5e2","resolution":{"observed_at":"2026-08-15T22:33:22.151660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14994","last_updated":"2024-06-20T15:21:23Z","snapshot_observed_at":"2026-08-16T13:58:32.954473Z","submitted_at":"2024-04-23T12:51:37Z","title":"Transformers Can Represent $n$-gram Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14994","snapshot_observed_at":"2026-08-15T22:33:21.763465Z","title":"and Cotterell, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-18T09:47:29.994030Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.763465Z"},"links":{"cited_paper":"/paper/2404.14994","citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:5c4dca2b1c7ed4feac039ca9f0cb3cdfaf7720123dbada2cb29bc38cde9714f3","observation_id":"157d7e55-b743-467d-9492-61bdb33c4707","resolution":{"observed_at":"2026-08-15T22:33:21.763465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03001","last_updated":"2024-10-03T21:21:02Z","snapshot_observed_at":"2026-08-16T13:12:46.887083Z","submitted_at":"2024-10-03T21:21:02Z","title":"Can Transformers Learn $n$-gram Language Models?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03001","snapshot_observed_at":"2026-08-15T22:33:21.767555Z","title":"Can transformers learn n -gram language models? arXiv preprint arXiv:2410.03001, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-18T09:47:29.994030Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.767555Z"},"links":{"cited_paper":"/paper/2410.03001","citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:d1b4413d74cb11fe3706ffd00381cb48b5239cadd7524a1acad63204add235cd","observation_id":"0f6e61bc-18ba-4be2-a204-186c8b956881","resolution":{"observed_at":"2026-08-15T22:33:21.767555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:22.131649Z","title":null,"venue":null,"work_id":"f8243015-4dfd-4a10-b162-114329b1d94b","year":2024},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-18T09:47:29.994030Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.771419Z"},"links":{"citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:fa1210c7fef628253994058ce86ac3187f15aa500a4d1e7c2717c3dcb966f15e","observation_id":"d329c099-752a-4831-9b5e-2f49d60ac138","resolution":{"observed_at":"2026-08-15T22:33:22.137635Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:21.774650Z","title":"N., Kaiser, ., and Polosukhin, I","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-18T09:47:29.994030Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.774650Z"},"links":{"citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:f66ae3994a33f95c41cbd8169a69dc1ce6749034283a6b3905e4693c0f50697f","observation_id":"ea2e2881-bca5-4459-b5db-efbc3c5f2232","resolution":{"observed_at":"2026-08-15T22:33:21.774650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.14522","last_updated":"2022-07-15T17:04:24Z","snapshot_observed_at":"2026-08-18T09:46:54.696672Z","submitted_at":"2020-11-30T03:21:05Z","title":"Feature Learning in Infinite-Width Neural Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.14522","snapshot_observed_at":"2026-08-15T22:33:21.778155Z","title":"and Hu, E","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-18T09:47:29.994030Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.778155Z"},"links":{"cited_paper":"/paper/2011.14522","citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:3a3f52faea90c2d958cb856bbd5a3eae1f42e63adbfa23c41294c09fe55ac8a7","observation_id":"7c19e1ac-989e-450d-8a10-a6704a878015","resolution":{"observed_at":"2026-08-15T22:33:21.778155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08117","last_updated":"2023-10-16T03:27:53Z","snapshot_observed_at":"2026-08-17T14:58:33.944003Z","submitted_at":"2023-03-14T17:49:50Z","title":"Do Transformers Parse while Predicting the Masked Word?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08117","snapshot_observed_at":"2026-08-15T22:33:21.782186Z","title":"Do transformers parse while predicting the masked word? arXiv preprint arXiv:2303.08117, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-18T09:47:29.994030Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.782186Z"},"links":{"cited_paper":"/paper/2303.08117","citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:dc8142ca5a74e3e1c9c88ccac9e622e9d937c0df3a9b5963708fa8efa672559a","observation_id":"8e97ade3-a463-49c7-a87c-90de7f60537f","resolution":{"observed_at":"2026-08-15T22:33:21.782186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1561/0600000017","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:33:21.813681Z","title":"and Mumford, D","venue":null,"work_id":"88ed3f37-8831-439b-862e-32bcaa327b04","year":2006},"citing_paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","snapshot_observed_at":"2026-08-18T09:47:29.994030Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T22:33:21.786029Z"},"links":{"citing_paper":"/paper/2505.07067"},"observation_digest":"sha256:6d542588612ddec369692ba22ee7a768bcaf42d36ccef426df03bca14d1bb129","observation_id":"11fd114e-107e-4db0-b722-6f5d2be9070b","resolution":{"observed_at":"2026-08-15T22:33:21.818742Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.07067","last_updated":"2025-05-11T17:38:40Z","latest_version":1,"primary_category":"stat.ML","snapshot_observed_at":"2026-08-18T09:47:29.994030Z","submitted_at":"2025-05-11T17:38:40Z","title":"Learning curves theory for hierarchically compositional data with power-law distributed features"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":3,"verified_fuzzy":10},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 4 inbound Pith citation observations for arXiv:2505.07067."}