{"as_of":"2026-08-10T11:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5110b39b8914785db215da96aca4cb60f467df1cd27fb21d2fb85e1411d7ab78","coverage":[{"denominator":217,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:07:39.908059Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-02T12:29:24.439779Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T12:36:56.135904Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"cited_work":{"arxiv_id":"2507.00004","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.00004","snapshot_observed_at":"2026-07-02T12:36:56.135904Z","title":"arXiv preprint arXiv:2507.00004 , year=","venue":null,"work_id":"8e757558-ceb0-44a5-a9e4-39ad19335615","year":null},"citing_paper":{"arxiv_id":"2607.00913","last_updated":"2026-07-01T13:18:21Z","snapshot_observed_at":"2026-08-05T09:20:57.270200Z","submitted_at":"2026-07-01T13:18:21Z","title":"Two AI Metrics Diverged: Will it Make All the Difference?","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-02T12:29:24.439779Z"},"links":{"cited_paper":"/paper/2507.00004","citing_paper":"/paper/2607.00913"},"observation_digest":"sha256:6b503faaef042c438373a5308063b80610c8131784a0fb98de6a7e4e1b8a97bd","observation_id":"5e5e584d-abf1-49fc-9722-19276522f94e","resolution":{"observed_at":"2026-07-02T12:36:56.137222Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.00004/citation-record","integrity":"/paper/2507.00004/integrity","json":"/paper/2507.00004/citation-record.json","paper":"/paper/2507.00004"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-07T05:07:39.492720Z","title":"Scaling laws for neural language models,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.492720Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:a51255b5bbb6036afc9beb1d581c4a1acd7453decb2e6d0975d1e4f95bb52541","observation_id":"ded0eeef-24b1-45e1-be13-4bc79ceb2429","resolution":{"observed_at":"2026-08-07T05:07:39.492720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-07T05:07:39.498613Z","title":"Training compute-optimal large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.498613Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:de5dbc3bc2015b6802d3999558d1980dd2bce9c0ae8671bb319101ee2991beb1","observation_id":"bb086a52-8788-4114-a846-700cf8dbfb0e","resolution":{"observed_at":"2026-08-07T05:07:39.498613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15208","last_updated":"2025-04-21T16:26:56Z","snapshot_observed_at":"2026-08-07T16:00:32.194586Z","submitted_at":"2025-04-21T16:26:56Z","title":"Compute-Optimal LLMs Provably Generalize Better With Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15208","snapshot_observed_at":"2026-08-07T05:07:39.503440Z","title":"Compute-optimal LLMs provably generalize better with scale,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.503440Z"},"links":{"cited_paper":"/paper/2504.15208","citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:6d3fdc82ea9ef2dcdd8918fa15989f47c1f134d169b39b9a782b5dedc225fefb","observation_id":"b0430e10-3c59-4534-997b-f8613924f1d5","resolution":{"observed_at":"2026-08-07T05:07:39.503440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:39.507915Z","title":"Training compute of frontier AI models grows by 4-5x per year,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.507915Z"},"links":{"citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:035fa519c04bc0b7c171dcc6ba7f2c7da5b1e2d4303c63179857b3c6135c14f6","observation_id":"f0d827f6-3399-4524-9224-f3b73361d949","resolution":{"observed_at":"2026-08-07T05:07:39.507915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15377","last_updated":"2024-02-13T17:52:00Z","snapshot_observed_at":"2026-08-06T10:36:22.238109Z","submitted_at":"2023-11-26T18:36:28Z","title":"Increased Compute Efficiency and the Diffusion of AI Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15377","snapshot_observed_at":"2026-08-07T05:07:39.512826Z","title":"Increased compute efficiency and the diffusion of AI capabilities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.512826Z"},"links":{"cited_paper":"/paper/2311.15377","citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:c6a38cbae3b2f847345bbd5ba4416f02a245b44755a762056b77b9935c9462b7","observation_id":"5efef214-44c5-4040-8b6f-e7af7d39138a","resolution":{"observed_at":"2026-08-07T05:07:39.512826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.04305","last_updated":"2020-05-08T22:26:37Z","snapshot_observed_at":"2026-08-09T04:04:38.739129Z","submitted_at":"2020-05-08T22:26:37Z","title":"Measuring the Algorithmic Efficiency of Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.04305","snapshot_observed_at":"2026-08-07T05:07:39.517278Z","title":"Measuring the algorithmic efficiency of neural networks,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.517278Z"},"links":{"cited_paper":"/paper/2005.04305","citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:d46e0b8fcce1393648f56a91b90c3a03ccf0f3496d87366c9dc35df9f55764c2","observation_id":"983dcfe7-b288-45fb-9d9d-5b300cfdfd01","resolution":{"observed_at":"2026-08-07T05:07:39.517278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05812","last_updated":"2024-03-09T06:26:21Z","snapshot_observed_at":"2026-07-06T17:41:55.780727Z","submitted_at":"2024-03-09T06:26:21Z","title":"Algorithmic progress in language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05812","snapshot_observed_at":"2026-08-07T05:07:39.522279Z","title":"Algorithmic progress in language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.522279Z"},"links":{"cited_paper":"/paper/2403.05812","citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:b2ea57984007f8dc26fb95e3d0e5f521172e9b4982937d01109ca9c9d5be59a6","observation_id":"a40e8546-a6c2-4358-9f2c-4b0cc46c1a01","resolution":{"observed_at":"2026-08-07T05:07:39.522279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:39.526454Z","title":"Claude’s extended thinking,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.526454Z"},"links":{"citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:af10eddc9bf2f3c10c902e86942e7da433e031f8fcd75ae015b0b0f2abbd08f1","observation_id":"55527bc7-82f6-45e1-a4e7-de716a995acb","resolution":{"observed_at":"2026-08-07T05:07:39.526454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T05:07:39.530848Z","title":"DeepSeek-R1: Incentivizing reasoning capability in LLMs via reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.530848Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:8c69d3359021f8f9894d07a17e5a4e1cd0fea2b49c89c74e7de60173afdab14a","observation_id":"94aeaad4-b318-4e1c-8996-82fa3d566d7b","resolution":{"observed_at":"2026-08-07T05:07:39.530848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:39.534878Z","title":"Gemini 2.5: Our most intelligent AI model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.534878Z"},"links":{"citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:0e855e840a19638f3a07d83f301c20ca9795b8dd0e65d8008f564f3d8bf7f1a3","observation_id":"d176cbbe-b1c1-4eeb-9c9f-b04f7c48f3cd","resolution":{"observed_at":"2026-08-07T05:07:39.534878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:39.538768Z","title":"IBM Granite 3.2: Reasoning, vision, forecasting and more,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.538768Z"},"links":{"citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:f7c0e80e5de75cd1d42385a838762beb5e77bc91826007dc731d6a45e53d4735","observation_id":"d7f1571f-5cf1-4269-b93e-c61995d18531","resolution":{"observed_at":"2026-08-07T05:07:39.538768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.21318","last_updated":"2025-04-30T05:05:09Z","snapshot_observed_at":"2026-08-08T08:43:53.657438Z","submitted_at":"2025-04-30T05:05:09Z","title":"Phi-4-reasoning Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.21318","snapshot_observed_at":"2026-08-07T05:07:39.542544Z","title":"Phi-4- reasoning technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.542544Z"},"links":{"cited_paper":"/paper/2504.21318","citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:76b86f0386da7acd63b8e56bcc644fdeb1f1f5a678dac2ceb0efac7490e2ec57","observation_id":"be84ecfc-bee3-440e-87d9-358799f52e61","resolution":{"observed_at":"2026-08-07T05:07:39.542544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:39.546640Z","title":"OpenAI o1 System Card,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.546640Z"},"links":{"citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:612a69a38dde18fa53179dc09dbcc2d09173fca6af22dd0e05965cba3e08e267","observation_id":"1fc145bf-976b-4c12-b63e-7551b5072a6c","resolution":{"observed_at":"2026-08-07T05:07:39.546640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:39.550360Z","title":"Introducing OpenAI o3 and o4-mini,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.550360Z"},"links":{"citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:54da149c219d4912558236cba5070da3eb444290f4428ebc96dc651ac3c9986b","observation_id":"0201b25d-8625-4501-8250-aa7f9357c89b","resolution":{"observed_at":"2026-08-07T05:07:39.550360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:39.554243Z","title":"Grok 3 Beta — The Age of Reasoning Agents,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.554243Z"},"links":{"citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:208d812a7ffe508e52a7046d3745b48e6b23e8004a5c211860734d294daae510","observation_id":"b1190000-cdb1-46d9-90f8-e9f8ffd15ccb","resolution":{"observed_at":"2026-08-07T05:07:39.554243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:39.557955Z","title":"The growing energy footprint of artificial intelligence,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.557955Z"},"links":{"citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:3679ace2fa08b177163da4d73f22e5037794b07609ebfd2afbb69a5b0f1f8e1c","observation_id":"be22cfff-d3eb-4ee5-b11f-ad8d106bbf3b","resolution":{"observed_at":"2026-08-07T05:07:39.557955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:39.562176Z","title":"Estimating the carbon footprint of BLOOM, a 176B parameter language model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.562176Z"},"links":{"citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:ffe1b36729a338bc7963453955d8f563ac1daa172aab13001b3bc4bfbe3a10f8","observation_id":"77f11932-1a2d-439a-9e21-ecd23f414404","resolution":{"observed_at":"2026-08-07T05:07:39.562176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05149","last_updated":"2022-04-11T14:30:27Z","snapshot_observed_at":"2026-08-09T18:42:48.591269Z","submitted_at":"2022-04-11T14:30:27Z","title":"The Carbon Footprint of Machine Learning Training Will Plateau, Then Shrink","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05149","snapshot_observed_at":"2026-08-07T05:07:39.565848Z","title":"The carbon footprint of machine learning training will plateau, then shrink,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.565848Z"},"links":{"cited_paper":"/paper/2204.05149","citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:062bec86a90191d11a6e8be7ebd0accd46886dd957510fd382519bd6a2fc04d9","observation_id":"a8743a1b-2298-4a01-9984-c89d0c621898","resolution":{"observed_at":"2026-08-07T05:07:39.565848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:39.570414Z","title":"Sustainable AI: Environmental implications, challenges and opportunities,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.570414Z"},"links":{"citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:13ddf1d67ed0491637216f7db9cdb8cb20ce113969d57231672a819fc7745869","observation_id":"d5477b62-9f63-4959-9c94-04557d63739a","resolution":{"observed_at":"2026-08-07T05:07:39.570414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:39.574308Z","title":"The next wave of AI: Demand and adoption,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.574308Z"},"links":{"citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:ad0c5ea2734fed74db012c5dc754410b1227e0ae8a775939dfc0e495003dd8ab","observation_id":"43c6e430-13ee-4da6-b7ea-0fefbd694ff9","resolution":{"observed_at":"2026-08-07T05:07:39.574308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16548","last_updated":"2025-06-13T15:59:59Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T22:45:06Z","title":"From Efficiency Gains to Rebound Effects: The Problem of Jevons' Paradox in AI's Polarized Environmental Debate","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16548","snapshot_observed_at":"2026-08-07T05:07:39.578208Z","title":"From efficiency gains to rebound effects: The problem of Jevons’ Paradox in AI’s polarized environmental debate,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.578208Z"},"links":{"cited_paper":"/paper/2501.16548","citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:f6f0b960231fb14b4384e8e87c4a6053fda9415a2ff9baefdc1e09d3e3659209","observation_id":"96a5ee41-d563-4a26-8ec6-1a7235947640","resolution":{"observed_at":"2026-08-07T05:07:39.578208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:39.582584Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.582584Z"},"links":{"citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:d3e23f9ccb9071517be204f8d15f4c8ba2ae8d22450241f8e296496f5d933d00","observation_id":"bd8f6d77-36a2-4910-a6a6-dcf1bfd64aae","resolution":{"observed_at":"2026-08-07T05:07:39.582584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:39.586504Z","title":"1B user messages sent on ChatGPT every day,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.586504Z"},"links":{"citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:76384aafebbb51cf871a9f9d7280214e5f5166dea7e78033e6bba6db7cd095e2","observation_id":"4cb6bb14-8ced-428d-8814-8dfb901fea59","resolution":{"observed_at":"2026-08-07T05:07:39.586504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:39.590585Z","title":"ChatGPT added one million users in the last hour,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.590585Z"},"links":{"citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:757a412325d09cfd06c7d5dee440583cb3045d05966bf2cbb55383ee0ace18a2","observation_id":"b3a8d728-3b7d-46d4-879a-679fc2647aee","resolution":{"observed_at":"2026-08-07T05:07:39.590585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:39.594451Z","title":"ChatGPT statistics and user trends (2025),","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.594451Z"},"links":{"citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:e6856b10c3972a8d6c8998dc66d4613c4779a545b45f458eee04b63d84a78a47","observation_id":"97a61648-86eb-4065-9d7d-d6e0b30c8fbf","resolution":{"observed_at":"2026-08-07T05:07:39.594451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:39.598332Z","title":"A systematic review of Green AI,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.598332Z"},"links":{"citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:5931295fbffafefc8755af8a4df8ec95d027051a6b71a2a87ef294fe89abcd25","observation_id":"c6daaac8-50e7-423f-b605-e0e4e0a7907d","resolution":{"observed_at":"2026-08-07T05:07:39.598332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:39.602174Z","title":"Deep Blue,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.602174Z"},"links":{"citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:fa49caf613a4a13ee012e30177a20ac0aba515f6a922b701333e3630e9acfaa5","observation_id":"80a688e5-b70a-40ea-91c4-956cb869db40","resolution":{"observed_at":"2026-08-07T05:07:39.602174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:39.606172Z","title":"Mastering the game of Go with deep neural networks and tree search,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.606172Z"},"links":{"citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:bc06954dbe6110ef244e1a2d3160d324c1a1c2dff63975179a2f2bcf832a82d3","observation_id":"6e7aebae-75b6-4a46-b0a6-9400c32231a5","resolution":{"observed_at":"2026-08-07T05:07:39.606172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:39.611183Z","title":"Mastering the game of Go without human knowledge,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.611183Z"},"links":{"citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:39f5cc7c29aee47249a271d3e45f7d490d878ace8a72b9a6ce5194944408f27c","observation_id":"e5c0c3f8-e05a-491c-b108-54348491f428","resolution":{"observed_at":"2026-08-07T05:07:39.611183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01815","last_updated":"2017-12-05T18:45:38Z","snapshot_observed_at":"2026-08-02T00:39:04.960144Z","submitted_at":"2017-12-05T18:45:38Z","title":"Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.01815","snapshot_observed_at":"2026-08-07T05:07:39.615289Z","title":"Mastering Chess and Shogi by self-play with a general reinforcement learning algorithm,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.615289Z"},"links":{"cited_paper":"/paper/1712.01815","citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:8dfdf15562f37464d6ae940ab3f3173197b72a04028e73bb9ddfc14f6a1485b3","observation_id":"3d9dc32f-db41-44a7-8c75-c83962b8fee6","resolution":{"observed_at":"2026-08-07T05:07:39.615289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.03113","last_updated":"2021-04-15T10:03:37Z","snapshot_observed_at":"2026-07-06T10:57:14.668681Z","submitted_at":"2021-04-07T13:34:25Z","title":"Scaling Scaling Laws with Board Games","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.03113","snapshot_observed_at":"2026-08-07T05:07:39.619445Z","title":"Scaling scaling laws with board games,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.619445Z"},"links":{"cited_paper":"/paper/2104.03113","citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:1c93ebc9d0b7247db601c83dfc6307df6894db42d6f17173a16cff341f66db00","observation_id":"6f8b12d7-0413-43ee-87ec-b1f2fa7277c0","resolution":{"observed_at":"2026-08-07T05:07:39.619445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.02955","last_updated":"2017-11-16T23:12:15Z","snapshot_observed_at":"2026-07-06T05:41:45.343378Z","submitted_at":"2017-05-08T16:27:48Z","title":"Safe and Nested Subgame Solving for Imperfect-Information Games","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.02955","snapshot_observed_at":"2026-08-07T05:07:39.624213Z","title":"Safe and nested subgame solving for imperfect-information games,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.624213Z"},"links":{"cited_paper":"/paper/1705.02955","citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:8c1a444c9915f752be47c2aad2b9ee79dba27cb1c76551fcb3e590c1cca4404d","observation_id":"638d68f3-0448-4836-bc9a-b4bb22aa41b0","resolution":{"observed_at":"2026-08-07T05:07:39.624213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:39.628464Z","title":"Human-level play in the game of Diplomacy by combining language models with strategic reasoning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.628464Z"},"links":{"citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:d6bbba3334be4df22c60799a3985c105882d347338ed2e4ebcb09f9092f84178","observation_id":"a549f08b-343c-4022-aca5-e6358296ec98","resolution":{"observed_at":"2026-08-07T05:07:39.628464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07682","last_updated":"2022-10-26T05:06:24Z","snapshot_observed_at":"2026-08-02T15:56:35.249569Z","submitted_at":"2022-06-15T17:32:01Z","title":"Emergent Abilities of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.07682","snapshot_observed_at":"2026-08-07T05:07:39.632468Z","title":"Emergent abilities of large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.632468Z"},"links":{"cited_paper":"/paper/2206.07682","citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:5df652cd808c345ee442f19b234edd24f298f5dd79974491491fe64006061e18","observation_id":"c111cbba-fc11-4128-a660-941e7adc9728","resolution":{"observed_at":"2026-08-07T05:07:39.632468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:39.636674Z","title":"An information theory of compute-optimal size scaling, emergence, and plateaus in language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.636674Z"},"links":{"citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:77fb3db57fd725d9bf6eeaee883378a24a822dd60703a4681dbd6d83d4ece999","observation_id":"f63715f7-46e5-4879-84ca-a789399dc89d","resolution":{"observed_at":"2026-08-07T05:07:39.636674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:39.640705Z","title":"Multi-task Language Understanding on MMLU Leaderboard,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.640705Z"},"links":{"citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:b5122a877bf1b245aa52012ca0df79e3f91ca40f3370758d24733bdf7dbc5d63","observation_id":"d0251886-4a32-4390-8104-c926f87aa3af","resolution":{"observed_at":"2026-08-07T05:07:39.640705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:39.644826Z","title":"Measuring massive multitask language understanding,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.644826Z"},"links":{"citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:a4aa3fb5cae2d9c3b33299356b5cf250982d963f111b37d3019fa2c5dc988c93","observation_id":"29c7dd85-4868-465f-8763-e1222da9e0d5","resolution":{"observed_at":"2026-08-07T05:07:39.644826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:39.648721Z","title":"Are emergent abilities of large language models a mirage?","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.648721Z"},"links":{"citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:55cf22df8e2da2986de86f9fc4c3535b09a5295a8e0f5bba1b9395cbc6328c32","observation_id":"2c45d034-17db-427c-a26d-ef2b36bfdb98","resolution":{"observed_at":"2026-08-07T05:07:39.648721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:39.652682Z","title":"The quantization model of neural scaling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.652682Z"},"links":{"citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:cafd513bb8d010944cc1172e767c271fd38a59997aa4f0ee34916ae209b5a86b","observation_id":"e0d401d8-160a-41a9-9e0f-bb25ed697939","resolution":{"observed_at":"2026-08-07T05:07:39.652682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:39.656514Z","title":"Circuit tracing: Revealing computational graphs in language models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.656514Z"},"links":{"citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:16d363385d74d7eac80162e0817eef32ef14c86f69275d7403369e8c923d6079","observation_id":"e6616e3c-20cf-4f50-8c31-bc0dc045550a","resolution":{"observed_at":"2026-08-07T05:07:39.656514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:39.664621Z","title":"Curriculum learning,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.664621Z"},"links":{"citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:bd5869bf0a293119e8f4c7883524ac2ccdba7d74f9dedf0bca0135952260c3e6","observation_id":"3fa94251-d92d-4778-9dc5-ae14f5e8ac3f","resolution":{"observed_at":"2026-08-07T05:07:39.664621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15936","last_updated":"2023-11-06T00:36:24Z","snapshot_observed_at":"2026-07-06T16:00:08.643627Z","submitted_at":"2023-07-29T09:22:54Z","title":"A Theory for Emergence of Complex Skills in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15936","snapshot_observed_at":"2026-08-07T05:07:39.668555Z","title":"A theory for emergence of complex skills in language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.668555Z"},"links":{"cited_paper":"/paper/2307.15936","citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:22bc96f3b7ad1e8e9ecccf060dd0a741a0b4eb63831485de080d29b7ab8087e5","observation_id":"86c4006f-a309-4535-b9cf-08632f0485c9","resolution":{"observed_at":"2026-08-07T05:07:39.668555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:39.673016Z","title":"A mathematical theory for learning semantic languages by abstract learners,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.673016Z"},"links":{"citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:a951e754cb50dbff39de695761b66ffbfb032a75b1afdca831cc6a55efebd7de","observation_id":"c12e0140-4c77-4313-8279-37d316de2be2","resolution":{"observed_at":"2026-08-07T05:07:39.673016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:39.676978Z","title":"Skill-Mix: a flexible and expandable family of evaluations for AI models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.676978Z"},"links":{"citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:f362fd5c66bbe51e2d8ebfefe055affa7209ae9129f390cec033b302fb2ca289","observation_id":"66468c21-ea12-4cdf-83f6-61997079e119","resolution":{"observed_at":"2026-08-07T05:07:39.676978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:39.680836Z","title":"The learning curve: implications of a quantitative analysis,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.680836Z"},"links":{"citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:c3aa79b94e2574d3a97dca94618800517706b6379830d121a9781c608a50aabe","observation_id":"0cd33ccb-1cbf-4e55-ad77-ba6e7bff0b80","resolution":{"observed_at":"2026-08-07T05:07:39.680836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:39.684918Z","title":"Plateaus, dips, and leaps: Where to look for inventions and discoveries during skilled performance,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.684918Z"},"links":{"citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:6c6d5995b9fa39175d29d2e834e68d8b3e8321c4e1cf7c43eff63e9dedf7e0a6","observation_id":"27c29121-cbce-4bce-83b4-97c2df0c216f","resolution":{"observed_at":"2026-08-07T05:07:39.684918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:39.688862Z","title":"A first-principles mathematical model integrates the disparate timescales of human learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.688862Z"},"links":{"citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:e1a7ac2c8a21b05dc2e194e77ad125419061a902dff719c4cb9236e92313250c","observation_id":"91c8e278-8ca1-4dfa-927a-b870f9af7cd7","resolution":{"observed_at":"2026-08-07T05:07:39.688862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:39.693324Z","title":"Spin-glass models as error-correcting codes,","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.693324Z"},"links":{"citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:5d8e5b297fb88c4f8bee3ed9c23f57ceb4862918434f08e8efefb47efd6ee037","observation_id":"6bd50324-3c6f-4f18-971b-9b663a5a8c9f","resolution":{"observed_at":"2026-08-07T05:07:39.693324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:39.697193Z","title":"Newell,Unified Theories of Cognition","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.697193Z"},"links":{"citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:d7e4c25aa63767c2c5bf52c8df186e6ff944424a9fa795822bf5d8543aa0f775","observation_id":"8491fe46-a0cd-40d9-9638-2b9ad7f199dd","resolution":{"observed_at":"2026-08-07T05:07:39.697193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:39.701454Z","title":"Barab ´asi,Network Science","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.701454Z"},"links":{"citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:8871296d712fac62758f3013701e62dc02511b771e076468ba06506cde204fb6","observation_id":"4c225486-1177-463a-bbeb-f745387c52fb","resolution":{"observed_at":"2026-08-07T05:07:39.701454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:39.705522Z","title":"Learning curves: Asymptotic values and rate of convergence,","venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.705522Z"},"links":{"citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:9f2ae5ff2637c5814a63d8c680f9b8103af1d3e2459a45574bfe689315031f00","observation_id":"b721141f-d0e6-4ec5-b9df-f670f1449ae9","resolution":{"observed_at":"2026-08-07T05:07:39.705522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-08-07T05:07:39.709672Z","title":"Deep learning scaling is predictable, empirically,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.709672Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:45fded595f6f94b533f0e3d9a7051a696acb6e2fbf1e583d628ec551db62f819","observation_id":"27dac46d-595c-4af0-be03-16caa56f7f4b","resolution":{"observed_at":"2026-08-07T05:07:39.709672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.12673","last_updated":"2019-12-20T18:20:34Z","snapshot_observed_at":"2026-08-05T03:04:56.613105Z","submitted_at":"2019-09-27T13:27:53Z","title":"A Constructive Prediction of the Generalization Error Across Scales","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.12673","snapshot_observed_at":"2026-08-07T05:07:39.713752Z","title":"A constructive prediction of the generalization error across scales,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.713752Z"},"links":{"cited_paper":"/paper/1909.12673","citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:4a76636c21919d303bcb4018eb924a2468e1e0d39a3735cb0f08acb57c1cbb31","observation_id":"77e77b35-f651-4a00-96d2-619bda196821","resolution":{"observed_at":"2026-08-07T05:07:39.713752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-07T05:07:39.718254Z","title":"Language models are few-shot learners,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.718254Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:735f8835d273187f28496b19ab42fd0cbf49ef94fcbbdaa3d64b49f20a7ba337","observation_id":"b2483da6-1c56-4ecf-b3e0-8f16bcb95355","resolution":{"observed_at":"2026-08-07T05:07:39.718254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:39.722424Z","title":"Prediction and entropy of printed English,","venue":null,"work_id":null,"year":1951},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.722424Z"},"links":{"citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:aafeef6060d4eac1290606c26fcf54daa3766378e3ff11cf878fa524a02d1396","observation_id":"a5a4d548-51d1-4c27-b5a3-208835a5ce7a","resolution":{"observed_at":"2026-08-07T05:07:39.722424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:39.726859Z","title":"Explaining neural scaling laws,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.726859Z"},"links":{"citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:c706a294110ca5dd3e5f5970f44414df914a4506a3984d20ea8046b5e97eefdc","observation_id":"6366e3eb-1eff-489f-9840-95594bbd5bf6","resolution":{"observed_at":"2026-08-07T05:07:39.726859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:39.730817Z","title":"Towards a universal scaling law of LLM training and inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.730817Z"},"links":{"citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:cece514e65bdf3997e394168ee31b70c2e22fffcebedb416c66ee0511d08c1a2","observation_id":"b54a65a2-cecf-44f0-8acc-597adfd2fe59","resolution":{"observed_at":"2026-08-07T05:07:39.730817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T05:07:39.734911Z","title":"The Llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.734911Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:0a3bb402e7d81e1478a40dd3230fe2ffd2bc9e335740febc66a46aa510cb5736","observation_id":"1e02fe25-2a3f-4352-8ea8-8dba24901087","resolution":{"observed_at":"2026-08-07T05:07:39.734911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04315","last_updated":"2024-12-06T11:39:27Z","snapshot_observed_at":"2026-08-04T05:54:36.205023Z","submitted_at":"2024-12-05T16:31:13Z","title":"Densing Law of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04315","snapshot_observed_at":"2026-08-07T05:07:39.739462Z","title":"Densing law of LLMs,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.739462Z"},"links":{"cited_paper":"/paper/2412.04315","citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:82d9f3e495a248155d997af2c4573f74e04b137c5f5c196f145ba05c86e287a3","observation_id":"7786d76e-84fb-4402-a578-d68742c0b14c","resolution":{"observed_at":"2026-08-07T05:07:39.739462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04757","last_updated":"2024-01-09T17:34:30Z","snapshot_observed_at":"2026-08-07T05:53:39.752355Z","submitted_at":"2024-01-09T17:34:30Z","title":"How predictable is language model benchmark performance?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04757","snapshot_observed_at":"2026-08-07T05:07:39.743953Z","title":"How predictable is language model benchmark performance?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.743953Z"},"links":{"cited_paper":"/paper/2401.04757","citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:b1ed9d5368a5a75f08a3c7b3ecec673d8e7e8396caf2c8a8de0086461de607f6","observation_id":"341e967e-f53c-44d0-b95a-640968e74a98","resolution":{"observed_at":"2026-08-07T05:07:39.743953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10938","last_updated":"2024-10-01T23:38:10Z","snapshot_observed_at":"2026-07-06T18:15:54.402568Z","submitted_at":"2024-05-17T17:49:44Z","title":"Observational Scaling Laws and the Predictability of Language Model Performance","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10938","snapshot_observed_at":"2026-08-07T05:07:39.748185Z","title":"Observational scaling laws and the predictability of language model performance,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.748185Z"},"links":{"cited_paper":"/paper/2405.10938","citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:969228faa912f681df1dfeb28968a40ad8834e7e3a7b03f473b32b03e922cacb","observation_id":"55d90686-d264-4dcc-acd3-a88ee28203c9","resolution":{"observed_at":"2026-08-07T05:07:39.748185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08540","last_updated":"2024-06-14T20:21:05Z","snapshot_observed_at":"2026-07-06T17:43:56.860733Z","submitted_at":"2024-03-13T13:54:00Z","title":"Language models scale reliably with over-training and on downstream tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08540","snapshot_observed_at":"2026-08-07T05:07:39.752393Z","title":"Language models scale reliably with over-training and on downstream tasks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.752393Z"},"links":{"cited_paper":"/paper/2403.08540","citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:9e29aa57bc308ec59e805190749a3ac323556954b248b54bf1926bca7b2c1ddb","observation_id":"7212905d-590a-4677-bc73-d486d3d50ec8","resolution":{"observed_at":"2026-08-07T05:07:39.752393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.14891","last_updated":"2023-07-24T00:05:04Z","snapshot_observed_at":"2026-08-07T16:10:09.620880Z","submitted_at":"2022-10-26T17:45:01Z","title":"Broken Neural Scaling Laws","version":17},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.14891","snapshot_observed_at":"2026-08-07T05:07:39.756787Z","title":"Broken neural scaling laws,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.756787Z"},"links":{"cited_paper":"/paper/2210.14891","citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:78f6c8bbf46aa20023051e79087460bbfbfba84b0273c8a496a9b3d6f4d1a72b","observation_id":"f1e3447c-cb80-4840-93aa-5ed3ab6d4741","resolution":{"observed_at":"2026-08-07T05:07:39.756787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:39.761555Z","title":"Scaling laws for downstream task performance in machine translation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.761555Z"},"links":{"citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:b84b9631aac063fa95935a67e0119ee5404b2b2f7dc240283107fb87340b6796","observation_id":"76fd424c-0c4b-41c9-8969-76a406233349","resolution":{"observed_at":"2026-08-07T05:07:39.761555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02095","last_updated":"2021-10-05T14:49:00Z","snapshot_observed_at":"2026-08-09T20:46:56.544929Z","submitted_at":"2021-10-05T14:49:00Z","title":"Exploring the Limits of Large Scale Pre-training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02095","snapshot_observed_at":"2026-08-07T05:07:39.765677Z","title":"Exploring the limits of large scale pre-training,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.765677Z"},"links":{"cited_paper":"/paper/2110.02095","citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:d8681f8da9f9a2475333a6267d50ab7b699b6a98659cadd430886bb5cd777420","observation_id":"24a0ee2a-be06-4e0c-ab17-dac540d80973","resolution":{"observed_at":"2026-08-07T05:07:39.765677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03201","last_updated":"2024-07-28T15:54:10Z","snapshot_observed_at":"2026-08-09T23:49:53.425048Z","submitted_at":"2023-07-05T15:32:21Z","title":"Scaling Laws Do Not Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03201","snapshot_observed_at":"2026-08-07T05:07:39.769818Z","title":"Scaling laws do not scale,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.769818Z"},"links":{"cited_paper":"/paper/2307.03201","citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:77ecac978703b922def570e05a0d5d2fc26ba431d00e542c39003307e1c5cdc9","observation_id":"0065568d-23ea-46ab-955f-c9b2bee4b5c9","resolution":{"observed_at":"2026-08-07T05:07:39.769818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:39.773993Z","title":"Not-just-scaling laws: Towards a better understanding of the downstream impact of language model design decisions,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.773993Z"},"links":{"citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:ff69d30bc2f8945048905680b5df5475abe66723cb67a2040a6d4211710291f5","observation_id":"663ecb2d-e843-4e8e-8586-d528424257a7","resolution":{"observed_at":"2026-08-07T05:07:39.773993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.14199","last_updated":"2022-10-25T17:45:36Z","snapshot_observed_at":"2026-07-06T14:10:20.983444Z","submitted_at":"2022-10-25T17:45:36Z","title":"Same Pre-training Loss, Better Downstream: Implicit Bias Matters for Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.14199","snapshot_observed_at":"2026-08-07T05:07:39.778229Z","title":"Same pre-training loss, better downstream: Implicit bias matters for language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.778229Z"},"links":{"cited_paper":"/paper/2210.14199","citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:f53714356325dc2a171c2ca4b9298afb66f5f83c8873b151b1be7ee78e1a332e","observation_id":"798b2385-8575-4476-9590-01cbf7243f93","resolution":{"observed_at":"2026-08-07T05:07:39.778229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19206","last_updated":"2025-03-28T02:10:05Z","snapshot_observed_at":"2026-08-07T16:39:47.680195Z","submitted_at":"2025-03-24T23:11:56Z","title":"Overtrained Language Models Are Harder to Fine-Tune","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19206","snapshot_observed_at":"2026-08-07T05:07:39.782404Z","title":"Overtrained language models are harder to fine-tune,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.782404Z"},"links":{"cited_paper":"/paper/2503.19206","citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:6b5d9dda42015cb45f87d2320feee5bf0b1e7a2e08d61c539ab8429b5af2e86d","observation_id":"29406675-cb2b-4863-b3dd-2c3dd95f3e92","resolution":{"observed_at":"2026-08-07T05:07:39.782404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:39.786753Z","title":"Rethinking fine-tuning when scaling test-time compute: Limiting confidence improves mathematical reasoning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.786753Z"},"links":{"citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:132601f2435cdfa3d800d8de8bb8c7bdca24cc78d506e41ef59a9af70a36f099","observation_id":"4638aa3f-b743-452f-b280-1e9c4233a83c","resolution":{"observed_at":"2026-08-07T05:07:39.786753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.07958","last_updated":"2022-05-08T02:43:02Z","snapshot_observed_at":"2026-08-03T16:26:48.747700Z","submitted_at":"2021-09-08T17:15:27Z","title":"TruthfulQA: Measuring How Models Mimic Human Falsehoods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.07958","snapshot_observed_at":"2026-08-07T05:07:39.791105Z","title":"TruthfulQA: Measuring how models mimic human falsehoods,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.791105Z"},"links":{"cited_paper":"/paper/2109.07958","citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:ce15c1363050f1015cde62eabd3639b3c00ad01d3e7506ec2263de0d6515a6b3","observation_id":"e9dd4514-ab59-4454-848f-e22edde220ed","resolution":{"observed_at":"2026-08-07T05:07:39.791105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.08193","last_updated":"2022-03-16T01:35:45Z","snapshot_observed_at":"2026-07-06T11:58:21.596920Z","submitted_at":"2021-10-15T16:43:46Z","title":"BBQ: A Hand-Built Bias Benchmark for Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.08193","snapshot_observed_at":"2026-08-07T05:07:39.795184Z","title":"BBQ: A hand-built bias benchmark for question answering,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.795184Z"},"links":{"cited_paper":"/paper/2110.08193","citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:f1cf2e4227ed2558466403a4a03fb339bc13eb4dd9017afa110d553f688f69e9","observation_id":"33d1bc75-12dc-4f7f-984d-dfbfd9f856a9","resolution":{"observed_at":"2026-08-07T05:07:39.795184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.02011","last_updated":"2023-05-24T06:55:50Z","snapshot_observed_at":"2026-08-07T09:09:12.525940Z","submitted_at":"2022-11-03T17:26:44Z","title":"Inverse scaling can become U-shaped","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.02011","snapshot_observed_at":"2026-08-07T05:07:39.799434Z","title":"Inverse scaling can become U-shaped,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.799434Z"},"links":{"cited_paper":"/paper/2211.02011","citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:b11588c6cf93266fb6f9c2421fe24fd2c7a14fb8ae5d89bbd65a2c5715220449","observation_id":"50259960-870e-45ad-b591-0b717961a115","resolution":{"observed_at":"2026-08-07T05:07:39.799434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-07T05:07:39.803725Z","title":"s1: Simple test-time scaling,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.803725Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:cdd7b756eb2af0ae3bbd747bd677de4511e7fa452ab5504e14583492fe80a332","observation_id":"b52716c6-d685-48ae-a9a6-3271f62f6f1d","resolution":{"observed_at":"2026-08-07T05:07:39.803725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20571","last_updated":"2025-10-24T10:02:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-29T09:24:30Z","title":"Reinforcement Learning for Reasoning in Large Language Models with One Training Example","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20571","snapshot_observed_at":"2026-08-07T05:07:39.807957Z","title":"Reinforcement learning for reasoning in large language models with one training example,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.807957Z"},"links":{"cited_paper":"/paper/2504.20571","citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:a39e91334fb71867fec1a892835f4697f5edb33145ba28b56b42b837389c866d","observation_id":"5ad86b0f-93bd-4328-8700-4bce37b0ea1c","resolution":{"observed_at":"2026-08-07T05:07:39.807957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11916","last_updated":"2023-01-29T05:14:17Z","snapshot_observed_at":"2026-08-07T04:02:08.445660Z","submitted_at":"2022-05-24T09:22:26Z","title":"Large Language Models are Zero-Shot Reasoners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.11916","snapshot_observed_at":"2026-08-07T05:07:39.812191Z","title":"Large language models are zero-shot reasoners,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.812191Z"},"links":{"cited_paper":"/paper/2205.11916","citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:0e3a05c720716251e41f5a17da34e304c302d9e7c1362a4ddf8c8f31728f9dc8","observation_id":"5cbeb825-46fa-49b6-809b-3a8ec04067d0","resolution":{"observed_at":"2026-08-07T05:07:39.812191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09261","last_updated":"2022-10-17T17:08:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-17T17:08:26Z","title":"Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09261","snapshot_observed_at":"2026-08-07T05:07:39.815981Z","title":"Challenging BIG-Bench tasks and whether chain-of-thought can solve them,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.815981Z"},"links":{"cited_paper":"/paper/2210.09261","citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:552eb9a6d10b175b69436d6510dfc9be684b0f2861d66a6a15d5df9bbf4601e0","observation_id":"2160b047-c53e-483c-8455-5b6271a68dcb","resolution":{"observed_at":"2026-08-07T05:07:39.815981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03268","last_updated":"2024-06-20T18:46:06Z","snapshot_observed_at":"2026-08-08T02:10:52.104600Z","submitted_at":"2024-02-05T18:25:51Z","title":"Understanding Reasoning Ability of Language Models From the Perspective of Reasoning Paths Aggregation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03268","snapshot_observed_at":"2026-08-07T05:07:39.820330Z","title":"Understanding reasoning ability of language models from the perspective of reasoning paths aggregation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.820330Z"},"links":{"cited_paper":"/paper/2402.03268","citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:25e1e05c5c0a1ca3e4c682be377c8fa8d22616c7137d8cb6367fdc53bfd2866f","observation_id":"6eb5c544-c2dc-4356-ae67-c3edea4480a2","resolution":{"observed_at":"2026-08-07T05:07:39.820330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:39.824523Z","title":"Sequence to sequence learning with neural networks: What a decade,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.824523Z"},"links":{"citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:0756c0b712242bd1846125a8f61752a0241c3c8146ffb33b906b511c5ae39c1e","observation_id":"395dad7c-5bf2-4692-9418-3263c1e2e7c9","resolution":{"observed_at":"2026-08-07T05:07:39.824523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:39.828440Z","title":"AI doom from an LLM-plateau-ist perspective,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.828440Z"},"links":{"citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:d44e379bb014674f76a5b543777414d50ca9564b1e3c01e439c635957d59fac3","observation_id":"43d03769-8801-4aad-8193-17701a25af25","resolution":{"observed_at":"2026-08-07T05:07:39.828440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:39.832462Z","title":"The first wave of AI innovation is over. here’s what comes next,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.832462Z"},"links":{"citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:c1a0828feab4be80f6b1e99fd576f9b9781bd5bb27432b1d5ceadc27921f0ca5","observation_id":"dd5603ca-4f42-4b38-a44e-be59e9426aa4","resolution":{"observed_at":"2026-08-07T05:07:39.832462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:39.836408Z","title":"AI won’t plateau — if we give it time to think,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.836408Z"},"links":{"citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:29a6c64d4c6bc261f2ca7a283a5082900912f46d1343a52d7e52937a1ef582c2","observation_id":"0a53bca0-df12-4823-90de-32112cda7561","resolution":{"observed_at":"2026-08-07T05:07:39.836408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:39.840145Z","title":"Scaling data-constrained language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.840145Z"},"links":{"citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:f65e126d6b6043e46df02fd80be763e23daefc6be88fe75d5773caa22e70cfc1","observation_id":"22f4293a-5b65-424e-ba50-474d1949f1d5","resolution":{"observed_at":"2026-08-07T05:07:39.840145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07177","last_updated":"2024-04-10T17:27:54Z","snapshot_observed_at":"2026-07-06T17:58:25.894552Z","submitted_at":"2024-04-10T17:27:54Z","title":"Scaling Laws for Data Filtering -- Data Curation cannot be Compute Agnostic","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07177","snapshot_observed_at":"2026-08-07T05:07:39.844389Z","title":"Scaling laws for data filtering – data curation cannot be compute agnostic,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.844389Z"},"links":{"cited_paper":"/paper/2404.07177","citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:94810f1c83f23cffedb06d2570f0a1938526c15a18e24fb5c52b190d92a36633","observation_id":"023ee840-7c37-4322-992c-200a388fecf4","resolution":{"observed_at":"2026-08-07T05:07:39.844389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21015","last_updated":"2025-02-07T23:27:07Z","snapshot_observed_at":"2026-08-08T03:33:50.673927Z","submitted_at":"2024-05-31T17:04:18Z","title":"The rising costs of training frontier AI models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21015","snapshot_observed_at":"2026-08-07T05:07:39.848494Z","title":"The rising costs of training frontier AI models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.848494Z"},"links":{"cited_paper":"/paper/2405.21015","citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:7e155df00c015c5046302931bff98a741615a6da6403955227487ff24b11a8a3","observation_id":"c6de41cc-bec8-40c6-bcd7-1aface91964a","resolution":{"observed_at":"2026-08-07T05:07:39.848494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04388","last_updated":"2023-12-09T21:25:02Z","snapshot_observed_at":"2026-08-02T07:12:38.105035Z","submitted_at":"2023-05-07T22:44:25Z","title":"Language Models Don't Always Say What They Think: Unfaithful Explanations in Chain-of-Thought Prompting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04388","snapshot_observed_at":"2026-08-07T05:07:39.852434Z","title":"Language models don’t always say what they think: Unfaithful explanations in chain-of-thought prompting,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.852434Z"},"links":{"cited_paper":"/paper/2305.04388","citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:23536a4d063266312330f22bfe7539b690b8e5d2ec441cb12672731498953f81","observation_id":"2fbe18fe-d46e-40fe-be04-734db104bfbf","resolution":{"observed_at":"2026-08-07T05:07:39.852434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.01240","last_updated":"2023-03-02T03:54:28Z","snapshot_observed_at":"2026-07-06T13:59:15.998573Z","submitted_at":"2022-10-03T21:34:32Z","title":"Language Models Are Greedy Reasoners: A Systematic Formal Analysis of Chain-of-Thought","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.01240","snapshot_observed_at":"2026-08-07T05:07:39.856507Z","title":"Language models are greedy reasoners: A systematic formal analysis of chain-of-thought,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.856507Z"},"links":{"cited_paper":"/paper/2210.01240","citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:8dc602f08c2dd5617d5945621ccbb20b77af62840b46f284a3108902c196de52","observation_id":"8a60c330-fc02-4424-aa94-100361efb22b","resolution":{"observed_at":"2026-08-07T05:07:39.856507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-07T05:07:39.860710Z","title":"Efficient streaming language models with attention sinks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.860710Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:95f3b480abd59b2071fe03c055d305833418026d32e885c4902475e7b57c3b94","observation_id":"caa6192b-6ee1-41e8-a587-77f1a904d156","resolution":{"observed_at":"2026-08-07T05:07:39.860710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11154","last_updated":"2025-03-14T07:46:33Z","snapshot_observed_at":"2026-08-07T17:04:48.119124Z","submitted_at":"2025-03-14T07:46:33Z","title":"Don't Take Things Out of Context: Attention Intervention for Enhancing Chain-of-Thought Reasoning in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11154","snapshot_observed_at":"2026-08-07T05:07:39.864758Z","title":"Don’t take things out of context: Attention intervention for enhancing chain-of-thought reasoning in large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.864758Z"},"links":{"cited_paper":"/paper/2503.11154","citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:698c57d728413fe6ae86b5784bb4820f19d9fa8bb861994dab4c92c1f3b739bb","observation_id":"71ffee8b-c47a-4cfb-a28b-3ff54ef3c5ad","resolution":{"observed_at":"2026-08-07T05:07:39.864758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:39.868843Z","title":"The curse of CoT: On the limitations of chain-of-thought in in-context learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.868843Z"},"links":{"citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:e721484c421c068a22b11e9f76c0b41dd54b0b4970b24c6ef7fd399b2861b888","observation_id":"489eb03e-4f65-440f-b1aa-4fd2ce6adefb","resolution":{"observed_at":"2026-08-07T05:07:39.868843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07266","last_updated":"2025-05-27T02:56:52Z","snapshot_observed_at":"2026-08-08T13:14:58.702776Z","submitted_at":"2025-02-11T05:28:59Z","title":"When More is Less: Understanding Chain-of-Thought Length in LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07266","snapshot_observed_at":"2026-08-07T05:07:39.872688Z","title":"When more is less: Understanding chain-of-thought length in LLMs,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.872688Z"},"links":{"cited_paper":"/paper/2502.07266","citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:a59e496f8d72d740ee6fd794426d6b35a8b9b5bfc441eb7680ec4897a32752c6","observation_id":"634eb7db-c73e-4d8a-92e9-9d8456bc662d","resolution":{"observed_at":"2026-08-07T05:07:39.872688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-05T13:11:04.104454Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-07T05:07:39.876992Z","title":"Let’s verify step by step,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.876992Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:e1e4e23c8963e45a09effec10648db319bac55950aab9c82709b5c80e655ef42","observation_id":"79cc6bdc-7dea-481c-bbe1-42664f1d2e42","resolution":{"observed_at":"2026-08-07T05:07:39.876992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T05:07:39.880977Z","title":"Training verifiers to solve math word problems,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.880977Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:ce4abb62921d3bbf364fad29aaa0d19bdab38009a9bdfd76721d068e3424a5cd","observation_id":"a884701b-03ed-4fe4-9a68-c650ccb5ee85","resolution":{"observed_at":"2026-08-07T05:07:39.880977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:39.884774Z","title":"When to solve, when to verify: Compute-optimal problem solving and generative verification for LLM reasoning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.884774Z"},"links":{"citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:b91ee5bfe3fa00af0d6b811bde69e3994822bc919d6b7ae7d28377ce1024d00e","observation_id":"e262f215-9b8c-4ac1-88db-db32dce362a4","resolution":{"observed_at":"2026-08-07T05:07:39.884774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-07T05:07:39.888499Z","title":"Self-consistency improves chain of thought reasoning in language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.888499Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:670e0edfa6885a89835be8a05cdad5bb60423e47b34af1504108ecdbdc5a30ce","observation_id":"f052279f-279d-41c7-83a1-2efabc1fa6e6","resolution":{"observed_at":"2026-08-07T05:07:39.888499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:39.892256Z","title":"Solving quantitative reasoning problems with language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.892256Z"},"links":{"citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:5bc6c876eae0cc1f552a198ccc39a652526d793341c889003b15babd38f7901d","observation_id":"bf2247ff-05b5-4065-9db4-a24a122bd5a1","resolution":{"observed_at":"2026-08-07T05:07:39.892256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17651","last_updated":"2023-05-25T19:13:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-30T18:30:01Z","title":"Self-Refine: Iterative Refinement with Self-Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17651","snapshot_observed_at":"2026-08-07T05:07:39.895889Z","title":"Self-Refine: Iterative refinement with self-feedback,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.895889Z"},"links":{"cited_paper":"/paper/2303.17651","citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:c1aa139e8b23aecd8fdfbe43bff13a981dbd5d64a89022c51661a4baf3f1c84b","observation_id":"055e7f58-e5b6-429d-bf48-6546b15f8b3d","resolution":{"observed_at":"2026-08-07T05:07:39.895889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:39.899967Z","title":"Cost-of-Pass: An economic framework for evaluating language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.899967Z"},"links":{"citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:e58a83cf7f8b9610adf35c3f64f934e8ab1f3c56c1e32e8a99136a472bf330bc","observation_id":"bf4a5fc3-212a-4143-b14f-e9186f1fb833","resolution":{"observed_at":"2026-08-07T05:07:39.899967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.01293","last_updated":"2021-02-02T04:07:38Z","snapshot_observed_at":"2026-08-01T22:46:19.170916Z","submitted_at":"2021-02-02T04:07:38Z","title":"Scaling Laws for Transfer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.01293","snapshot_observed_at":"2026-08-07T05:07:39.903603Z","title":"Scaling laws for transfer,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.903603Z"},"links":{"cited_paper":"/paper/2102.01293","citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:f99931314ec9ad88d8981062a8d7f6669590b544501211d98881681c8ee3be51","observation_id":"2aa08e6c-7e5a-4790-be4b-c704137801f3","resolution":{"observed_at":"2026-08-07T05:07:39.903603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:07:39.908059Z","title":"Reproducible scaling laws for contrastive language-image learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T05:07:39.908059Z"},"links":{"citing_paper":"/paper/2507.00004"},"observation_digest":"sha256:155ee3d9485f15f76ba8d759667f40d41aa4b942592fb09a2ae39c6661eeb385","observation_id":"45d542b2-0c07-4f17-ba0f-eb4f23d3ebc4","resolution":{"observed_at":"2026-08-07T05:07:39.908059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.00004","last_updated":"2025-07-10T17:08:40Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T16:04:02.052629Z","submitted_at":"2025-06-10T14:47:48Z","title":"A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":217},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 100 of 217 outbound references and 1 inbound Pith citation observation for arXiv:2507.00004."}