{"as_of":"2026-08-14T06:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9d33b0a42a105ca5c8db0f4d3e1fcd77311ca3e9031adfb91293254c99a527d7","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T13:41:46.254216Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.16035/citation-record","integrity":"/paper/2411.16035/integrity","json":"/paper/2411.16035/citation-record.json","paper":"/paper/2411.16035"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.11018","last_updated":"2024-10-17T17:45:09Z","snapshot_observed_at":"2026-08-13T00:28:39.359814Z","submitted_at":"2024-04-17T02:49:26Z","title":"Many-Shot In-Context Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11018","snapshot_observed_at":"2026-08-12T13:41:45.965971Z","title":"Zhang, Bernd Bohnet, Luis Rosias, Stephanie Chan, Biao Zhang, Ankesh Anand, Zaheer Abbas, Azade Nova, John D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:45.965971Z"},"links":{"cited_paper":"/paper/2404.11018","citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:6e73de753d97a8c604f10364cb0560f7343a3ba82757f8ed5c9b15201207c1bd","observation_id":"34b427c7-d979-44dd-9e22-84af62f7b809","resolution":{"observed_at":"2026-08-12T13:41:45.965971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:41:47.155823Z","title":"Scaling laws for generative mixed-modal language models, 2023","venue":null,"work_id":"732c00ac-7f15-47dd-80fa-96859e424ea2","year":2023},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:45.972438Z"},"links":{"citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:c65aae90284d0521a3c5705b2ad86d96bdd1ca898856b5f3146aaa7f762459f7","observation_id":"c7867831-24b2-4bcc-b60b-1bab32606976","resolution":{"observed_at":"2026-08-12T13:41:47.160971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:41:47.140291Z","title":"Dai, Anja Hauth, Katie Millican, David Silver, Slav Petrov, Melvin Johnson, Ioannis Antonoglou, Julian Schrittwieser, et al","venue":null,"work_id":"b1d19630-c703-499e-af39-af2a97171f8d","year":2023},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:45.977474Z"},"links":{"citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:083bb52fa03c33e74e2517e0060ff958ac252921e0809cfeddfebc9e866cd104","observation_id":"0cf24f91-bdd7-489f-914a-6cd8eac2dcb7","resolution":{"observed_at":"2026-08-12T13:41:47.145463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-12T13:41:45.982526Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:45.982526Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:df7a3cb5233a73acc505319b51ee0e033748e52ee7500d11e6ab2a3c564fc25a","observation_id":"8bdcc17c-1756-49fd-b3e0-98dcec4f223b","resolution":{"observed_at":"2026-08-12T13:41:45.982526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04927","last_updated":"2023-12-08T09:44:25Z","snapshot_observed_at":"2026-08-13T05:07:21.762970Z","submitted_at":"2023-12-08T09:44:25Z","title":"Zoology: Measuring and Improving Recall in Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04927","snapshot_observed_at":"2026-08-12T13:41:45.987890Z","title":"Zoology: Measuring and improving recall in efficient language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:45.987890Z"},"links":{"cited_paper":"/paper/2312.04927","citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:2055e42d8582174b537174d2e45b030672056f41c76fdf449efd678b25a1ecb1","observation_id":"2c1a7b28-08f5-4adb-9af4-79dac01906ae","resolution":{"observed_at":"2026-08-12T13:41:45.987890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-12T13:41:45.992980Z","title":"Program synthesis with large language models, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:45.992980Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:330f3db4e4c92282f0ca139321d5bbd3b511fc29d24a0855154684c841cf583e","observation_id":"d775fd2b-0baa-48c2-86f0-40f2194cf5aa","resolution":{"observed_at":"2026-08-12T13:41:45.992980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:41:47.124696Z","title":"Emergent abilities and grokking: Fundamental, mirage, or both?, 2023","venue":null,"work_id":"4ce28620-5bbf-4bae-9fb9-fedbbb11596a","year":2023},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:45.998468Z"},"links":{"citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:eb4171922f5c1d01ff6c30da8b4dc7a50cb8d33ea009faf1912986997185120b","observation_id":"9bdaeabc-85fb-496a-92b0-d2c47d0da5cc","resolution":{"observed_at":"2026-08-12T13:41:47.129582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17688","last_updated":"2024-05-22T16:19:38Z","snapshot_observed_at":"2026-08-13T05:39:35.646615Z","submitted_at":"2023-10-26T17:59:06Z","title":"Managing extreme AI risks amid rapid progress","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17688","snapshot_observed_at":"2026-08-12T13:41:46.003072Z","title":"Managing ai risks in an era of rapid progress","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:46.003072Z"},"links":{"cited_paper":"/paper/2310.17688","citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:e6c88c9a8362367327f273370612b1e7081980de05e5e73614d9a3aaed331886","observation_id":"c769af3d-4170-451c-938c-962f99453c2f","resolution":{"observed_at":"2026-08-12T13:41:46.003072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03476","last_updated":"2024-06-05T17:29:15Z","snapshot_observed_at":"2026-08-13T01:07:48.611418Z","submitted_at":"2024-06-05T17:29:15Z","title":"Does your data spark joy? Performance gains from domain upsampling at the end of training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03476","snapshot_observed_at":"2026-08-12T13:41:46.008379Z","title":"Larsen, Sean Owen, and Jonathan Frankle","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:46.008379Z"},"links":{"cited_paper":"/paper/2406.03476","citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:ffe947888077c4c19686291fe79a142d4a028e64db25caecc4d02467738936ba","observation_id":"f125af7e-c2cb-4f1d-a55a-23303004c79e","resolution":{"observed_at":"2026-08-12T13:41:46.008379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:41:46.014855Z","title":"JAX : composable transformations of P ython+ N um P y programs, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:46.014855Z"},"links":{"citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:acd4581507b562dfc19d77c53f5bd4171dc6b20e1259bad9aa0184c573595d7d","observation_id":"108a6f13-21b5-4d0d-a389-5b93dca50e05","resolution":{"observed_at":"2026-08-12T13:41:46.014855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:41:47.100103Z","title":"Broken neural scaling laws, 2023","venue":null,"work_id":"c8d79cf1-74cb-4d4a-99ab-538c86c4b535","year":2023},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:46.019423Z"},"links":{"citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:708f3706b1b408be479b242a4b309aa7b136e49be7c908603d230f65ec7bde24","observation_id":"3246946a-4d6d-493d-a462-4de00aea052b","resolution":{"observed_at":"2026-08-12T13:41:47.104718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-12T13:41:46.023929Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:46.023929Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:a630ab8b9f375cf115c08769ee29139fb4d9f5ca062b0cced17cdca61b2b4a62","observation_id":"a2deb85d-13fb-46ca-9493-253dedd131f1","resolution":{"observed_at":"2026-08-12T13:41:46.023929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-12T13:41:46.028820Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:46.028820Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:6782b798060d23bc7240ebe4c626423db0f212cb29386af76a369bf4a1a37afb","observation_id":"bc6ab49d-c021-4f46-b672-4f904ddb03e4","resolution":{"observed_at":"2026-08-12T13:41:46.028820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:41:47.085135Z","title":"Redpajama-data: An open source recipe to reproduce llama training dataset, 2023","venue":null,"work_id":"251b6da9-d993-471d-851f-d770488919f3","year":2023},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:46.033573Z"},"links":{"citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:33918ee2edcb0ec31a7703fc1ec7c5e7b16ab96399b6b45245768199f12ca160","observation_id":"a0649c6c-a796-496e-ad53-cd3b02d4502e","resolution":{"observed_at":"2026-08-12T13:41:47.090024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15796","last_updated":"2025-01-15T02:48:59Z","snapshot_observed_at":"2026-08-13T00:47:22.625052Z","submitted_at":"2024-03-23T11:03:31Z","title":"Understanding Emergent Abilities of Language Models from the Loss Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15796","snapshot_observed_at":"2026-08-12T13:41:46.037754Z","title":"Understanding emergent abilities of language models from the loss perspective, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:46.037754Z"},"links":{"cited_paper":"/paper/2403.15796","citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:3339d15732fdf69aac2ae115716e4172b5f2080a78a577169b09019d60d26d03","observation_id":"3a57637b-bf38-4e30-8a05-0ea8283a7b73","resolution":{"observed_at":"2026-08-12T13:41:46.037754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:41:47.070003Z","title":"Dimakis, Gabriel Ilharco, Shuran Song, Thomas Kollar, Yair Carmon, Achal Dave, Reinhard Heckel, Niklas Muennighoff, and Ludwig Schmidt","venue":null,"work_id":"1071b782-0101-47dc-af1c-49940fef8c9b","year":2024},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:46.041795Z"},"links":{"citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:d4e1a1999bd70de27d0954b3989a8997847fd1390e53cbf746e7e4dcb4ad0bf8","observation_id":"811e3b5e-fe73-40a7-a20b-28a7d7ca4a2f","resolution":{"observed_at":"2026-08-12T13:41:47.074811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:41:46.045718Z","title":"Openllama: An open reproduction of llama, May 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:46.045718Z"},"links":{"citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:a4c4c5cff32d15e8ce4afedd35e547faed7a1b1734a592797fb2cefcc35fd498","observation_id":"fe536083-937f-4ded-b8cc-a6848bdce38a","resolution":{"observed_at":"2026-08-12T13:41:46.045718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:41:47.044160Z","title":"Scalax: scaling utilities for jax, 2024","venue":null,"work_id":"e8f926bd-58c9-4b8d-b5e3-2c0e61018a59","year":2024},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:46.049973Z"},"links":{"citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:d5e33a2af30283767f947af21dd6231682b73c769f38cdf600f4ff630cb06c5a","observation_id":"d25f746d-457c-4b9c-8190-5f986b7df5df","resolution":{"observed_at":"2026-08-12T13:41:47.049617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-12T13:41:46.053646Z","title":"Mamba: Linear-time sequence modeling with selective state spaces","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:46.053646Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:b21267a30a69263e13c6b933f53ddb453d033a895b41a6aea9e325f70c0cd924","observation_id":"8d26cf8f-c2fa-4613-9b34-3ef6a28cb268","resolution":{"observed_at":"2026-08-12T13:41:46.053646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15717","last_updated":"2023-05-25T05:00:12Z","snapshot_observed_at":"2026-08-12T18:39:37.539896Z","submitted_at":"2023-05-25T05:00:12Z","title":"The False Promise of Imitating Proprietary LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15717","snapshot_observed_at":"2026-08-12T13:41:46.057754Z","title":"The false promise of imitating proprietary llms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:46.057754Z"},"links":{"cited_paper":"/paper/2305.15717","citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:a5cff8c9cb4e476b427685f1e8a83af0fa9779de64d45efc13ad02724c705736","observation_id":"135e0a4b-9270-44ee-99d1-482505704b16","resolution":{"observed_at":"2026-08-12T13:41:46.057754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:41:46.062341Z","title":"Measuring massive multitask language understanding, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:46.062341Z"},"links":{"citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:c75788e8cec2448bc532e665cfa5ff8c87bc2f700b0bfa35a4543b367aabd409","observation_id":"c8a7c8c4-cc0d-46b6-a9d1-17a1c4f0103d","resolution":{"observed_at":"2026-08-12T13:41:46.062341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12001","last_updated":"2023-10-09T22:57:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-21T03:35:06Z","title":"An Overview of Catastrophic AI Risks","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12001","snapshot_observed_at":"2026-08-12T13:41:46.066786Z","title":"An overview of catastrophic ai risks, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:46.066786Z"},"links":{"cited_paper":"/paper/2306.12001","citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:7ba7dde186463a573520c910bbfec918129d8d4146d4b9b2467163942884b6b6","observation_id":"6137db7a-3b60-49da-adca-7e36a34382d0","resolution":{"observed_at":"2026-08-12T13:41:46.066786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.14701","last_updated":"2020-11-06T04:16:36Z","snapshot_observed_at":"2026-07-06T10:09:17.078776Z","submitted_at":"2020-10-28T02:17:24Z","title":"Scaling Laws for Autoregressive Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.14701","snapshot_observed_at":"2026-08-12T13:41:46.071559Z","title":"Scaling laws for autoregressive generative modeling","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:46.071559Z"},"links":{"cited_paper":"/paper/2010.14701","citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:d88932fd78a51e477b8e3c05954f7d62fabcd570eadbb70a24e1f720323b560b","observation_id":"02daedf1-52a2-420b-9b5a-1b4d56894c78","resolution":{"observed_at":"2026-08-12T13:41:46.071559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.01293","last_updated":"2021-02-02T04:07:38Z","snapshot_observed_at":"2026-08-01T22:46:19.170916Z","submitted_at":"2021-02-02T04:07:38Z","title":"Scaling Laws for Transfer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.01293","snapshot_observed_at":"2026-08-12T13:41:46.076596Z","title":"Scaling laws for transfer","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:46.076596Z"},"links":{"cited_paper":"/paper/2102.01293","citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:a0c2bf1e94f3ad003d0d06e99d87e70be14e9d793e4ebc11a1bb7b87f3d4218f","observation_id":"5f1bcd97-1a3b-41a9-bebd-9ada0aab95e0","resolution":{"observed_at":"2026-08-12T13:41:46.076596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:41:46.081425Z","title":"The no-u-turn sampler: adaptively setting path lengths in hamiltonian monte carlo","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:46.081425Z"},"links":{"citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:06622b43d96049696492240847dc5b5e5b3bb688d08b00d2fc0b962d2d1029cf","observation_id":"9a264839-d387-4dde-a2d1-29cef7ffbb1f","resolution":{"observed_at":"2026-08-12T13:41:46.081425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:41:46.086105Z","title":"Rae, Oriol Vinyals, and Laurent Sifre","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:46.086105Z"},"links":{"citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:8a070f68186c926551bc486d9706021a205db37f029bcd46b723f5936bcbf6b6","observation_id":"ca2b7058-a325-4c7e-ba58-ed2d867ac350","resolution":{"observed_at":"2026-08-12T13:41:46.086105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03262","last_updated":"2024-04-17T13:43:59Z","snapshot_observed_at":"2026-08-13T16:57:24.122036Z","submitted_at":"2023-10-05T02:35:00Z","title":"Predicting Emergent Abilities with Infinite Resolution Evaluation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03262","snapshot_observed_at":"2026-08-12T13:41:46.090662Z","title":"Predicting emergent abilities with infinite resolution evaluation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:46.090662Z"},"links":{"cited_paper":"/paper/2310.03262","citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:91cda037805485864122a06d2cbd3da6a665a7486c9edaf07d66161b508e09a0","observation_id":"11019e95-ddbe-4a2b-be7a-53e65d49abc4","resolution":{"observed_at":"2026-08-12T13:41:46.090662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09937","last_updated":"2024-08-19T13:55:42Z","snapshot_observed_at":"2026-08-13T00:29:44.000863Z","submitted_at":"2024-04-15T17:03:41Z","title":"Compression Represents Intelligence Linearly","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09937","snapshot_observed_at":"2026-08-12T13:41:46.095518Z","title":"Compression represents intelligence linearly, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:46.095518Z"},"links":{"cited_paper":"/paper/2404.09937","citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:fd339e1a0c616c3619050ea6c43a7c8c37330a6b0dc0f028c1cc88922ced2b96","observation_id":"97cb7e55-a901-4691-b164-15a24fb8b279","resolution":{"observed_at":"2026-08-12T13:41:46.095518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:41:46.100058Z","title":"Scaling laws for downstream task performance of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:46.100058Z"},"links":{"citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:055968389c24ea088065d13e9fc87a67ef5edd3d8cade8a5d67a90e91b2b3b94","observation_id":"d3a9e5b6-40a4-4275-9dc4-eb1faa5db8eb","resolution":{"observed_at":"2026-08-12T13:41:46.100058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2022.findings-emnlp.544","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:41:46.296845Z","title":"Scaling laws under the microscope: Predicting transformer performance from small scale experiments","venue":null,"work_id":"0e011da0-3825-4580-a5cc-de44c3f7e35e","year":2022},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:46.104839Z"},"links":{"citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:0ffa17b7b59c19528dc765015799594066530d0ac51a0652abb2a48d1a3c9713","observation_id":"ff26e04d-d338-4150-9cd5-8c0cc49b729f","resolution":{"observed_at":"2026-08-12T13:41:46.302863Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:41:46.109591Z","title":"Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, and Dario Amodei","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:46.109591Z"},"links":{"citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:b6d40705d1f8767108e7ad80c1d9a6cfcf2fe923d46e71294f0858f135c4a78e","observation_id":"787d0171-74af-4ad8-bf88-46834009ad46","resolution":{"observed_at":"2026-08-12T13:41:46.109591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:41:46.114322Z","title":"Scaling laws for fine-grained mixture of experts, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:46.114322Z"},"links":{"citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:6a2ff7df995cc4bd503a05f4e0bc52ae65f35b421e94736a3317a1ba328afe32","observation_id":"e02d7550-b495-4f0e-a036-df8cf8ed6c5d","resolution":{"observed_at":"2026-08-12T13:41:46.114322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:41:46.118767Z","title":"Starcoder: may the source be with you! 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:46.118767Z"},"links":{"citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:2111ab405aaaae5e532ccbbda5e3155853af1c4dfd4c8d0765f482000e90ba12","observation_id":"0ef47036-2955-4f45-a12a-09bfe1572ee8","resolution":{"observed_at":"2026-08-12T13:41:46.118767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00190","last_updated":"2021-01-01T08:00:36Z","snapshot_observed_at":"2026-08-12T12:37:28.207761Z","submitted_at":"2021-01-01T08:00:36Z","title":"Prefix-Tuning: Optimizing Continuous Prompts for Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00190","snapshot_observed_at":"2026-08-12T13:41:46.123561Z","title":"Prefix-tuning: Optimizing continuous prompts for generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:46.123561Z"},"links":{"cited_paper":"/paper/2101.00190","citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:21ed69e1743a3680f3afb4caefa1fc8f2483d05a956eb782eff306b3b71f24ee","observation_id":"b3e3d0a9-620f-4da1-8b29-dfa44169a67e","resolution":{"observed_at":"2026-08-12T13:41:46.123561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09458","last_updated":"2023-07-24T08:32:40Z","snapshot_observed_at":"2026-08-13T10:53:08.817635Z","submitted_at":"2023-07-18T17:39:04Z","title":"Does Circuit Analysis Interpretability Scale? Evidence from Multiple Choice Capabilities in Chinchilla","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09458","snapshot_observed_at":"2026-08-12T13:41:46.127986Z","title":"Does circuit analysis interpretability scale? evidence from multiple choice capabilities in chinchilla, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:46.127986Z"},"links":{"cited_paper":"/paper/2307.09458","citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:dda88bc7fc8fa042f790121d2313a38a3db8a0d76a44f465545b6a47dcc0270d","observation_id":"43d13c81-2043-4e55-b0cc-ba2e7695e138","resolution":{"observed_at":"2026-08-12T13:41:46.127986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:41:46.132683Z","title":"Rush, Boaz Barak, Teven Le Scao, Aleksandra Piktus, Nouamane Tazi, Sampo Pyysalo, Thomas Wolf, and Colin Raffel","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:46.132683Z"},"links":{"citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:f5b572e82ab673e4d1c416fa07b0130622c1ddd0d7d18bc9783e1ee5ad501462","observation_id":"d66559c1-121c-4393-b3c9-eb2821b2443d","resolution":{"observed_at":"2026-08-12T13:41:46.132683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:41:46.136957Z","title":"Scaling data-constrained language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:46.136957Z"},"links":{"citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:5fd0cab5a9c2ef783b83ea20cf8bef6c2ad4a53080155911042c7fcdcc7c83c1","observation_id":"0d4a2e13-5f6e-46c9-8854-b6c0fcd8287a","resolution":{"observed_at":"2026-08-12T13:41:46.136957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:41:46.141428Z","title":"In-context learning and induction heads","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:46.141428Z"},"links":{"citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:ce2cb157e091f7bd6a76199494785d2f1d515a5fa06701f6901ff99ca68eec23","observation_id":"e55ee2b1-e87f-48a6-b362-71fde885c6b1","resolution":{"observed_at":"2026-08-12T13:41:46.141428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:41:46.942422Z","title":"GPT-4 technical report, 2024","venue":null,"work_id":"ffeed59c-abbf-4eb0-89a8-d83f3f75f12b","year":2024},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:46.146197Z"},"links":{"citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:447f08c86b50cd9fde4ac040925ffb612bdebaa24079571462ce590969ec308e","observation_id":"a092fa50-d1b0-4fe4-ab40-9565a7445e73","resolution":{"observed_at":"2026-08-12T13:41:46.947634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04757","last_updated":"2024-01-09T17:34:30Z","snapshot_observed_at":"2026-08-13T04:45:48.084564Z","submitted_at":"2024-01-09T17:34:30Z","title":"How predictable is language model benchmark performance?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04757","snapshot_observed_at":"2026-08-12T13:41:46.150658Z","title":"How predictable is language model benchmark performance?, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:46.150658Z"},"links":{"cited_paper":"/paper/2401.04757","citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:bba785e3ccfa7951ee1de22184a351fa301789f7ec2823ecea8ae69b51fbc2b0","observation_id":"dd925cb2-8907-4699-9a2b-07d8148ed0e6","resolution":{"observed_at":"2026-08-12T13:41:46.150658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:41:46.926080Z","title":"Mark zuckerberg - llama 3, open sourcing \\ 10b models, & caesar augustus","venue":null,"work_id":"6f186081-eb44-4f5c-84b8-effa4d13a160","year":2024},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:46.154555Z"},"links":{"citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:85fa3de869b411f69562caa502c9e0fb501ba078d58c980012d8cca254c9caa4","observation_id":"6fc9b9d2-fcb2-4e02-b044-1ab668b818b7","resolution":{"observed_at":"2026-08-12T13:41:46.930960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01116","last_updated":"2023-06-01T20:03:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-01T20:03:56Z","title":"The RefinedWeb Dataset for Falcon LLM: Outperforming Curated Corpora with Web Data, and Web Data Only","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01116","snapshot_observed_at":"2026-08-12T13:41:46.158562Z","title":"The R efined W eb dataset for F alcon LLM : outperforming curated corpora with web data, and web data only","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:46.158562Z"},"links":{"cited_paper":"/paper/2306.01116","citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:c3ed977b4e78818bb9a84b958e55e8b7ba10099954ceb8c160c462a51a546d9e","observation_id":"14a1ad2d-0468-4e7e-ac37-a4e5fb48090e","resolution":{"observed_at":"2026-08-12T13:41:46.158562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.11554","last_updated":"2019-12-24T22:09:36Z","snapshot_observed_at":"2026-07-06T08:46:54.138798Z","submitted_at":"2019-12-24T22:09:36Z","title":"Composable Effects for Flexible and Accelerated Probabilistic Programming in NumPyro","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.11554","snapshot_observed_at":"2026-08-12T13:41:46.162628Z","title":"Composable effects for flexible and accelerated probabilistic programming in numpyro","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:46.162628Z"},"links":{"cited_paper":"/paper/1912.11554","citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:78479feb4094a9c5995166e07d6bc1d200ec05be55525748c8a415ffc6a3d080","observation_id":"1fec5bf8-afbc-4148-af84-70f969e6c9cd","resolution":{"observed_at":"2026-08-12T13:41:46.162628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-08-13T04:25:38.282910Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-12T13:41:46.168477Z","title":"Code llama: Open foundation models for code, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:46.168477Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:c43cd696b93ca88ea662bbda520e1405c47dfa94daf198228ee6de7cb3ceb6a3","observation_id":"a678f03c-5545-4a5e-abe1-63c884567898","resolution":{"observed_at":"2026-08-12T13:41:46.168477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10938","last_updated":"2024-10-01T23:38:10Z","snapshot_observed_at":"2026-08-13T00:04:55.312158Z","submitted_at":"2024-05-17T17:49:44Z","title":"Observational Scaling Laws and the Predictability of Language Model Performance","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10938","snapshot_observed_at":"2026-08-12T13:41:46.173180Z","title":"Maddison, and Tatsunori Hashimoto","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:46.173180Z"},"links":{"cited_paper":"/paper/2405.10938","citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:ba39a7e2d0f33df1f26d4b7f20460e24415038f1d9f4e5cee0f536b6c71a8841","observation_id":"fc45107e-6534-48a5-8971-9e534aa10c14","resolution":{"observed_at":"2026-08-12T13:41:46.173180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:41:46.177815Z","title":"Are emergent abilities of large language models a mirage?, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:46.177815Z"},"links":{"citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:0d215be5133521ddbd029465cd39e44320c0036443683f5ee239a39e79f0d15e","observation_id":"347eaa26-8492-4410-a809-82833ba07777","resolution":{"observed_at":"2026-08-12T13:41:46.177815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:41:46.900800Z","title":"Active learning literature survey","venue":null,"work_id":"01390e52-6ac4-4ea2-869b-026a21eff254","year":2009},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:46.182446Z"},"links":{"citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:3a10bdfe26c7b94c4c84e0b4dca579fbd8f461c57aaf54e35cda491009cf885f","observation_id":"e5275730-b464-4408-b084-1b6691976be1","resolution":{"observed_at":"2026-08-12T13:41:46.905574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15324","last_updated":"2023-09-22T18:48:42Z","snapshot_observed_at":"2026-08-13T11:34:14.941622Z","submitted_at":"2023-05-24T16:38:43Z","title":"Model evaluation for extreme risks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15324","snapshot_observed_at":"2026-08-12T13:41:46.186969Z","title":"Model evaluation for extreme risks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:46.186969Z"},"links":{"cited_paper":"/paper/2305.15324","citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:230a5c1296e2f590f9b6feb1879eaa477b9fb48bd6014107e27349d3d386fd89","observation_id":"a4db7fa9-1212-4148-b23a-0100283cd38f","resolution":{"observed_at":"2026-08-12T13:41:46.186969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:41:46.191727Z","title":"Commonsenseqa: A question answering challenge targeting commonsense knowledge, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:46.191727Z"},"links":{"citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:64cae84c856f2169c4a18c99979cc9fda19f21b80d9f675a00f5186bd7b35bc1","observation_id":"60c7a955-2b1c-4eb6-a189-75dab3117c47","resolution":{"observed_at":"2026-08-12T13:41:46.191727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.10551","last_updated":"2022-07-21T15:50:22Z","snapshot_observed_at":"2026-08-13T14:59:23.044746Z","submitted_at":"2022-07-21T15:50:22Z","title":"Scaling Laws vs Model Architectures: How does Inductive Bias Influence Scaling?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.10551","snapshot_observed_at":"2026-08-12T13:41:46.196766Z","title":"Scaling laws vs model architectures: How does inductive bias influence scaling? arXiv preprint arXiv:2207.10551, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:46.196766Z"},"links":{"cited_paper":"/paper/2207.10551","citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:62177f752c0be51424e68bd9e56647475b4fcf303874cf40a5e3ee4489cf2693","observation_id":"af491cf6-710f-405e-b125-5303224f4257","resolution":{"observed_at":"2026-08-12T13:41:46.196766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.05816","last_updated":"2025-03-10T17:56:18Z","snapshot_observed_at":"2026-08-12T22:48:25.615430Z","submitted_at":"2024-09-09T17:23:29Z","title":"Improving Pretraining Data Using Perplexity Correlations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.05816","snapshot_observed_at":"2026-08-12T13:41:46.201649Z","title":"Improving pretraining data using perplexity correlations, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:46.201649Z"},"links":{"cited_paper":"/paper/2409.05816","citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:a6d3a25a0451e23ae5e27e6e043631d088935ee674eac379efbf4c46a6ed0c5d","observation_id":"b7b5ad2f-8d97-4ddb-b2d7-b0e890848129","resolution":{"observed_at":"2026-08-12T13:41:46.201649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-12T13:41:46.206648Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:46.206648Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:2c26de6f2e0447f239188e216dc3e8a1762a4134053f54d67bc863cbd5097cb4","observation_id":"6134ecc2-51c7-4883-96e0-f0c1ea965a15","resolution":{"observed_at":"2026-08-12T13:41:46.206648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-12T13:41:46.211796Z","title":"Llama 2: Open foundation and fine-tuned chat models, 2023 b","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:46.211796Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:f621f00db2e586e156554539f30479cd8dcb91f3c18a7a5f10809d5f5e385854","observation_id":"50e6794f-4292-4e81-8ba3-343c525eb762","resolution":{"observed_at":"2026-08-12T13:41:46.211796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:41:46.216633Z","title":"GLUE : A multi-task benchmark and analysis platform for natural language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:46.216633Z"},"links":{"citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:2d0b3fe4da1b649e731e3a754b2928004af28073d05bed35afea5123d4c8179f","observation_id":"77bc24d6-c32f-4f77-adfd-d493354b734f","resolution":{"observed_at":"2026-08-12T13:41:46.216633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:41:46.874523Z","title":"Chi, Tatsunori Hashimoto, Oriol Vinyals, Percy Liang, Jeff Dean, and William Fedus","venue":null,"work_id":"a60c4cff-f369-4da4-8d3c-c91d86e61a73","year":2022},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:46.221331Z"},"links":{"citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:704a8b748d7779966a3069b6887cb94027baed2b2609e465faa3a6198c8af804","observation_id":"47f4acdf-7304-4c34-a3c5-d4bf01a34ce8","resolution":{"observed_at":"2026-08-12T13:41:46.879690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:41:46.225882Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:46.225882Z"},"links":{"citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:5fdb4f8c0bdcec39664be0729e9d837be964173d6ea478bbaf69007f902becbf","observation_id":"2c0ca1ec-6bee-447c-a509-59d58bcbfce1","resolution":{"observed_at":"2026-08-12T13:41:46.225882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09803","last_updated":"2023-05-30T03:33:27Z","snapshot_observed_at":"2026-08-13T13:18:42.131395Z","submitted_at":"2022-12-19T19:16:29Z","title":"Training Trajectories of Language Models Across Scales","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09803","snapshot_observed_at":"2026-08-12T13:41:46.230224Z","title":"Training trajectories of language models across scales, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:46.230224Z"},"links":{"cited_paper":"/paper/2212.09803","citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:d5657f003200cd1196a0ce4e3419e9fe6557eea08a0996f78f7a040cfcdf4089","observation_id":"02c817c7-1e25-4563-88a2-6c11c8826ec6","resolution":{"observed_at":"2026-08-12T13:41:46.230224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:41:46.235064Z","title":"Star: Bootstrapping reasoning with reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:46.235064Z"},"links":{"citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:b83af4ae15b773f9bbe22ab60ccb24b337bea0e557922876a79240ca3391c6e7","observation_id":"a334f3ac-e991-46f1-bdb9-22b042e9d5f4","resolution":{"observed_at":"2026-08-12T13:41:46.235064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:41:46.239766Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:46.239766Z"},"links":{"citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:66b1c8977211eeaae5adfe7e4541ad5d8ecb5e7e994a62f6f683ecee3f565ce5","observation_id":"91a1f6a0-b85b-4a5e-bb00-c14e5b359f87","resolution":{"observed_at":"2026-08-12T13:41:46.239766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:41:46.245295Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:46.245295Z"},"links":{"citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:2ab826102036b369ed62cfa4317c1baac5eef05bfa13a4518bf70b18c75fb70f","observation_id":"5c099122-094d-4bb7-9f17-b8ed8142b730","resolution":{"observed_at":"2026-08-12T13:41:46.245295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:41:46.250303Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:46.250303Z"},"links":{"citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:8b2e1a7db9be95312996e2b23712e3090b2842e81ee9f72cb5dd7d44d7bef161","observation_id":"366a5b0c-29f0-4d1f-85b1-4f9cee70b275","resolution":{"observed_at":"2026-08-12T13:41:46.250303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:41:46.809912Z","title":null,"venue":null,"work_id":"a7164767-7213-4732-8ba6-46603524d2e3","year":2024},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:46.254216Z"},"links":{"citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:b5886e16f5788313068c1fab07d43a39b3687f87cae760ebbf262a05612ca0a1","observation_id":"88904a78-79d2-4695-8f36-a0215bb91b16","resolution":{"observed_at":"2026-08-12T13:41:46.815064Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":50,"verified_exact":1,"verified_fuzzy":11},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 0 inbound Pith citation observations for arXiv:2411.16035."}