{"as_of":"2026-08-10T12:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5e491de8ecd030e7c9d4e2bc5934d8552f4b0b18021310564891c6af4bccecb6","coverage":[{"denominator":200,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T19:58:58.867835Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T14:52:15.202629Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T06:09:36.811786Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"cited_work":{"arxiv_id":"2502.00197","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.00197","snapshot_observed_at":"2026-07-04T06:09:36.811786Z","title":"Chang and Y","venue":null,"work_id":"efa4d93c-f6dc-4ba5-86b4-fb2f1c0914f6","year":2025},"citing_paper":{"arxiv_id":"2606.20999","last_updated":"2026-06-19T00:19:53Z","snapshot_observed_at":"2026-08-02T02:39:42.396834Z","submitted_at":"2026-06-19T00:19:53Z","title":"Inductive Generalization for Robotic Manipulation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T14:52:15.202629Z"},"links":{"cited_paper":"/paper/2502.00197","citing_paper":"/paper/2606.20999"},"observation_digest":"sha256:514eafd199d5fed49f520bc4bf64b254c1d57b76f3541ad62a455655ba925fce","observation_id":"d02f66f3-a884-46ee-8809-ccd0a4dc5335","resolution":{"observed_at":"2026-07-04T06:09:36.813232Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.00197/citation-record","integrity":"/paper/2502.00197/integrity","json":"/paper/2502.00197/citation-record.json","paper":"/paper/2502.00197"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.532496Z","title":"Generalization on the unseen, logic reasoning and degree curriculum","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.532496Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:904c6f76d26b5b76f7596d8e3ae0efe1ff25ece5bc087d2d646a2608e307a414","observation_id":"6aa04dd3-1356-4934-97b8-6caaf6d5630c","resolution":{"observed_at":"2026-08-09T19:58:58.532496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06467","last_updated":"2024-11-01T17:45:03Z","snapshot_observed_at":"2026-08-10T09:23:28.227357Z","submitted_at":"2024-06-10T17:05:12Z","title":"How Far Can Transformers Reason? The Globality Barrier and Inductive Scratchpad","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06467","snapshot_observed_at":"2026-08-09T19:58:58.536622Z","title":"How far can transformers reason? the locality barrier and inductive scratchpad","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.536622Z"},"links":{"cited_paper":"/paper/2406.06467","citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:88199506be5e5e60113865e4fdab7bab9a719398fbf4430df15ca74a15d876d8","observation_id":"41075264-72e6-4f6b-88c6-d017d13d2f59","resolution":{"observed_at":"2026-08-09T19:58:58.536622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.540760Z","title":"and Mansouri, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.540760Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:2c26ff8fedbf0937e15cfb7f83f2c157dbd123a3f9b07a69dee5eb140c5b85c0","observation_id":"bc794514-7c94-4ff6-8a9f-9d7ccefae7bc","resolution":{"observed_at":"2026-08-09T19:58:58.540760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.544307Z","title":"and Rodríguez, C","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.544307Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:4d1e47550c46b0ccb0e40451adacb894b1c28361539301daef7b65e9a3ad2948","observation_id":"7600bbd7-3cb1-4dd4-b536-a947b8223bdf","resolution":{"observed_at":"2026-08-09T19:58:58.544307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.547602Z","title":"Autoregressive transformers are zero-shot video imitators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.547602Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:0388e09ac4987305fe0f4b13ddce5ee85ebf8e6c064084f0e7b14602a7b9bd20","observation_id":"3e64211c-5dd5-455e-91b2-75785a820dd7","resolution":{"observed_at":"2026-08-09T19:58:58.547602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.02893","last_updated":"2020-03-27T19:07:58Z","snapshot_observed_at":"2026-07-06T08:05:24.076802Z","submitted_at":"2019-07-05T15:26:26Z","title":"Invariant Risk Minimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.02893","snapshot_observed_at":"2026-08-09T19:58:58.550955Z","title":"Invariant risk minimization","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.550955Z"},"links":{"cited_paper":"/paper/1907.02893","citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:64802aff847ad8ccaeec9155c375774c9cf64fca24d5cd9d419237b96666deaf","observation_id":"88536657-7b6a-413f-930e-4459c69080b9","resolution":{"observed_at":"2026-08-09T19:58:58.550955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.554851Z","title":"Dynamic node creation in backpropagation networks","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.554851Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:21f9b928cec93aeb1568698db5a966bd4593b6be892fb17a8c22e38912c41e37","observation_id":"588d85eb-f1c3-483b-9222-d920715f5314","resolution":{"observed_at":"2026-08-09T19:58:58.554851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.558638Z","title":"and Nagarajan, V","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.558638Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:a9c4aacbd6fe154eeb5d4940e3e28d813add4543fb33f23302dcd0b5437ce448","observation_id":"2e3dfbbe-d01a-4be0-b184-6f0cf9557af7","resolution":{"observed_at":"2026-08-09T19:58:58.558638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.561859Z","title":"P., Köster, R., Chadwick, M","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.561859Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:7cc61cc6a80a12ec120c0aa3687a2ca867d06247c40760ddd27405af64d6907f","observation_id":"6b4ea1c4-9aa0-4d42-8f5d-1661b9fa117b","resolution":{"observed_at":"2026-08-09T19:58:58.561859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.564897Z","title":"Pondernet: Learning to ponder","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.564897Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:339ee90662dbf09068a960c97c31066b1d8c161a89b71b9c7bff832e9eb15315","observation_id":"28b05043-23fb-4e42-abe7-e7e7250b5809","resolution":{"observed_at":"2026-08-09T19:58:58.564897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.567977Z","title":"L., Montanari, A., and Rakhlin, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.567977Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:4c7329f3a65dcef838ea6b0394a8c668dcde2e9917daa50d09a39b91178d074c","observation_id":"3141a23b-a5cc-47c5-9a4e-e923389a24de","resolution":{"observed_at":"2026-08-09T19:58:58.567977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.570976Z","title":"A model of inductive bias learning","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.570976Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:fba09f13e8233471d1d51544a8f2ca23ca968b60544dbd45be1b19f31ca167db","observation_id":"2540d0ac-c56c-4136-a5d1-52f553efdc1c","resolution":{"observed_at":"2026-08-09T19:58:58.570976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.574038Z","title":"and Schuller, R","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.574038Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:a78bb48895576c3452be6762afdb70567cc65344edd9b1d516390c5a213a8589","observation_id":"c8e929f7-7d09-4436-a1cb-6e2850612ebb","resolution":{"observed_at":"2026-08-09T19:58:58.574038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.577056Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.577056Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:ab5c4faefb2314936a776a2e1547d1e8c90eda3871424f2bf8c7febd0be71f6e","observation_id":"ab0f2012-f1a2-41cf-b990-bc756decc577","resolution":{"observed_at":"2026-08-09T19:58:58.577056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.579961Z","title":"and Boult, T","venue":null,"work_id":null,"year":1902},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.579961Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:ee135888c24a3692eeb34ce60a44a221355ad56254ad871cdd213438a03a1708","observation_id":"afdc4092-f724-4c70-a546-a1de8e721af5","resolution":{"observed_at":"2026-08-09T19:58:58.579961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.583995Z","title":"Deep learning of representations for unsupervised and transfer learning","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.583995Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:ac2377cef6de5f88e96d239bcf26383e5baed2a4dfc8a5c5234e40f58b06f228","observation_id":"9ce5e554-f15a-4d99-8906-69ad4421da0f","resolution":{"observed_at":"2026-08-09T19:58:58.583995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.587083Z","title":"Curriculum learning","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.587083Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:cc2535f3164c329e80a14c4ad5a042fa857d0906b7a16b00c912ddfc13878ab0","observation_id":"1fc7285a-80cb-47c2-807c-0654b133cbba","resolution":{"observed_at":"2026-08-09T19:58:58.587083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.590327Z","title":"On the practical ability of recurrent neural networks to recognize hierarchical languages","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.590327Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:fcfec3965877d122e20a87a86d3d7be238a4ce0b52fa55c782c3aecdd3cfdf27","observation_id":"1561931f-2784-4b30-999d-34db768e0e58","resolution":{"observed_at":"2026-08-09T19:58:58.590327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.593567Z","title":"On the Ability and Limitations of Transformers to Recognize Formal Languages","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.593567Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:66e5b8c1f473e54446a559829dcae543b40f0960b746c515ce38df7fcb4e4db1","observation_id":"b6e6d241-e002-4673-af37-a39711694993","resolution":{"observed_at":"2026-08-09T19:58:58.593567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.596605Z","title":"Simplicity bias in transformers and their ability to learn sparse Boolean functions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.596605Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:9b9d2ac600deef941d435839d03cc55d283ece355b5d17812081b5b56973a326","observation_id":"e0cc7456-c94b-4aef-ad38-00a05bd9d6e7","resolution":{"observed_at":"2026-08-09T19:58:58.596605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.599725Z","title":"and Schulz, E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.599725Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:e4cc4c1aa747facde1424e7a90e4b779a3f095749a9064c1d922758a7327b7b9","observation_id":"a372cc28-8fe7-430a-b55a-fb58d59d0788","resolution":{"observed_at":"2026-08-09T19:58:58.599725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.602830Z","title":"E., Cruz, S., Dhamija, A","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.602830Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:30bab603cfbb4dc4cad2a76af2f07ee084c8fa76cf52f2927e6469bfe3302cd0","observation_id":"9ddd2113-7a27-43f4-8f5f-44a45a692e04","resolution":{"observed_at":"2026-08-09T19:58:58.602830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.06611","last_updated":"2017-04-21T16:02:26Z","snapshot_observed_at":"2026-08-10T07:50:48.521233Z","submitted_at":"2017-04-21T16:02:26Z","title":"Making Neural Programming Architectures Generalize via Recursion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.06611","snapshot_observed_at":"2026-08-09T19:58:58.605979Z","title":"Making neural programming architectures generalize via recursion","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.605979Z"},"links":{"cited_paper":"/paper/1704.06611","citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:f76bd701b3d8625fb8923fd9cd3769a41aef61106a24197cbb5d1bbbaadd31a7","observation_id":"731e7264-b6dd-4eeb-9f45-021db20ddef4","resolution":{"observed_at":"2026-08-09T19:58:58.605979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.609671Z","title":"Précis of the origin of concepts","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.609671Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:2db201c537a39fa71116cc4962a4a43a303f1ff74bf5b067371d21ec79566400","observation_id":"dc5b9a19-f900-40d1-9176-8059e0aeb7f3","resolution":{"observed_at":"2026-08-09T19:58:58.609671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.612717Z","title":"Multitask learning","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.612717Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:f7c078762e780ec3788ca286f0126f8d36b6f7281059a920a6fbd9631dbafd7e","observation_id":"35f20f8d-ac1f-49a0-9223-b9f0fdeae851","resolution":{"observed_at":"2026-08-09T19:58:58.612717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20131","last_updated":"2024-10-25T14:50:45Z","snapshot_observed_at":"2026-08-01T18:24:13.057707Z","submitted_at":"2024-05-30T15:10:37Z","title":"Language Models Need Inductive Biases to Count Inductively","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20131","snapshot_observed_at":"2026-08-09T19:58:58.615900Z","title":"and Bisk, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.615900Z"},"links":{"cited_paper":"/paper/2405.20131","citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:62f83b6a967f3b3cb3bdf4471cfacc6c8d141040444f9c81ab7cb145be6d3117","observation_id":"1765ed43-296b-4381-9305-6828726aaa28","resolution":{"observed_at":"2026-08-09T19:58:58.615900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.619239Z","title":"A convex formulation for learning shared structures from multiple tasks","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.619239Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:aaf152718d602c9a90da9b1ea29e3dffc44217079c1dc7f7cdb18c9ee694793b","observation_id":"739a501a-3bc1-4268-9043-08bc1c1aec3c","resolution":{"observed_at":"2026-08-09T19:58:58.619239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08477","last_updated":"2024-07-01T15:29:16Z","snapshot_observed_at":"2026-08-06T17:45:57.639013Z","submitted_at":"2024-03-13T12:46:03Z","title":"Unleashing the Power of Meta-tuning for Few-shot Generalization Through Sparse Interpolated Experts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08477","snapshot_observed_at":"2026-08-09T19:58:58.622270Z","title":"W., Schwarz, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.622270Z"},"links":{"cited_paper":"/paper/2403.08477","citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:8d0b9ff36b89f152b3462f6f7ab264df698addb296622c202ce0d18d1320045e","observation_id":"6a9a48b6-57a0-49fd-ba10-7b75351bb3a7","resolution":{"observed_at":"2026-08-09T19:58:58.622270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.625828Z","title":"and Liu, B","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.625828Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:008e00756c7529b620004379eaf615a27895053558a1ecff5d76c0f819c4c5ff","observation_id":"580f9c21-5e89-4a6c-a327-17af3ce4afc9","resolution":{"observed_at":"2026-08-09T19:58:58.625828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.628817Z","title":"Learning from multiple sources","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.628817Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:663eb146dd5a26d6aae6eb85a504217c7ef5dc9e426b4c0e8cd0eaba23269983","observation_id":"cee00724-6292-4152-8583-45105c15490d","resolution":{"observed_at":"2026-08-09T19:58:58.628817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.631911Z","title":"Learning higher-order logic programs","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.631911Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:d43bb1d09b22a4ddb7b0505b43f68ecba216233d37b022c97f6ed43db78104b6","observation_id":"a6ddfcdf-fc35-40f4-8c83-aa18aafde7d1","resolution":{"observed_at":"2026-08-09T19:58:58.631911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.635110Z","title":"and Feys, R","venue":null,"work_id":null,"year":1958},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.635110Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:5eec08d7caaffc854c3ad9ffb9ca1ae5528e77033e158be0fc37e3b989c8887a","observation_id":"7225f957-2c7b-4f9e-a455-56ca6abc7468","resolution":{"observed_at":"2026-08-09T19:58:58.635110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.638190Z","title":"Bayesian multitask learning with latent hierarchies","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.638190Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:638d5bdbe7be411ef0321aabeaf1dcc0abb9ca00eecf3baec735eda5f295bbc6","observation_id":"dd7695cd-4d73-4216-930b-c7ea771bc89c","resolution":{"observed_at":"2026-08-09T19:58:58.638190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.641165Z","title":"B., Lu, T., Luu, T., and Pál, D","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.641165Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:091e10aa2a9e1373ffa92d17de0872b098e0dd5b37a8b4c4d1e0cdb9f2652125","observation_id":"cb2bff39-dbd6-4f0e-9418-c315ea5b3622","resolution":{"observed_at":"2026-08-09T19:58:58.641165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01686","last_updated":"2025-06-09T18:05:35Z","snapshot_observed_at":"2026-08-10T11:20:00.385235Z","submitted_at":"2024-10-02T15:55:08Z","title":"Positional Attention: Expressivity and Learnability of Algorithmic Computation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01686","snapshot_observed_at":"2026-08-09T19:58:58.644090Z","title":"B., Giapitzakis, G., Yang, S., Veli ˇckovi´c, P., and Fountoulakis, K","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.644090Z"},"links":{"cited_paper":"/paper/2410.01686","citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:d5d62c931340560338813df8bd2697bc8bbdaf2230b545276f8c84dd04650f5b","observation_id":"2cdd0f68-d1d3-4e0e-80aa-fbb474b95451","resolution":{"observed_at":"2026-08-09T19:58:58.644090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.647514Z","title":"Random deep neural networks are biased towards simple functions","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.647514Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:04c4aa2e16154f3a636805eb5975d428a741e42ba1d48572bd4cb16354356108","observation_id":"5c1fdd9d-740e-4e47-a20a-1b5f5c3cb499","resolution":{"observed_at":"2026-08-09T19:58:58.647514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.650534Z","title":"H., Cowan, N","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.650534Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:a97ddf4ed5b04138938f2e806c3e5aed24a84e1c4d2dc0b84a4799274c48d2f4","observation_id":"48562429-90ed-4751-b471-5b428a45e473","resolution":{"observed_at":"2026-08-09T19:58:58.650534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.653505Z","title":"Universal transformers","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.653505Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:0927838ebe3d63376ecfe8a282e794e328a6c957a7d32d37a2976c7f42ef5a06","observation_id":"d42f2003-10e6-4a22-adfb-03ee0f211182","resolution":{"observed_at":"2026-08-09T19:58:58.653505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.656387Z","title":"K., Catt, E., Cundy, C., Hutter, M., Legg, S., Veness, J., and Ortega, P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.656387Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:bdc9ddb1aa3d4dd479f0014092f1d74fa7eb38b1048bd366d305a6448a1165ef","observation_id":"389655e0-3b77-4a57-9b35-f162e088c76a","resolution":{"observed_at":"2026-08-09T19:58:58.656387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.14501","last_updated":"2024-06-07T17:24:36Z","snapshot_observed_at":"2026-08-04T14:24:56.404829Z","submitted_at":"2021-09-29T15:35:16Z","title":"Towards a theory of out-of-distribution learning","version":5},"cited_work":{"arxiv_id":"2109.14501","doi":null,"metadata_source":"pith","pith_arxiv_id":"2109.14501","snapshot_observed_at":"2026-08-09T19:59:00.086331Z","title":"Towards a theory of out-of-distribution learning","venue":"stat.ML","work_id":"c37f6c6e-8751-46c3-9bc6-7d41cfbb53cd","year":2021},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.659419Z"},"links":{"cited_paper":"/paper/2109.14501","citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:3acd6781f7687e40ce0f05c1df0cb61ba6ace850b220158a41215103c3c3fa67","observation_id":"28069940-5170-4b81-bc85-290cfead5e45","resolution":{"observed_at":"2026-08-09T19:59:00.090318Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.662538Z","title":"A closer look at distribution shifts and out-of-distribution generalization on graphs","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.662538Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:149d193ea66a47e59524e776e1773c222af0cd9b68eb2ec192afd7799cb349ec","observation_id":"b65e1763-5466-414f-875e-71f700e31f0a","resolution":{"observed_at":"2026-08-09T19:58:58.662538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11719","last_updated":"2022-12-01T14:47:50Z","snapshot_observed_at":"2026-07-06T14:21:22.601555Z","submitted_at":"2022-11-21T18:41:19Z","title":"First Steps Toward Understanding the Extrapolation of Nonlinear Models to Unseen Domains","version":2},"cited_work":{"arxiv_id":"2211.11719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.11719","snapshot_observed_at":"2026-08-09T19:59:00.070467Z","title":"First Steps Toward Understanding the Extrapolation of Nonlinear Models to Unseen Domains","venue":"cs.LG","work_id":"ddec6dbe-7df8-44c9-83ed-7777d9feb0a5","year":2022},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.665308Z"},"links":{"cited_paper":"/paper/2211.11719","citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:3ef03074ee5f05e0e6ecd4b5f7dfdda659e83c5c272865aa7a34e7643d6841f3","observation_id":"08eddf54-d707-4587-a3a9-4da33b5ceb3a","resolution":{"observed_at":"2026-08-09T19:59:00.074951Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.668701Z","title":"Location Attention for Extrapolation to Longer Sequences","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.668701Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:926748e351e09d3f9a191069d26b0ed966fba6bc0a15c3b690b7889386a7e954","observation_id":"bdb15049-987a-4da1-a61a-d2be39e0ec4f","resolution":{"observed_at":"2026-08-09T19:58:58.668701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.674983Z","title":"L., Jiang, L., Lin, B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.674983Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:320545e19ef874232a6b8d7f2d28d839608006728e0cf4269bf987fc33f81a9f","observation_id":"f43f03e0-9e73-46f7-8af1-e9e1e1bf77c8","resolution":{"observed_at":"2026-08-09T19:58:58.674983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.678043Z","title":"How can self-attention networks recognize Dyck-n languages? In Findings of the Association for Computational Linguistics: EMNLP 2020 , November 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.678043Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:ec922531072d2a67ba6e7b8d3c8f42f36e6b74d0cc6ea1bd074b3f1bdd15f114","observation_id":"413678e0-ce1f-4660-b64e-4562fa1f8d32","resolution":{"observed_at":"2026-08-09T19:58:58.678043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-1-4419-1428-6_98","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"and Zilioli, M","venue":null,"work_id":"fef999e9-b9a4-4026-a5f2-781719de1a49","year":2012},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.680967Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:cdffced0d95791a7ece55d954ac5f6e319ccacd637ec638600dccad307162f85","observation_id":"cee353bf-f5b2-436c-b9ff-c3f3d3e99596","resolution":{"observed_at":"2026-08-09T19:58:59.271061Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.684334Z","title":null,"venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.684334Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:e7dc485b86e62dbe5b0e2daab0980b1436c8ca92bd6edecf13aebe3f1ee23ae7","observation_id":"34177a40-0f56-484a-a037-f68ff786bba1","resolution":{"observed_at":"2026-08-09T19:58:58.684334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.09081","last_updated":"2019-02-26T16:06:36Z","snapshot_observed_at":"2026-08-02T03:09:12.462232Z","submitted_at":"2018-04-24T15:01:07Z","title":"Efficient Multi-objective Neural Architecture Search via Lamarckian Evolution","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.09081","snapshot_observed_at":"2026-08-09T19:58:58.687657Z","title":"H., and Hutter, F","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.687657Z"},"links":{"cited_paper":"/paper/1804.09081","citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:0e269f2c173c82f78736e9f2897aec86a212d45cac129745c69f928e80a2ae7e","observation_id":"2b021610-6415-4508-abaa-4961810a04bf","resolution":{"observed_at":"2026-08-09T19:58:58.687657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.691235Z","title":"H., and Hutter, F","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.691235Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:5bd48b5fc16469c7ad7f744d0c230b6677485bc8863b73dd4b0a936737d2e8b2","observation_id":"3f1d9181-09b9-4d8f-9243-da8aa2266734","resolution":{"observed_at":"2026-08-09T19:58:58.691235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.694620Z","title":"Neural fine-tuning search for few-shot learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.694620Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:2c7cfaa8e8b5cac93b6ea037a162d91daacbe0e611aa2c662d4c08882643dd92","observation_id":"ac828527-8e45-4ca8-8387-0bb1ff1491e1","resolution":{"observed_at":"2026-08-09T19:58:58.694620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.697903Z","title":"and Lebiere, C","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.697903Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:5bdf0139f5afa369039ad47e9b87673547d412529bea394c7e38035b2fce8ad8","observation_id":"dbff4b03-f517-4dc3-acd4-5826475060df","resolution":{"observed_at":"2026-08-09T19:58:58.697903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.700941Z","title":"Looped transformers for length generalization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.700941Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:374750955bd898bd89ad58f159fe75847a301e247144e288f1e831e4b1e34518","observation_id":"edaa3432-7fbb-48c6-b2bd-dabfaa92e82c","resolution":{"observed_at":"2026-08-09T19:58:58.700941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.703852Z","title":"and Heit, E","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.703852Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:935b4e25f68bb1f74082d16bec617baeacaa00d66ee679949b5b67eb76fff0ad","observation_id":"3cd76213-295a-4894-9029-7f0a71f759e1","resolution":{"observed_at":"2026-08-09T19:58:58.703852Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.706837Z","title":null,"venue":null,"work_id":null,"year":1986},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.706837Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:49d9faa83b5b3348274b221c043504243a9042c9500b28706d9f17b228debfeb","observation_id":"513fae5c-712d-4013-ad00-884759b44312","resolution":{"observed_at":"2026-08-09T19:58:58.706837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.710069Z","title":"D., Tenenbaum, J","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.710069Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:67be093017479ee6ea0e61b6e4700b4c6f6f12e899db5386082f55d41395e386","observation_id":"e564fa2f-f2a7-426d-802f-68d4607c2676","resolution":{"observed_at":"2026-08-09T19:58:58.710069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.713262Z","title":"K., Mattern, C., Aitchison, M., and Veness, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.713262Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:f1e0bd3849054ecb348ba8a0ff962015ca518bcd3eadc7fda5f6835ba71b6e89","observation_id":"9c65ff1b-1511-4633-a039-d6ce205be529","resolution":{"observed_at":"2026-08-09T19:58:58.713262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1410.5401","last_updated":"2014-12-10T16:01:39Z","snapshot_observed_at":"2026-08-01T22:22:04.725773Z","submitted_at":"2014-10-20T19:28:26Z","title":"Neural Turing Machines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1410.5401","snapshot_observed_at":"2026-08-09T19:58:58.716216Z","title":"Neural turing machines","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.716216Z"},"links":{"cited_paper":"/paper/1410.5401","citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:019d04e248fbce70caac1c1c297c077030d9faa2d87618a39f7170730b534bcc","observation_id":"4239e0d4-4275-414c-bc04-fb8d6dffcaec","resolution":{"observed_at":"2026-08-09T19:58:58.716216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1603.08983","last_updated":"2017-02-21T16:21:21Z","snapshot_observed_at":"2026-08-04T14:24:45.814840Z","submitted_at":"2016-03-29T22:09:00Z","title":"Adaptive Computation Time for Recurrent Neural Networks","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1603.08983","snapshot_observed_at":"2026-08-09T19:58:58.719581Z","title":"Adaptive computation time for recurrent neural networks","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.719581Z"},"links":{"cited_paper":"/paper/1603.08983","citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:3d62f2854f1dfdb1e0e7047cf4550c06808756e8392c6cd3ed255d004f518a4f","observation_id":"a93db7f5-9920-4c03-887d-9298ae2e265b","resolution":{"observed_at":"2026-08-09T19:58:58.719581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.722895Z","title":"and Lopez-Paz, D","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.722895Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:4ce2449a483877caa6069f18f0486284a597e76095873a1f5403eb91b5198c00","observation_id":"88bc8a7c-c620-4869-a8d0-479abea927f4","resolution":{"observed_at":"2026-08-09T19:58:58.722895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.726337Z","title":"Characterizing implicit bias in terms of optimization geometry","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.726337Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:011bd21624b118492eafb16fc0539fb4139668ad8d9586d3f9d6903cab976da4","observation_id":"4d9d2a1b-d488-41e1-a1b6-c1671d97d4ab","resolution":{"observed_at":"2026-08-09T19:58:58.726337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.729415Z","title":"Theoretical limitations of self-attention in neural sequence models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.729415Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:fce40f9d8f7a33111b5fc75909a9d43445e1ac9d493468265bf35b81764ec49c","observation_id":"44dab14c-f8bb-4827-a91b-9d3e4350fee8","resolution":{"observed_at":"2026-08-09T19:58:58.729415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14608","last_updated":"2024-09-16T02:54:50Z","snapshot_observed_at":"2026-08-04T09:07:42.158421Z","submitted_at":"2024-03-21T17:55:50Z","title":"Parameter-Efficient Fine-Tuning for Large Models: A Comprehensive Survey","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14608","snapshot_observed_at":"2026-08-09T19:58:58.732447Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.732447Z"},"links":{"cited_paper":"/paper/2403.14608","citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:bcc0b59ab0bd0add2fede0f3451d793396704bd94e3d4c22573973c713009486","observation_id":"be4afcfb-2cc5-4b2e-9344-0288894bd5c1","resolution":{"observed_at":"2026-08-09T19:58:58.732447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.736138Z","title":"Formal language recognition by hard attention transformers: Perspectives from circuit complexity","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.736138Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:d621cad7f5606a38e50319c516e4ab9d730607ed2f979a12809add24431df35d","observation_id":"2e03eb67-0c04-4e02-9e8c-6d8d92db305a","resolution":{"observed_at":"2026-08-09T19:58:58.736138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.739399Z","title":"The problem of induction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.739399Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:33910fef1b4812437cb95e0b821e72605e24bad8a522427843b2508cf5032502","observation_id":"172daf44-a008-4627-b828-07b0807a8f37","resolution":{"observed_at":"2026-08-09T19:58:58.739399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.742571Z","title":"The many faces of robustness: A critical analysis of out-of-distribution generalization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.742571Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:c4a147486fa40d0f13efbb531bb603cac853f59731e726bded7efd00314a6df6","observation_id":"93af8cf7-ffd5-478d-9b15-7564ea8526da","resolution":{"observed_at":"2026-08-09T19:58:58.742571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03310","last_updated":"2024-07-03T17:53:44Z","snapshot_observed_at":"2026-08-07T00:15:01.765782Z","submitted_at":"2024-07-03T17:53:44Z","title":"Universal Length Generalization with Turing Programs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03310","snapshot_observed_at":"2026-08-09T19:58:58.745856Z","title":"Universal length generalization with turing programs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.745856Z"},"links":{"cited_paper":"/paper/2407.03310","citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:06fddd9e41ac83ee76a2b040b0a59c1999d5f8a61665e525b557b6b7adec5685","observation_id":"cba4097d-275b-4017-a20f-29f87983e020","resolution":{"observed_at":"2026-08-09T19:58:58.745856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.749309Z","title":"Llm- adapters: An adapter family for parameter-efficient fine-tuning of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.749309Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:32e29dce97e907f14d6143800a84a0df28f89fd8c49385cdaa97aa1fa920174d","observation_id":"0151658a-260e-4010-8ded-823afd20e297","resolution":{"observed_at":"2026-08-09T19:58:58.749309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.07207","last_updated":"2022-03-08T06:47:17Z","snapshot_observed_at":"2026-08-06T08:07:23.771593Z","submitted_at":"2022-01-18T18:59:45Z","title":"Language Models as Zero-Shot Planners: Extracting Actionable Knowledge for Embodied Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.07207","snapshot_observed_at":"2026-08-09T19:58:58.752493Z","title":"Language models as zero-shot planners: Extracting actionable knowledge for embodied agents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.752493Z"},"links":{"cited_paper":"/paper/2201.07207","citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:965e7676df5ad415e0dc0bc92810894c45e4414c00f951543a4a11cf3e77cc42","observation_id":"5bf45d6d-a55d-48c3-9818-6f660380f5ad","resolution":{"observed_at":"2026-08-09T19:58:58.752493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"cs.ai/0004001","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:59.823866Z","title":"A theory of universal artificial intelligence based on algorithmic complexity","venue":null,"work_id":"44add1fd-a402-45ed-b055-b75e1d57c0e2","year":2000},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.755767Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:632ad41d35e4cf915a3dca3d389a7dc93e65b84277fc74bd47e6f43631e16b44","observation_id":"657e4fdb-9d05-44da-a2d8-3986b8d0ba48","resolution":{"observed_at":"2026-08-09T19:58:59.829573Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.758805Z","title":"Making a low-dimensional representation suitable for diverse tasks","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.758805Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:479feb7a8a2051844ad624d46a7e5f39af3f0768c1169566d411401dba4ca616","observation_id":"675b6776-372f-4dca-a9f6-81e79f500e6d","resolution":{"observed_at":"2026-08-09T19:58:58.758805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.762088Z","title":"Going beyond linear transformers with recurrent fast weight programmers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.762088Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:9c82fb97b5d83f09c28429af2d8c08b86ae77d64cdecea43fed2cd65073235f5","observation_id":"26c8c763-b70f-4a75-9584-cb9206ff87c1","resolution":{"observed_at":"2026-08-09T19:58:58.762088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.765376Z","title":"Length general- ization in arithmetic transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.765376Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:02e706a93d140c61041f19e0d3961feca2c46746e2d48e197c76048c892fe1d9","observation_id":"0db4dc65-c3ef-491c-b69c-81d15eefa39c","resolution":{"observed_at":"2026-08-09T19:58:58.765376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.768403Z","title":"Fantastic generalization measures and where to find them","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.768403Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:6a04ed99d215d3ef412bd82fbd5da1604f2507b11a7c948c4becba3b884be951","observation_id":"cbd4a543-dc40-49d7-ae14-95453ad4f7b9","resolution":{"observed_at":"2026-08-09T19:58:58.768403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.775373Z","title":"The impact of positional encoding on length generalization in transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.775373Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:f533b95437c6a8ec84c545227e697a55b05730319b80872f9e38ec3314e37d49","observation_id":"c3d13476-7dff-4f53-b64e-fe0fa0407d5f","resolution":{"observed_at":"2026-08-09T19:58:58.775373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.771966Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.771966Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:fddfb388c684e2ac632c4fabe9bc2795fff292a1b1443a25134ce2f0f487768d","observation_id":"1d79daad-6d1b-49bf-ac66-5a7513efc8c1","resolution":{"observed_at":"2026-08-09T19:58:58.771966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.782130Z","title":null,"venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.782130Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:7e7d11ce8dd0f030d51c0470db4d1eda663407b4804122a497cb4cb46cdf8fb7","observation_id":"81fe6a00-db6c-4f01-94ff-bdf2fd4793f9","resolution":{"observed_at":"2026-08-09T19:58:58.782130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.12701","last_updated":"2023-05-11T09:48:55Z","snapshot_observed_at":"2026-07-06T14:22:00.790764Z","submitted_at":"2022-11-23T04:46:28Z","title":"Continual Learning of Natural Language Processing Tasks: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.12701","snapshot_observed_at":"2026-08-09T19:58:58.778533Z","title":"and Liu, B","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.778533Z"},"links":{"cited_paper":"/paper/2211.12701","citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:9228b34ef083692fabb8cffacb69ad29e16df3f811b1831498b087b84d6316b8","observation_id":"35193fb4-2386-49c8-b95b-107cc68c6634","resolution":{"observed_at":"2026-08-09T19:58:58.778533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.788633Z","title":"S., Reid, M., Matsuo, Y ., and Iwasawa, Y","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.788633Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:542cd3d57af125d327f8d6a0ddfb74a895c7fe5ebc93192f0a6c3d547261c6b9","observation_id":"9eee66ea-37e9-44f4-a285-169c4f31585c","resolution":{"observed_at":"2026-08-09T19:58:58.788633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.785202Z","title":"W., Sagawa, S., Marklund, H., Xie, S","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.785202Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:d62094bfdfbb6522d36d1e2e4bc24e7d7a2e698b54f706eef0e34306bc219be3","observation_id":"51350ace-16ae-4893-a040-a98a165d68fc","resolution":{"observed_at":"2026-08-09T19:58:58.785202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.795623Z","title":"L., and Courville, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.795623Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:9279e761e3e8e241491567933f5fd33c7dba73680a32b92d8646223681dc4889","observation_id":"cb89c596-5be5-4cdb-b415-d1cc6ae83fd6","resolution":{"observed_at":"2026-08-09T19:58:58.795623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.792001Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.792001Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:de35406ad81fa383f005effbbd0f3b2a44de117c50950321138a0b421c274403","observation_id":"32740b3d-dbba-4097-9554-4e93f05347d2","resolution":{"observed_at":"2026-08-09T19:58:58.792001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.808540Z","title":"and Daumé, H","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.808540Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:1631623f8b6787f89e82863ad9bca8f1e8fa830144691c573e59465a61a59478","observation_id":"0238334e-a103-462a-ad73-0aa76853eca3","resolution":{"observed_at":"2026-08-09T19:58:58.808540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04345","last_updated":"2025-06-26T16:08:44Z","snapshot_observed_at":"2026-07-06T15:51:58.017259Z","submitted_at":"2023-07-10T05:06:41Z","title":"Continual Learning as Computationally Constrained Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04345","snapshot_observed_at":"2026-08-09T19:58:58.811971Z","title":"J., Liu, Y ., and Van Roy, B","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.811971Z"},"links":{"cited_paper":"/paper/2307.04345","citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:d69cf5d8a2e3224cb56e9841f74423561dfe74f80e82f47634e38e7b92aa99b5","observation_id":"9e79f6b9-11c6-470c-8261-502306f55608","resolution":{"observed_at":"2026-08-09T19:58:58.811971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.804760Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.804760Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:46d5f7bcff13f4ce83ab7b7d608571e45f89377322b2d208dfdbfe0d96a2f3f3","observation_id":"d178b9e4-35a2-48c3-9ea9-55e9cfb95761","resolution":{"observed_at":"2026-08-09T19:58:58.804760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.819852Z","title":"M., Salakhutdinov, R., and Tenenbaum, J","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.819852Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:d5433f89b0ee46290143991bee06894ecbfead4b8463aca781a41f44d99b6d02","observation_id":"01d723ee-e2a8-4fef-ae4f-8760a9449d90","resolution":{"observed_at":"2026-08-09T19:58:58.819852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.02258","last_updated":"2021-01-06T20:47:02Z","snapshot_observed_at":"2026-08-10T06:44:58.023532Z","submitted_at":"2021-01-06T20:47:02Z","title":"Can RNNs learn Recursive Nested Subject-Verb Agreements?","version":1},"cited_work":{"arxiv_id":"2101.02258","doi":null,"metadata_source":"pith","pith_arxiv_id":"2101.02258","snapshot_observed_at":"2026-08-09T19:58:59.734968Z","title":"Can RNNs learn Recursive Nested Subject-Verb Agreements?","venue":"cs.CL","work_id":"cfc7d989-e317-47b6-9f72-8cc4b4de1bb4","year":2021},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.823159Z"},"links":{"cited_paper":"/paper/2101.02258","citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:d20ae6e97ae0065c2f4eed8813fb35bd6907ed9e7e8fc6a035784aaf813498f5","observation_id":"f364f0d2-5eef-460d-a4a6-37f262adc654","resolution":{"observed_at":"2026-08-09T19:58:59.739340Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.816143Z","title":"D., and Johns, E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.816143Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:313c7671c7fab838ba0ec9c8c31f3d6f48dcda5edffc763241bf8fde30150849","observation_id":"8dc1eb60-a94e-4f46-9a9e-670af9425d88","resolution":{"observed_at":"2026-08-09T19:58:58.816143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.830257Z","title":"L., Brockschmidt, M., and Kushman, N","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.830257Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:beb5d94daa8b3926160e642d4af7571fc4ba036c80df9ff4f85b6d69fcebfcce","observation_id":"06afaf1d-f684-4b0f-9110-8094a4df3933","resolution":{"observed_at":"2026-08-09T19:58:58.830257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.833369Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.833369Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:26143cfe578227e0cad223d52b3ab68470369a61955369771f75522666ac0599","observation_id":"289fdfe6-783d-4bcb-b944-f92af096bf4c","resolution":{"observed_at":"2026-08-09T19:58:58.833369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.826697Z","title":"Learning a meta-level prior for feature relevance from multiple related tasks","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.826697Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:de0d0a861545dcadac92193b93866930c986e357a329fa8b267d6d618e3be614","observation_id":"69c8e9ad-ae21-4538-9f1d-5fda9ce681e4","resolution":{"observed_at":"2026-08-09T19:58:58.826697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.839706Z","title":"R., and Eisner, J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.839706Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:5d610526fb6511ed89135ef50cc4b75d86f3d7a0966297055f19c6dbeb1cb250","observation_id":"1302c1d6-5f2b-4685-b48f-e1d4758b1fae","resolution":{"observed_at":"2026-08-09T19:58:58.839706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.842701Z","title":"T., Goel, S., Krishnamurthy, A., and Zhang, C","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.842701Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:c86459cf37fdd932f4dcfa1922e929ee10d617e90d290be9af0c71fc6b4cf2d1","observation_id":"9f714ce5-f1fe-4c0e-a287-873174679781","resolution":{"observed_at":"2026-08-09T19:58:58.842701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.836405Z","title":"and Vitanyi, P","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.836405Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:9a13be2ddd731b1d9b2af3d2e100a9855d113fd1a3a715d38ac7a4fd9efd0e10","observation_id":"2dfc607a-9572-4396-9aea-38c8b504fc39","resolution":{"observed_at":"2026-08-09T19:58:58.836405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.849361Z","title":"Darts: Differentiable architecture search","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.849361Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:a622af65a84007431862babc82fa703b57b33c8701b80754986eb4a6a199a156","observation_id":"da24bc99-2a5b-45c0-9083-7f8b5cdfeede","resolution":{"observed_at":"2026-08-09T19:58:58.849361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2008.10937","last_updated":"2022-02-04T03:45:53Z","snapshot_observed_at":"2026-08-10T01:52:12.896724Z","submitted_at":"2020-08-25T11:00:46Z","title":"A Survey on Evolutionary Neural Architecture Search","version":4},"cited_work":{"arxiv_id":"2008.10937","doi":null,"metadata_source":"pith","pith_arxiv_id":"2008.10937","snapshot_observed_at":"2026-08-09T19:58:59.652504Z","title":"A Survey on Evolutionary Neural Architecture Search","venue":"cs.NE","work_id":"463cb08a-5bab-4e13-9d6c-ed14366501d2","year":2020},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.852333Z"},"links":{"cited_paper":"/paper/2008.10937","citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:b56f41550cfb6f6b71e51520ae23dc606d110266691fda9c3334612f7b1c74d3","observation_id":"5ffd42ed-65a8-4474-b44e-c95d57a2ac76","resolution":{"observed_at":"2026-08-09T19:58:59.656463Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.846097Z","title":"Hierarchical representa- tions for efficient architecture search","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.846097Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:90ad81260595642583c432cd97eb22ed3c6850eca47ce44fabd43f222dbeb8b5","observation_id":"2766de11-f9c9-4c92-8d8c-40f6767e646e","resolution":{"observed_at":"2026-08-09T19:58:58.846097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.858556Z","title":null,"venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.858556Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:9c615cdaa210cc88185c0d4666ba8658e65f5dbef62fff1f8cff26d9f31a282f","observation_id":"7ddcf38a-4b7a-4f6d-b507-36985e65f4de","resolution":{"observed_at":"2026-08-09T19:58:58.858556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06979","last_updated":"2024-07-29T20:51:25Z","snapshot_observed_at":"2026-08-09T18:26:00.758042Z","submitted_at":"2023-09-13T14:15:03Z","title":"Auto-Regressive Next-Token Predictors are Universal Learners","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06979","snapshot_observed_at":"2026-08-09T19:58:58.861348Z","title":"Auto-regressive next-token predictors are universal learners","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.861348Z"},"links":{"cited_paper":"/paper/2309.06979","citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:7d210e2fc6eb82232dfcfb163d7d68db957414435ef93f8e98c10a86ca63fbd5","observation_id":"268bee84-5104-42e0-82e5-acd092f25bf0","resolution":{"observed_at":"2026-08-09T19:58:58.861348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.855579Z","title":null,"venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.855579Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:bf532f271a9fe945b0a38d7e5f1b32783f20167dcc6793f9c76ea1970e0db43c","observation_id":"97f765ef-a37d-4586-85b2-cbb028f456f3","resolution":{"observed_at":"2026-08-09T19:58:58.855579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:58:58.867835Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:58.867835Z"},"links":{"citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:2d1d1f51ce628fc7af2ea5e7bb1c1063e0bcc10ec20be88247878928ac4c9490","observation_id":"968c25da-07b2-4709-b58e-b802f328b96f","resolution":{"observed_at":"2026-08-09T19:58:58.867835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T09:23:38.750852Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":93,"verified_exact":6,"verified_fuzzy":0},"total_outbound_references":200},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 100 of 200 outbound references and 1 inbound Pith citation observation for arXiv:2502.00197."}