{"as_of":"2026-08-10T14:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:76dfc8a1eae1ead24ebc45372d3a4b0c370b38bcdb78c51c7b793081f8764368","coverage":[{"denominator":18,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:17:44.447421Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T11:21:30.867480Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T11:24:08.689134Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19475","last_updated":"2025-05-28T11:04:19Z","snapshot_observed_at":"2026-08-08T15:11:51.265629Z","submitted_at":"2025-05-26T03:54:47Z","title":"Continuous Self-Improvement of Large Language Models by Test-time Training with Verifier-Driven Sample Selection","version":2},"cited_work":{"arxiv_id":"2505.19475","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19475","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Continuous self-improvement of large language models by test-time training with verifier-driven sample selection.arXiv preprint arXiv:2505.19475","venue":null,"work_id":"a234dca2-f1c6-43d0-9a55-f0c3998dc969","year":2025},"citing_paper":{"arxiv_id":"2604.18131","last_updated":"2026-04-20T11:54:20Z","snapshot_observed_at":"2026-07-06T23:05:04.279268Z","submitted_at":"2026-04-20T11:54:20Z","title":"Training LLM Agents for Spontaneous, Reward-Free Self-Evolution via World Knowledge Exploration","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T04:36:27.381942Z"},"links":{"cited_paper":"/paper/2505.19475","citing_paper":"/paper/2604.18131"},"observation_digest":"sha256:1ecfab6bc55cd4da468da365c271f7b88a207a32dba94056e01268bf569956e9","observation_id":"8c8461f9-393c-4608-9713-a5662f24200b","resolution":{"observed_at":"2026-05-10T12:10:23.467718Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19475","last_updated":"2025-05-28T11:04:19Z","snapshot_observed_at":"2026-08-08T15:11:51.265629Z","submitted_at":"2025-05-26T03:54:47Z","title":"Continuous Self-Improvement of Large Language Models by Test-time Training with Verifier-Driven Sample Selection","version":2},"cited_work":{"arxiv_id":"2505.19475","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19475","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Continuous self-improvement of large language models by test-time training with verifier-driven sample selection.arXiv preprint arXiv:2505.19475","venue":null,"work_id":"a234dca2-f1c6-43d0-9a55-f0c3998dc969","year":2025},"citing_paper":{"arxiv_id":"2605.11328","last_updated":"2026-05-11T23:26:30Z","snapshot_observed_at":"2026-08-02T08:39:07.747479Z","submitted_at":"2026-05-11T23:26:30Z","title":"Epistemic Uncertainty for Test-Time Discovery","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-13T01:52:41.192353Z"},"links":{"cited_paper":"/paper/2505.19475","citing_paper":"/paper/2605.11328"},"observation_digest":"sha256:5c484c22350d6dfb4fe60a7680de5043a0bc93a4baa9532dfb93455027d52f98","observation_id":"9490c672-7ce5-4cd1-a42a-9df04c413960","resolution":{"observed_at":"2026-05-13T01:57:06.136696Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19475","last_updated":"2025-05-28T11:04:19Z","snapshot_observed_at":"2026-08-08T15:11:51.265629Z","submitted_at":"2025-05-26T03:54:47Z","title":"Continuous Self-Improvement of Large Language Models by Test-time Training with Verifier-Driven Sample Selection","version":2},"cited_work":{"arxiv_id":"2505.19475","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19475","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Continuous self-improvement of large language models by test-time training with verifier-driven sample selection.arXiv preprint arXiv:2505.19475","venue":null,"work_id":"a234dca2-f1c6-43d0-9a55-f0c3998dc969","year":2025},"citing_paper":{"arxiv_id":"2605.20189","last_updated":"2026-03-23T07:18:02Z","snapshot_observed_at":"2026-08-01T19:18:00.278267Z","submitted_at":"2026-03-23T07:18:02Z","title":"SOLAR: A Self-Optimizing Open-Ended Autonomous Agent for Lifelong Learning and Continual Adaptation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-21T11:21:30.867480Z"},"links":{"cited_paper":"/paper/2505.19475","citing_paper":"/paper/2605.20189"},"observation_digest":"sha256:39ba416fb8a57da0d1da989727290ac7e9f1979c587742e4700979185548fefe","observation_id":"1a97d93e-2d8f-4ce8-9198-cdd718d374a2","resolution":{"observed_at":"2026-05-21T11:24:08.690998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19475/citation-record","integrity":"/paper/2505.19475/integrity","json":"/paper/2505.19475/citation-record.json","paper":"/paper/2505.19475"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-07T14:17:43.662673Z","title":"Measuring mathematical problem solving with the math dataset.arXiv preprint arXiv:2103.03874,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19475","last_updated":"2025-05-28T11:04:19Z","snapshot_observed_at":"2026-08-08T15:11:51.265629Z","submitted_at":"2025-05-26T03:54:47Z","title":"Continuous Self-Improvement of Large Language Models by Test-time Training with Verifier-Driven Sample Selection","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:43.662673Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2505.19475"},"observation_digest":"sha256:1743fd440fe8552378e18378b75d4aea2559794850739b4dedca0f35bcfc52cd","observation_id":"807d5c9c-325e-4275-b43c-c5fb24b057f5","resolution":{"observed_at":"2026-08-07T14:17:43.662673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16763","last_updated":"2023-10-25T16:52:00Z","snapshot_observed_at":"2026-07-06T16:38:29.188225Z","submitted_at":"2023-10-25T16:52:00Z","title":"SuperHF: Supervised Iterative Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16763","snapshot_observed_at":"2026-08-07T14:17:43.978557Z","title":"Superhf: Supervised iterative learning from human feedback.arXiv preprint arXiv:2310.16763,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19475","last_updated":"2025-05-28T11:04:19Z","snapshot_observed_at":"2026-08-08T15:11:51.265629Z","submitted_at":"2025-05-26T03:54:47Z","title":"Continuous Self-Improvement of Large Language Models by Test-time Training with Verifier-Driven Sample Selection","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:43.978557Z"},"links":{"cited_paper":"/paper/2310.16763","citing_paper":"/paper/2505.19475"},"observation_digest":"sha256:cf5a96693f195b03bd766949fb5e80ae129b6b44800c759d3c4f83a3b6ae069e","observation_id":"f4a35f45-02bc-4213-9e61-4aff232acf98","resolution":{"observed_at":"2026-08-07T14:17:43.978557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05012","last_updated":"2024-05-12T22:21:27Z","snapshot_observed_at":"2026-08-09T13:43:01.627365Z","submitted_at":"2024-05-08T12:26:15Z","title":"The Entropy Enigma: Success and Failure of Entropy Minimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05012","snapshot_observed_at":"2026-08-07T14:17:44.046534Z","title":"The entropy enigma: Success and failure of entropy minimization.arXiv preprint arXiv:2405.05012,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19475","last_updated":"2025-05-28T11:04:19Z","snapshot_observed_at":"2026-08-08T15:11:51.265629Z","submitted_at":"2025-05-26T03:54:47Z","title":"Continuous Self-Improvement of Large Language Models by Test-time Training with Verifier-Driven Sample Selection","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:44.046534Z"},"links":{"cited_paper":"/paper/2405.05012","citing_paper":"/paper/2505.19475"},"observation_digest":"sha256:f1892d4e83697c2ba67dc7f2808aaf9db1413b75c607993f23930a903a3625e5","observation_id":"c0b18e1d-6719-47ea-b3fb-c519270c0560","resolution":{"observed_at":"2026-08-07T14:17:44.046534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:44.906433Z","title":"The effect of sampling temperature on problem solving in large language models","venue":null,"work_id":"5a8b0705-6891-43d5-bc5e-469d334d82fc","year":2024},"citing_paper":{"arxiv_id":"2505.19475","last_updated":"2025-05-28T11:04:19Z","snapshot_observed_at":"2026-08-08T15:11:51.265629Z","submitted_at":"2025-05-26T03:54:47Z","title":"Continuous Self-Improvement of Large Language Models by Test-time Training with Verifier-Driven Sample Selection","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:44.125520Z"},"links":{"citing_paper":"/paper/2505.19475"},"observation_digest":"sha256:a9c84cd9cf2d41d6dc967519973124f11a3e3603eba463c60dfc016c14654610","observation_id":"7f1808f0-f761-4bde-b22c-8a0385d9eb8c","resolution":{"observed_at":"2026-08-07T14:17:44.962617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T14:17:44.208326Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19475","last_updated":"2025-05-28T11:04:19Z","snapshot_observed_at":"2026-08-08T15:11:51.265629Z","submitted_at":"2025-05-26T03:54:47Z","title":"Continuous Self-Improvement of Large Language Models by Test-time Training with Verifier-Driven Sample Selection","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:44.208326Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.19475"},"observation_digest":"sha256:a12b20d9cdbd9770df3b4b2cf85cabe249add7c04e7d1a8ef9c9ab366a607fd3","observation_id":"693ddb9e-c624-41dc-aaee-bdf452aec13a","resolution":{"observed_at":"2026-08-07T14:17:44.208326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T14:17:44.288121Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19475","last_updated":"2025-05-28T11:04:19Z","snapshot_observed_at":"2026-08-08T15:11:51.265629Z","submitted_at":"2025-05-26T03:54:47Z","title":"Continuous Self-Improvement of Large Language Models by Test-time Training with Verifier-Driven Sample Selection","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:44.288121Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.19475"},"observation_digest":"sha256:14ddf186e8ee5788ed460896aea2af505ca6095ec73bf4c60e75039393669cc2","observation_id":"93af7555-85bd-4448-88db-01c371e75911","resolution":{"observed_at":"2026-08-07T14:17:44.288121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01364","last_updated":"2024-02-07T07:14:39Z","snapshot_observed_at":"2026-08-04T18:35:41.659861Z","submitted_at":"2024-02-02T12:34:09Z","title":"Continual Learning for Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01364","snapshot_observed_at":"2026-08-07T14:17:44.344757Z","title":"Continual learning for large language models: A survey.arXiv preprint arXiv:2402.01364,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19475","last_updated":"2025-05-28T11:04:19Z","snapshot_observed_at":"2026-08-08T15:11:51.265629Z","submitted_at":"2025-05-26T03:54:47Z","title":"Continuous Self-Improvement of Large Language Models by Test-time Training with Verifier-Driven Sample Selection","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:44.344757Z"},"links":{"cited_paper":"/paper/2402.01364","citing_paper":"/paper/2505.19475"},"observation_digest":"sha256:8d1efc71116b54fc5a7473b73f7ab91f7d20aa0c8136d3edbe48b06fc58cc4a4","observation_id":"f2549d4f-86c9-4f5e-bba8-49617eedade3","resolution":{"observed_at":"2026-08-07T14:17:44.344757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03687","last_updated":"2024-11-06T06:13:57Z","snapshot_observed_at":"2026-08-06T20:03:24.909204Z","submitted_at":"2024-11-06T06:13:57Z","title":"Beyond Model Adaptation at Test Time: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.03687","snapshot_observed_at":"2026-08-07T14:17:44.395312Z","title":"Beyond model adaptation at test time: A survey.arXiv preprint arXiv:2411.03687,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19475","last_updated":"2025-05-28T11:04:19Z","snapshot_observed_at":"2026-08-08T15:11:51.265629Z","submitted_at":"2025-05-26T03:54:47Z","title":"Continuous Self-Improvement of Large Language Models by Test-time Training with Verifier-Driven Sample Selection","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:44.395312Z"},"links":{"cited_paper":"/paper/2411.03687","citing_paper":"/paper/2505.19475"},"observation_digest":"sha256:84ce387585e8f2964f3a50f1121610a41b60353157544c0f2824ab615ae843ea","observation_id":"69a951f2-45b4-4564-9711-2c0316699745","resolution":{"observed_at":"2026-08-07T14:17:44.395312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16084","last_updated":"2025-06-30T15:59:26Z","snapshot_observed_at":"2026-07-06T21:13:13.686703Z","submitted_at":"2025-04-22T17:59:56Z","title":"TTRL: Test-Time Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16084","snapshot_observed_at":"2026-08-07T14:17:44.447421Z","title":"Ttrl: Test-time reinforcement learning.arXiv preprint arXiv:2504.16084,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19475","last_updated":"2025-05-28T11:04:19Z","snapshot_observed_at":"2026-08-08T15:11:51.265629Z","submitted_at":"2025-05-26T03:54:47Z","title":"Continuous Self-Improvement of Large Language Models by Test-time Training with Verifier-Driven Sample Selection","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:44.447421Z"},"links":{"cited_paper":"/paper/2504.16084","citing_paper":"/paper/2505.19475"},"observation_digest":"sha256:482b1573151e88c68b7acefa692f83f0a5a20521113559aaf4bbbc907fe71a20","observation_id":"06c5c7e8-624a-4d61-877a-f1af05548987","resolution":{"observed_at":"2026-08-07T14:17:44.447421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T14:17:43.253745Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19475","last_updated":"2025-05-28T11:04:19Z","snapshot_observed_at":"2026-08-08T15:11:51.265629Z","submitted_at":"2025-05-26T03:54:47Z","title":"Continuous Self-Improvement of Large Language Models by Test-time Training with Verifier-Driven Sample Selection","version":2},"reference_index":1988,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:43.253745Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.19475"},"observation_digest":"sha256:f3ea035f2674eee14a3420bc0fb6c93c6330c1265e1b7d3e8737ea8fc78f1220","observation_id":"f36fc033-e6de-4467-b241-d481a7ef774f","resolution":{"observed_at":"2026-08-07T14:17:43.253745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09390","last_updated":"2023-12-14T23:07:33Z","snapshot_observed_at":"2026-07-06T17:02:09.539730Z","submitted_at":"2023-12-14T23:07:33Z","title":"Weak-to-Strong Generalization: Eliciting Strong Capabilities With Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09390","snapshot_observed_at":"2026-08-07T14:17:43.075394Z","title":"Weak-to-strong generalization: Eliciting strong capabilities with weak supervision.arXiv preprint arXiv:2312.09390,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19475","last_updated":"2025-05-28T11:04:19Z","snapshot_observed_at":"2026-08-08T15:11:51.265629Z","submitted_at":"2025-05-26T03:54:47Z","title":"Continuous Self-Improvement of Large Language Models by Test-time Training with Verifier-Driven Sample Selection","version":2},"reference_index":1992,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:43.075394Z"},"links":{"cited_paper":"/paper/2312.09390","citing_paper":"/paper/2505.19475"},"observation_digest":"sha256:737bfdd7a6f757b81039fdd66065e1083467826256c1a9c4106017b1ca5a22de","observation_id":"159f8971-b300-4993-9824-c833f327f7fd","resolution":{"observed_at":"2026-08-07T14:17:43.075394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-08-07T14:17:44.275296Z","title":"Scaling test-time compute without verification or rl is suboptimal.arXiv preprint arXiv:2502.12118,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19475","last_updated":"2025-05-28T11:04:19Z","snapshot_observed_at":"2026-08-08T15:11:51.265629Z","submitted_at":"2025-05-26T03:54:47Z","title":"Continuous Self-Improvement of Large Language Models by Test-time Training with Verifier-Driven Sample Selection","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:44.275296Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2505.19475"},"observation_digest":"sha256:63a87c5ebe48e266ee649ba385d879e1be0b765863030ee9dc75e8e7276d9fbf","observation_id":"38e18a3b-642c-459f-8caa-ccc9876c8e26","resolution":{"observed_at":"2026-08-07T14:17:44.275296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.10726","last_updated":"2021-03-18T17:58:01Z","snapshot_observed_at":"2026-07-06T09:30:32.320227Z","submitted_at":"2020-06-18T17:55:28Z","title":"Tent: Fully Test-time Adaptation by Entropy Minimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.10726","snapshot_observed_at":"2026-08-07T14:17:44.295987Z","title":"Tent: Fully test-time adaptation by entropy minimization.arXiv preprint arXiv:2006.10726,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.19475","last_updated":"2025-05-28T11:04:19Z","snapshot_observed_at":"2026-08-08T15:11:51.265629Z","submitted_at":"2025-05-26T03:54:47Z","title":"Continuous Self-Improvement of Large Language Models by Test-time Training with Verifier-Driven Sample Selection","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:44.295987Z"},"links":{"cited_paper":"/paper/2006.10726","citing_paper":"/paper/2505.19475"},"observation_digest":"sha256:ea0b5e2a8013221c8f40f8ded10728b2af2aadbd7f882b6b459fdb9a6bdff3be","observation_id":"08e01256-2de9-41f1-9149-40516eca05f1","resolution":{"observed_at":"2026-08-07T14:17:44.295987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08998","last_updated":"2023-08-21T10:23:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-17T14:12:48Z","title":"Reinforced Self-Training (ReST) for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08998","snapshot_observed_at":"2026-08-07T14:17:43.424702Z","title":"Reinforced self-training (rest) for language modeling.arXiv preprint arXiv:2308.08998,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19475","last_updated":"2025-05-28T11:04:19Z","snapshot_observed_at":"2026-08-08T15:11:51.265629Z","submitted_at":"2025-05-26T03:54:47Z","title":"Continuous Self-Improvement of Large Language Models by Test-time Training with Verifier-Driven Sample Selection","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:43.424702Z"},"links":{"cited_paper":"/paper/2308.08998","citing_paper":"/paper/2505.19475"},"observation_digest":"sha256:633935fc00e9ef2edeea0422431acd8d7b3b734ebd2175b72e2683ea0adbb82f","observation_id":"6b85c2f8-e47f-4d9d-bd4a-e8f099e93c21","resolution":{"observed_at":"2026-08-07T14:17:43.424702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-07T14:17:43.753618Z","title":"Open-reasoner- zero: An open source approach to scaling up reinforcement learning on the base model.arXiv preprint arXiv:2503.24290,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19475","last_updated":"2025-05-28T11:04:19Z","snapshot_observed_at":"2026-08-08T15:11:51.265629Z","submitted_at":"2025-05-26T03:54:47Z","title":"Continuous Self-Improvement of Large Language Models by Test-time Training with Verifier-Driven Sample Selection","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:43.753618Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2505.19475"},"observation_digest":"sha256:c9cf8ee1296559dcf5cbafcbbbc4e4788fdee4e96497b632c540227e5b913a47","observation_id":"4a4e6df7-7e9a-421e-964f-fbba1689d469","resolution":{"observed_at":"2026-08-07T14:17:43.753618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18466","last_updated":"2024-02-02T20:28:27Z","snapshot_observed_at":"2026-08-04T19:50:24.574752Z","submitted_at":"2023-05-29T08:03:28Z","title":"Test-Time Training on Nearest Neighbors for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18466","snapshot_observed_at":"2026-08-07T14:17:43.596078Z","title":"Test-time training on nearest neighbors for large language models.arXiv preprint arXiv:2305.18466,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19475","last_updated":"2025-05-28T11:04:19Z","snapshot_observed_at":"2026-08-08T15:11:51.265629Z","submitted_at":"2025-05-26T03:54:47Z","title":"Continuous Self-Improvement of Large Language Models by Test-time Training with Verifier-Driven Sample Selection","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:43.596078Z"},"links":{"cited_paper":"/paper/2305.18466","citing_paper":"/paper/2505.19475"},"observation_digest":"sha256:dbab0c5c2657a454288b8e4e996e9171a38aa9a3178c25246bc06d4147a6a1d4","observation_id":"d435c54c-67a7-453a-8e56-f683ca89d209","resolution":{"observed_at":"2026-08-07T14:17:43.596078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02497","last_updated":"2025-06-29T06:49:52Z","snapshot_observed_at":"2026-08-08T16:04:18.962646Z","submitted_at":"2025-01-05T10:24:20Z","title":"A Survey of Test-Time Compute: From Intuitive Inference to Deliberate Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02497","snapshot_observed_at":"2026-08-07T14:17:43.887609Z","title":"Test-time computing: from system-1 thinking to system-2 thinking.arXiv preprint arXiv:2501.02497,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19475","last_updated":"2025-05-28T11:04:19Z","snapshot_observed_at":"2026-08-08T15:11:51.265629Z","submitted_at":"2025-05-26T03:54:47Z","title":"Continuous Self-Improvement of Large Language Models by Test-time Training with Verifier-Driven Sample Selection","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:43.887609Z"},"links":{"cited_paper":"/paper/2501.02497","citing_paper":"/paper/2505.19475"},"observation_digest":"sha256:3f9c5cb9885dd1e9693b53efd94559232b8a448d4dda715fcf011ec81d67e641","observation_id":"58da377b-4834-4a5c-bc68-60066dce9c07","resolution":{"observed_at":"2026-08-07T14:17:43.887609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08020","last_updated":"2025-02-08T19:39:09Z","snapshot_observed_at":"2026-08-09T20:46:54.394199Z","submitted_at":"2024-10-10T15:17:49Z","title":"Efficiently Learning at Test-Time: Active Fine-Tuning of LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08020","snapshot_observed_at":"2026-08-07T14:17:43.818843Z","title":"Efficiently learning at test-time: Active fine-tuning of llms.arXiv preprint arXiv:2410.08020,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19475","last_updated":"2025-05-28T11:04:19Z","snapshot_observed_at":"2026-08-08T15:11:51.265629Z","submitted_at":"2025-05-26T03:54:47Z","title":"Continuous Self-Improvement of Large Language Models by Test-time Training with Verifier-Driven Sample Selection","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:43.818843Z"},"links":{"cited_paper":"/paper/2410.08020","citing_paper":"/paper/2505.19475"},"observation_digest":"sha256:dcf930d00019e0d30eb0102d0f3100cecc4a4502cc82f1899722b4a16b8b03f4","observation_id":"d1ea5909-4513-4eaf-87c1-a98325cd8196","resolution":{"observed_at":"2026-08-07T14:17:43.818843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.19475","last_updated":"2025-05-28T11:04:19Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T15:11:51.265629Z","submitted_at":"2025-05-26T03:54:47Z","title":"Continuous Self-Improvement of Large Language Models by Test-time Training with Verifier-Driven Sample Selection"},"reference_resolution":{"displayed":18,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":18},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 18 of 18 outbound references and 3 inbound Pith citation observations for arXiv:2505.19475."}