{"as_of":"2026-08-20T20:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:68961d8550f9942e8528461a0366c04e5689b1a8770733013517956184ea6f7d","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:50:30.746297Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-10T22:46:24.057572Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T22:47:37.001412Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.03259","last_updated":"2026-05-31T02:55:06Z","snapshot_observed_at":"2026-08-16T20:27:51.024961Z","submitted_at":"2025-09-26T14:05:48Z","title":"Verifying Meta-Awareness via Predictive Rewards in Reasoning Models","version":2},"cited_work":{"arxiv_id":"2510.03259","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.03259","snapshot_observed_at":"2026-07-10T22:47:37.001412Z","title":"Verifying Meta-Awareness via Predictive Rewards in Reasoning Models","venue":"cs.LG","work_id":"ba5c037c-ca6e-4d36-b79d-4b72e9a3fe71","year":2025},"citing_paper":{"arxiv_id":"2607.06720","last_updated":"2026-07-07T18:36:04Z","snapshot_observed_at":"2026-08-19T23:14:36.284430Z","submitted_at":"2026-07-07T18:36:04Z","title":"When Does In-Context Search Help? A Sampling-Complexity Theory of Reflection-Driven Reasoning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-10T22:46:24.057572Z"},"links":{"cited_paper":"/paper/2510.03259","citing_paper":"/paper/2607.06720"},"observation_digest":"sha256:588815c3768b86405e1e5e0e8300fccfb0a433d5e5129be59fb3c4a29c789eb9","observation_id":"32c50b34-3160-4960-80d1-44575255273c","resolution":{"observed_at":"2026-07-10T22:47:37.015452Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2510.03259/citation-record","integrity":"/paper/2510.03259/integrity","json":"/paper/2510.03259/citation-record.json","paper":"/paper/2510.03259"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:50:30.486633Z","title":"Language models are few-shot learners.Advances in neural information processing systems, 33:1877–1901,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2510.03259","last_updated":"2026-05-31T02:55:06Z","snapshot_observed_at":"2026-08-16T20:27:51.024961Z","submitted_at":"2025-09-26T14:05:48Z","title":"Verifying Meta-Awareness via Predictive Rewards in Reasoning Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T15:50:30.486633Z"},"links":{"citing_paper":"/paper/2510.03259"},"observation_digest":"sha256:5e964c8e9fecba082802932ca767822d2488cca26e6e7846e6b38894f891d918","observation_id":"72f27256-062e-4977-8a49-dd816e3169d6","resolution":{"observed_at":"2026-08-15T15:50:30.486633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:50:31.916224Z","title":"This finding suggests that the predicted notions can serve as useful cues for problem solving and may enable further performance gains when leveraged during inference","venue":null,"work_id":"599548a5-47f2-4b26-ba90-4c53b611624e","year":2000},"citing_paper":{"arxiv_id":"2510.03259","last_updated":"2026-05-31T02:55:06Z","snapshot_observed_at":"2026-08-16T20:27:51.024961Z","submitted_at":"2025-09-26T14:05:48Z","title":"Verifying Meta-Awareness via Predictive Rewards in Reasoning Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T15:50:30.746297Z"},"links":{"citing_paper":"/paper/2510.03259"},"observation_digest":"sha256:1b27a8a4497e9f690922e246d4671ec3a594a41b320a6c82673503a3b321351c","observation_id":"bb7d3139-9c8e-4afe-84cf-1f0f727edebb","resolution":{"observed_at":"2026-08-15T15:50:31.922281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05563","last_updated":"2025-06-23T18:59:37Z","snapshot_observed_at":"2026-08-16T13:11:43.223334Z","submitted_at":"2024-10-07T23:48:52Z","title":"Rational Metareasoning for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05563","snapshot_observed_at":"2026-08-15T15:50:30.511531Z","title":"Rational metareasoning for large language models.arXiv preprint arXiv:2410.05563,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03259","last_updated":"2026-05-31T02:55:06Z","snapshot_observed_at":"2026-08-16T20:27:51.024961Z","submitted_at":"2025-09-26T14:05:48Z","title":"Verifying Meta-Awareness via Predictive Rewards in Reasoning Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T15:50:30.511531Z"},"links":{"cited_paper":"/paper/2410.05563","citing_paper":"/paper/2510.03259"},"observation_digest":"sha256:7344d2facd448e133717ac3f1698a7dcf253ebcff29d19cbc3b8e5cff8c93ced","observation_id":"81a03056-42e1-4202-8f9d-ea5cec19d62b","resolution":{"observed_at":"2026-08-15T15:50:30.511531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.01604","last_updated":"2025-08-03T05:41:36Z","snapshot_observed_at":"2026-08-16T20:28:20.390944Z","submitted_at":"2025-08-03T05:41:36Z","title":"Enhancing Math Reasoning in Small-sized LLMs via Preview Difficulty-Aware Intervention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.01604","snapshot_observed_at":"2026-08-15T15:50:30.520995Z","title":"URLhttps://arxiv.org/ abs/2508.01604","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03259","last_updated":"2026-05-31T02:55:06Z","snapshot_observed_at":"2026-08-16T20:27:51.024961Z","submitted_at":"2025-09-26T14:05:48Z","title":"Verifying Meta-Awareness via Predictive Rewards in Reasoning Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T15:50:30.520995Z"},"links":{"cited_paper":"/paper/2508.01604","citing_paper":"/paper/2510.03259"},"observation_digest":"sha256:b03ea49769e95c7bfffadca21996c228e4586696588de8962c6d45952a2754c4","observation_id":"0e14117a-1d47-43aa-be14-4f068fd2bcac","resolution":{"observed_at":"2026-08-15T15:50:30.520995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17291","last_updated":"2025-08-24T10:36:36Z","snapshot_observed_at":"2026-08-16T20:28:05.846022Z","submitted_at":"2025-08-24T10:36:36Z","title":"Meta-R1: Empowering Large Reasoning Models with Metacognition","version":1},"cited_work":{"arxiv_id":"2508.17291","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.17291","snapshot_observed_at":"2026-08-15T15:50:31.812770Z","title":"Meta-R1: Empowering Large Reasoning Models with Metacognition","venue":"cs.AI","work_id":"2872b93d-ed71-474b-aa4e-4247f8c9db25","year":2025},"citing_paper":{"arxiv_id":"2510.03259","last_updated":"2026-05-31T02:55:06Z","snapshot_observed_at":"2026-08-16T20:27:51.024961Z","submitted_at":"2025-09-26T14:05:48Z","title":"Verifying Meta-Awareness via Predictive Rewards in Reasoning Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T15:50:30.527738Z"},"links":{"cited_paper":"/paper/2508.17291","citing_paper":"/paper/2510.03259"},"observation_digest":"sha256:f1a150619d876a546953c9636b6641fc4660084baa8559483c1c64a55dc4e10c","observation_id":"a8aa4e49-60f9-4cfd-8f75-9e34b490732c","resolution":{"observed_at":"2026-08-15T15:50:31.819104Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13379","last_updated":"2025-06-26T14:06:49Z","snapshot_observed_at":"2026-08-16T17:02:25.944512Z","submitted_at":"2025-05-19T17:24:16Z","title":"Thinkless: LLM Learns When to Think","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13379","snapshot_observed_at":"2026-08-15T15:50:30.535082Z","title":"Thinkless: Llm learns when to think.arXiv preprint arXiv:2505.13379,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03259","last_updated":"2026-05-31T02:55:06Z","snapshot_observed_at":"2026-08-16T20:27:51.024961Z","submitted_at":"2025-09-26T14:05:48Z","title":"Verifying Meta-Awareness via Predictive Rewards in Reasoning Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T15:50:30.535082Z"},"links":{"cited_paper":"/paper/2505.13379","citing_paper":"/paper/2510.03259"},"observation_digest":"sha256:df3f2b963aed8a34e82061ace0361bdd93085552dfc07a6e9873eca9d0e4abbc","observation_id":"060c60f2-3ee7-43e3-9add-38dba8d67927","resolution":{"observed_at":"2026-08-15T15:50:30.535082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.04460","last_updated":"2026-06-23T08:45:55Z","snapshot_observed_at":"2026-08-16T23:35:19.027508Z","submitted_at":"2025-08-06T13:59:17Z","title":"From \"Aha Moments\" to Controllable Thinking: Toward Meta-Cognitive Reasoning in Large Reasoning Models via Decoupled Reasoning and Control","version":2},"cited_work":{"arxiv_id":"2508.04460","doi":"10.48550/arxiv.2508.04460","metadata_source":"pith","pith_arxiv_id":"2508.04460","snapshot_observed_at":"2026-08-15T18:16:14.067578Z","title":"From \"Aha Moments\" to Controllable Thinking: Toward Meta-Cognitive Reasoning in Large Reasoning Models via Decoupled Reasoning and Control","venue":"cs.AI","work_id":"e53bd4c9-83cc-476c-9528-5e610e74463a","year":2025},"citing_paper":{"arxiv_id":"2510.03259","last_updated":"2026-05-31T02:55:06Z","snapshot_observed_at":"2026-08-16T20:27:51.024961Z","submitted_at":"2025-09-26T14:05:48Z","title":"Verifying Meta-Awareness via Predictive Rewards in Reasoning Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T15:50:30.550768Z"},"links":{"cited_paper":"/paper/2508.04460","citing_paper":"/paper/2510.03259"},"observation_digest":"sha256:b4e01171b92b65f64738953994a299f64f39a5b9c2f76b61c18a92c3f20c3a8d","observation_id":"0210e4cd-170e-450d-85b7-e82d1d1bb23a","resolution":{"observed_at":"2026-08-15T15:50:31.156183Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.23317","last_updated":"2025-07-31T07:54:58Z","snapshot_observed_at":"2026-08-16T20:28:20.843826Z","submitted_at":"2025-07-31T07:54:58Z","title":"Good Learners Think Their Thinking: Generative PRM Makes Large Reasoning Model More Efficient Math Learner","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.23317","snapshot_observed_at":"2026-08-15T15:50:30.556542Z","title":"Good learners think their thinking: Generative prm makes large reasoning model more efficient math learner.arXiv preprint arXiv:2507.23317,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03259","last_updated":"2026-05-31T02:55:06Z","snapshot_observed_at":"2026-08-16T20:27:51.024961Z","submitted_at":"2025-09-26T14:05:48Z","title":"Verifying Meta-Awareness via Predictive Rewards in Reasoning Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T15:50:30.556542Z"},"links":{"cited_paper":"/paper/2507.23317","citing_paper":"/paper/2510.03259"},"observation_digest":"sha256:c35233b345343c6476bb0e0c41adb0008d5f9e7e5469d2c146d372ceff2f0bff","observation_id":"655d1a57-9d47-49ec-a10d-288d54480e52","resolution":{"observed_at":"2026-08-15T15:50:30.556542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2505.18822","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:50:31.120698Z","title":"URLhttps://arxiv.org/abs/2505.18822","venue":null,"work_id":"13106b5f-09ef-4752-b1e5-b906590761f4","year":null},"citing_paper":{"arxiv_id":"2510.03259","last_updated":"2026-05-31T02:55:06Z","snapshot_observed_at":"2026-08-16T20:27:51.024961Z","submitted_at":"2025-09-26T14:05:48Z","title":"Verifying Meta-Awareness via Predictive Rewards in Reasoning Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T15:50:30.563064Z"},"links":{"citing_paper":"/paper/2510.03259"},"observation_digest":"sha256:5de170ec5c631a528bdd7e266755432570537b2b76e34cb105b0543f804f5d2d","observation_id":"d8537c46-3728-48f9-872d-01f3385e696c","resolution":{"observed_at":"2026-08-15T15:50:31.126155Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.00829","last_updated":"2025-04-01T14:18:38Z","snapshot_observed_at":"2026-08-16T12:44:55.811344Z","submitted_at":"2025-04-01T14:18:38Z","title":"How Difficulty-Aware Staged Reinforcement Learning Enhances LLMs' Reasoning Capabilities: A Preliminary Experimental Study","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.00829","snapshot_observed_at":"2026-08-15T15:50:30.575386Z","title":"URL https://arxiv.org/abs/2504.00829","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03259","last_updated":"2026-05-31T02:55:06Z","snapshot_observed_at":"2026-08-16T20:27:51.024961Z","submitted_at":"2025-09-26T14:05:48Z","title":"Verifying Meta-Awareness via Predictive Rewards in Reasoning Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T15:50:30.575386Z"},"links":{"cited_paper":"/paper/2504.00829","citing_paper":"/paper/2510.03259"},"observation_digest":"sha256:2d2b1b7483a16fbb359a3b930fe9b60a7c04f40b56d0af021278860d83f8e138","observation_id":"efd4feab-0cce-4f40-be27-6652d92b3363","resolution":{"observed_at":"2026-08-15T15:50:30.575386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14643","last_updated":"2025-05-29T17:52:30Z","snapshot_observed_at":"2026-08-19T18:14:16.611882Z","submitted_at":"2025-02-20T15:30:27Z","title":"Length-Controlled Margin-Based Preference Optimization without Reference Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14643","snapshot_observed_at":"2026-08-15T15:50:30.584550Z","title":"URLhttps: //arxiv.org/abs/2502.14643","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03259","last_updated":"2026-05-31T02:55:06Z","snapshot_observed_at":"2026-08-16T20:27:51.024961Z","submitted_at":"2025-09-26T14:05:48Z","title":"Verifying Meta-Awareness via Predictive Rewards in Reasoning Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T15:50:30.584550Z"},"links":{"cited_paper":"/paper/2502.14643","citing_paper":"/paper/2510.03259"},"observation_digest":"sha256:93320b87091b0edeeb1386954b75945d6df48898fbb8560a3c5cef963d4e77a0","observation_id":"c9d9a4f5-ae23-40c0-819c-d341314aaf43","resolution":{"observed_at":"2026-08-15T15:50:30.584550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-08-13T12:34:54.476684Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-15T15:50:30.590430Z","title":"11 Preprint Zichen Liu, Changyu Chen, Wenjun Li, Penghui Qi, Tianyu Pang, Chao Du, Wee Sun Lee, and Min Lin","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03259","last_updated":"2026-05-31T02:55:06Z","snapshot_observed_at":"2026-08-16T20:27:51.024961Z","submitted_at":"2025-09-26T14:05:48Z","title":"Verifying Meta-Awareness via Predictive Rewards in Reasoning Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T15:50:30.590430Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2510.03259"},"observation_digest":"sha256:f850e9053e17f1e1e91a56f167f8a0e5e7a8f1200f18e27c7b27dd1889380776","observation_id":"c465e968-7558-4cef-b3ec-86586aae680a","resolution":{"observed_at":"2026-08-15T15:50:30.590430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:50:30.597921Z","title":"Ziyang Ma, Qingyue Yuan, Zhenglin Wang, and Deyu Zhou","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03259","last_updated":"2026-05-31T02:55:06Z","snapshot_observed_at":"2026-08-16T20:27:51.024961Z","submitted_at":"2025-09-26T14:05:48Z","title":"Verifying Meta-Awareness via Predictive Rewards in Reasoning Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T15:50:30.597921Z"},"links":{"citing_paper":"/paper/2510.03259"},"observation_digest":"sha256:2c8f342cae2c2e39ccd1ddc2e15013399f75b88e54742d36e75466a9dcbc9bf3","observation_id":"28959a3d-2057-4412-8dfc-c17f8898ea18","resolution":{"observed_at":"2026-08-15T15:50:30.597921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20541","last_updated":"2025-09-05T08:42:04Z","snapshot_observed_at":"2026-08-16T00:59:45.133911Z","submitted_at":"2025-07-28T05:56:40Z","title":"MeLA: A Metacognitive LLM-Driven Architecture for Automatic Heuristic Design","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20541","snapshot_observed_at":"2026-08-15T15:50:30.626738Z","title":"Mela: A metacognitive llm-driven architec- ture for automatic heuristic design.arXiv preprint arXiv:2507.20541,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03259","last_updated":"2026-05-31T02:55:06Z","snapshot_observed_at":"2026-08-16T20:27:51.024961Z","submitted_at":"2025-09-26T14:05:48Z","title":"Verifying Meta-Awareness via Predictive Rewards in Reasoning Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T15:50:30.626738Z"},"links":{"cited_paper":"/paper/2507.20541","citing_paper":"/paper/2510.03259"},"observation_digest":"sha256:da78ac968536fc288573d817b7e13d69eda4747072700ccefa62f2c11592504c","observation_id":"1c53317d-d5a3-4a31-bbe8-5a5a6f2aef8e","resolution":{"observed_at":"2026-08-15T15:50:30.626738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07572","last_updated":"2025-03-10T17:40:43Z","snapshot_observed_at":"2026-08-16T12:51:25.160206Z","submitted_at":"2025-03-10T17:40:43Z","title":"Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07572","snapshot_observed_at":"2026-08-15T15:50:30.633542Z","title":"Optimizing test-time compute via meta reinforcement fine- tuning.arXiv preprint arXiv:2503.07572,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03259","last_updated":"2026-05-31T02:55:06Z","snapshot_observed_at":"2026-08-16T20:27:51.024961Z","submitted_at":"2025-09-26T14:05:48Z","title":"Verifying Meta-Awareness via Predictive Rewards in Reasoning Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T15:50:30.633542Z"},"links":{"cited_paper":"/paper/2503.07572","citing_paper":"/paper/2510.03259"},"observation_digest":"sha256:e24d219e2a3f7aee4df4f091a6c9f220829b56cfb48384fd9b20329a37d47c48","observation_id":"272acc1f-67a2-4e1c-a94c-5280c1bd8e7d","resolution":{"observed_at":"2026-08-15T15:50:30.633542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-15T15:50:30.639257Z","title":"URL https://arxiv.org/abs/2402.03300","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03259","last_updated":"2026-05-31T02:55:06Z","snapshot_observed_at":"2026-08-16T20:27:51.024961Z","submitted_at":"2025-09-26T14:05:48Z","title":"Verifying Meta-Awareness via Predictive Rewards in Reasoning Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T15:50:30.639257Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2510.03259"},"observation_digest":"sha256:576380f170fd00795154066d5c7591e4dde6f06981b08e0e14df1ecc66b026ef","observation_id":"da16f71c-ba51-44e4-8f6f-d5f87a377629","resolution":{"observed_at":"2026-08-15T15:50:30.639257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05520","last_updated":"2026-06-21T17:23:43Z","snapshot_observed_at":"2026-08-19T18:44:04.628527Z","submitted_at":"2025-04-07T21:31:31Z","title":"Efficient Reinforcement Finetuning via Adaptive Curriculum Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05520","snapshot_observed_at":"2026-08-15T15:50:30.645256Z","title":"Efficient reinforcement finetun- ing via adaptive curriculum learning.arXiv preprint arXiv:2504.05520,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03259","last_updated":"2026-05-31T02:55:06Z","snapshot_observed_at":"2026-08-16T20:27:51.024961Z","submitted_at":"2025-09-26T14:05:48Z","title":"Verifying Meta-Awareness via Predictive Rewards in Reasoning Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T15:50:30.645256Z"},"links":{"cited_paper":"/paper/2504.05520","citing_paper":"/paper/2510.03259"},"observation_digest":"sha256:903af4e1f6bb4f9542973fcf6ac30710002422c611d8dce4041c16e8564154b7","observation_id":"8dd391c5-f046-48c3-88f3-c235b574892c","resolution":{"observed_at":"2026-08-15T15:50:30.645256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01815","last_updated":"2017-12-05T18:45:38Z","snapshot_observed_at":"2026-08-14T20:06:37.819179Z","submitted_at":"2017-12-05T18:45:38Z","title":"Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.01815","snapshot_observed_at":"2026-08-15T15:50:30.662398Z","title":"Mastering chess and shogi by self-play with a general reinforcement learning algorithm.arXiv preprint arXiv:1712.01815,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03259","last_updated":"2026-05-31T02:55:06Z","snapshot_observed_at":"2026-08-16T20:27:51.024961Z","submitted_at":"2025-09-26T14:05:48Z","title":"Verifying Meta-Awareness via Predictive Rewards in Reasoning Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T15:50:30.662398Z"},"links":{"cited_paper":"/paper/1712.01815","citing_paper":"/paper/2510.03259"},"observation_digest":"sha256:6684301c42b0a5ddfbe25a7d49ca233e189f075d2951d18a0bcfe3e556620369","observation_id":"b158b652-4c66-4a5c-8741-98c348e1f969","resolution":{"observed_at":"2026-08-15T15:50:30.662398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:50:30.673152Z","title":"Proofwriter: Generating implications, proofs, and abductive statements over natural language","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.03259","last_updated":"2026-05-31T02:55:06Z","snapshot_observed_at":"2026-08-16T20:27:51.024961Z","submitted_at":"2025-09-26T14:05:48Z","title":"Verifying Meta-Awareness via Predictive Rewards in Reasoning Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T15:50:30.673152Z"},"links":{"citing_paper":"/paper/2510.03259"},"observation_digest":"sha256:1063d02aeed8cb86bee57a8402e55dceeadea7031be2781771547b9060e1c722","observation_id":"fc43aa8e-3d76-4735-940d-3b19e1ec9db3","resolution":{"observed_at":"2026-08-15T15:50:30.673152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-15T15:50:30.681257Z","title":"Llama: Open and efficient foundation language models.arXiv preprint arXiv:2302.13971,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03259","last_updated":"2026-05-31T02:55:06Z","snapshot_observed_at":"2026-08-16T20:27:51.024961Z","submitted_at":"2025-09-26T14:05:48Z","title":"Verifying Meta-Awareness via Predictive Rewards in Reasoning Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T15:50:30.681257Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2510.03259"},"observation_digest":"sha256:a9b0bb0931b81501d08f832b3049afcdc8eacdffd3717e4d7122ac4009e9790f","observation_id":"48a62f97-aebc-442b-8e85-748f3395d87a","resolution":{"observed_at":"2026-08-15T15:50:30.681257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:50:30.688457Z","title":"Learning when to think: Shaping adaptive reasoning in r1-style models via multi-stage rl","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03259","last_updated":"2026-05-31T02:55:06Z","snapshot_observed_at":"2026-08-16T20:27:51.024961Z","submitted_at":"2025-09-26T14:05:48Z","title":"Verifying Meta-Awareness via Predictive Rewards in Reasoning Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T15:50:30.688457Z"},"links":{"citing_paper":"/paper/2510.03259"},"observation_digest":"sha256:d54ce867efdbfd127ac8cf647bb02f8fb0c5499e10fc3e84b01e1ef890734444","observation_id":"4f0fab65-4878-4005-8546-e25e6efbac5f","resolution":{"observed_at":"2026-08-15T15:50:30.688457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09501","last_updated":"2025-05-27T03:22:35Z","snapshot_observed_at":"2026-08-19T23:00:01.582498Z","submitted_at":"2025-03-12T16:05:31Z","title":"ReMA: Learning to Meta-think for LLMs with Multi-Agent Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09501","snapshot_observed_at":"2026-08-15T15:50:30.694124Z","title":"Rema: Learning to meta-think for llms with multi-agent reinforcement learning.arXiv preprint arXiv:2503.09501,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03259","last_updated":"2026-05-31T02:55:06Z","snapshot_observed_at":"2026-08-16T20:27:51.024961Z","submitted_at":"2025-09-26T14:05:48Z","title":"Verifying Meta-Awareness via Predictive Rewards in Reasoning Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T15:50:30.694124Z"},"links":{"cited_paper":"/paper/2503.09501","citing_paper":"/paper/2510.03259"},"observation_digest":"sha256:afcbf9fd1d39550a2191162ac4157ddcc39771a4c504dbe959b77668c1a4ed9d","observation_id":"63b88547-fa44-4002-a585-e99974574f45","resolution":{"observed_at":"2026-08-15T15:50:30.694124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20101","last_updated":"2025-05-27T12:54:28Z","snapshot_observed_at":"2026-08-17T02:42:11.295323Z","submitted_at":"2025-05-26T15:08:51Z","title":"Adaptive Deep Reasoning: Triggering Deep Thinking When Needed","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20101","snapshot_observed_at":"2026-08-15T15:50:30.701259Z","title":"Yunhao Wang, Yuhao Zhang, Tinghao Yu, Can Xu, Feng Zhang, and Fengzong Lian","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03259","last_updated":"2026-05-31T02:55:06Z","snapshot_observed_at":"2026-08-16T20:27:51.024961Z","submitted_at":"2025-09-26T14:05:48Z","title":"Verifying Meta-Awareness via Predictive Rewards in Reasoning Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T15:50:30.701259Z"},"links":{"cited_paper":"/paper/2505.20101","citing_paper":"/paper/2510.03259"},"observation_digest":"sha256:af936992274f78e380a8472b8856920b21e741cc12920d66203a1d78e33f4b7a","observation_id":"d8ce3474-982d-46c6-8bf3-d0ee46a5aba6","resolution":{"observed_at":"2026-08-15T15:50:30.701259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05256","last_updated":"2025-06-06T02:38:39Z","snapshot_observed_at":"2026-08-17T10:46:27.297066Z","submitted_at":"2025-06-05T17:17:05Z","title":"Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05256","snapshot_observed_at":"2026-08-15T15:50:30.707660Z","title":"URLhttps://arxiv.org/abs/2506","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03259","last_updated":"2026-05-31T02:55:06Z","snapshot_observed_at":"2026-08-16T20:27:51.024961Z","submitted_at":"2025-09-26T14:05:48Z","title":"Verifying Meta-Awareness via Predictive Rewards in Reasoning Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T15:50:30.707660Z"},"links":{"cited_paper":"/paper/2506.05256","citing_paper":"/paper/2510.03259"},"observation_digest":"sha256:20d1dd5625de3b9dcab17ca94a0c4cd7f4173d197d6c1e3fb0cbc34adff65be2","observation_id":"84067768-e4ab-44df-a498-07d6b4bca3d6","resolution":{"observed_at":"2026-08-15T15:50:30.707660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-18T05:01:20.543826Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-15T15:50:30.713753Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03259","last_updated":"2026-05-31T02:55:06Z","snapshot_observed_at":"2026-08-16T20:27:51.024961Z","submitted_at":"2025-09-26T14:05:48Z","title":"Verifying Meta-Awareness via Predictive Rewards in Reasoning Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T15:50:30.713753Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2510.03259"},"observation_digest":"sha256:b9dbaa5d9a58b5fe8f0cca8ce3915c5db03f4a4065f1c5c7a1fb990a78d68078","observation_id":"4e0888dc-3986-4834-ad6e-5912eb61255a","resolution":{"observed_at":"2026-08-15T15:50:30.713753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13417","last_updated":"2025-05-19T17:50:52Z","snapshot_observed_at":"2026-08-16T04:08:44.793379Z","submitted_at":"2025-05-19T17:50:52Z","title":"AdaptThink: Reasoning Models Can Learn When to Think","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13417","snapshot_observed_at":"2026-08-15T15:50:30.720466Z","title":"Adaptthink: Reasoning models can learn when to think.arXiv preprint arXiv:2505.13417, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03259","last_updated":"2026-05-31T02:55:06Z","snapshot_observed_at":"2026-08-16T20:27:51.024961Z","submitted_at":"2025-09-26T14:05:48Z","title":"Verifying Meta-Awareness via Predictive Rewards in Reasoning Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T15:50:30.720466Z"},"links":{"cited_paper":"/paper/2505.13417","citing_paper":"/paper/2510.03259"},"observation_digest":"sha256:6b335fcfc94eb40af67109551f6ae28675a23281d3a9732d36c0520137a4c1c7","observation_id":"f66f512b-2ada-40d0-9e3f-5a845488f422","resolution":{"observed_at":"2026-08-15T15:50:30.720466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2504.09696","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:50:30.899899Z","title":"URLhttps://arxiv.org/abs/2504.09696","venue":null,"work_id":"1373c4db-42fb-46ce-8958-f1a807b4129e","year":null},"citing_paper":{"arxiv_id":"2510.03259","last_updated":"2026-05-31T02:55:06Z","snapshot_observed_at":"2026-08-16T20:27:51.024961Z","submitted_at":"2025-09-26T14:05:48Z","title":"Verifying Meta-Awareness via Predictive Rewards in Reasoning Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T15:50:30.725943Z"},"links":{"citing_paper":"/paper/2510.03259"},"observation_digest":"sha256:ddaff9a77115d1fc73f9126489e352b712bff23f163e1d596ea02ecd99267e33","observation_id":"de7451e4-54b1-45b0-8633-0a96f4754abd","resolution":{"observed_at":"2026-08-15T15:50:30.911216Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:50:31.935114Z","title":"Analytical reasoning of text","venue":null,"work_id":"06116c00-043f-4931-9e23-2727b44812bc","year":2022},"citing_paper":{"arxiv_id":"2510.03259","last_updated":"2026-05-31T02:55:06Z","snapshot_observed_at":"2026-08-16T20:27:51.024961Z","submitted_at":"2025-09-26T14:05:48Z","title":"Verifying Meta-Awareness via Predictive Rewards in Reasoning Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T15:50:30.731741Z"},"links":{"citing_paper":"/paper/2510.03259"},"observation_digest":"sha256:a2ec5854eb2211c6d141ddaea5867e647deda5f924a05ee74fea9a5a6ea48c6a","observation_id":"1c03559e-9e82-4393-ade9-41941fd42281","resolution":{"observed_at":"2026-08-15T15:50:31.941002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19918","last_updated":"2026-05-07T16:58:35Z","snapshot_observed_at":"2026-08-02T05:40:27.766263Z","submitted_at":"2025-02-27T09:40:13Z","title":"Meta-Reasoner: Dynamic Guidance for Optimized Inference-time Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19918","snapshot_observed_at":"2026-08-15T15:50:30.667850Z","title":"Beyond the imitation game: Quantifying and extrapolating the capabilities of language models.Transactions on Machine Learning Research","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03259","last_updated":"2026-05-31T02:55:06Z","snapshot_observed_at":"2026-08-16T20:27:51.024961Z","submitted_at":"2025-09-26T14:05:48Z","title":"Verifying Meta-Awareness via Predictive Rewards in Reasoning Models","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-15T15:50:30.667850Z"},"links":{"cited_paper":"/paper/2502.19918","citing_paper":"/paper/2510.03259"},"observation_digest":"sha256:f6898103c80422d59a62065724f35ce029acf9d99258e82cff8a0900d4cb07f4","observation_id":"4e85181f-eb2e-4b2f-99c2-46df01202708","resolution":{"observed_at":"2026-08-15T15:50:30.667850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-15T15:50:30.503057Z","title":"Use the ARC-Challenge split for ARC-C results","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03259","last_updated":"2026-05-31T02:55:06Z","snapshot_observed_at":"2026-08-16T20:27:51.024961Z","submitted_at":"2025-09-26T14:05:48Z","title":"Verifying Meta-Awareness via Predictive Rewards in Reasoning Models","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-15T15:50:30.503057Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2510.03259"},"observation_digest":"sha256:fc55021d0b67dc0c8d8f36e97ee69f365b22d3a2a6c33ad08450edb225d761bf","observation_id":"82d7913f-c030-4e38-91c5-54a6e7205dd5","resolution":{"observed_at":"2026-08-15T15:50:30.503057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:50:31.976793Z","title":"Logic-lm: Empowering large lan- guage models with symbolic solvers for faithful logical reasoning","venue":null,"work_id":"c6d65391-ab53-4619-b8bb-5f293211f2ec","year":2023},"citing_paper":{"arxiv_id":"2510.03259","last_updated":"2026-05-31T02:55:06Z","snapshot_observed_at":"2026-08-16T20:27:51.024961Z","submitted_at":"2025-09-26T14:05:48Z","title":"Verifying Meta-Awareness via Predictive Rewards in Reasoning Models","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-15T15:50:30.614165Z"},"links":{"citing_paper":"/paper/2510.03259"},"observation_digest":"sha256:e02af275c1456fc6660b850193702c7a35b7c6b1a69e138c01a62b825b743ef3","observation_id":"29094c5c-a1a3-405c-9506-78fcd2869bf9","resolution":{"observed_at":"2026-08-15T15:50:31.983802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.11582","last_updated":"2025-08-15T16:40:29Z","snapshot_observed_at":"2026-08-20T00:05:40.458313Z","submitted_at":"2025-08-15T16:40:29Z","title":"Aware First, Think Less: Dynamic Boundary Self-Awareness Drives Extreme Reasoning Efficiency in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.11582","snapshot_observed_at":"2026-08-15T15:50:30.494962Z","title":"Aware first, think less: Dynamic boundary self-awareness drives extreme reasoning effi- ciency in large language models.arXiv preprint arXiv:2508.11582, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03259","last_updated":"2026-05-31T02:55:06Z","snapshot_observed_at":"2026-08-16T20:27:51.024961Z","submitted_at":"2025-09-26T14:05:48Z","title":"Verifying Meta-Awareness via Predictive Rewards in Reasoning Models","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-15T15:50:30.494962Z"},"links":{"cited_paper":"/paper/2508.11582","citing_paper":"/paper/2510.03259"},"observation_digest":"sha256:305cf461b4dae93f72d464a4bae7136daf6411209a08f56c155c82ae6da26e1f","observation_id":"f3b4834e-9805-4b7f-bf7c-74ee1bd3fecf","resolution":{"observed_at":"2026-08-15T15:50:30.494962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14520","last_updated":"2025-04-20T07:34:26Z","snapshot_observed_at":"2026-08-18T07:29:47.820993Z","submitted_at":"2025-04-20T07:34:26Z","title":"Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14520","snapshot_observed_at":"2026-08-15T15:50:30.476760Z","title":"Meta-thinking in llms via multi-agent reinforcement learning: A survey.arXiv preprint arXiv:2504.14520,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03259","last_updated":"2026-05-31T02:55:06Z","snapshot_observed_at":"2026-08-16T20:27:51.024961Z","submitted_at":"2025-09-26T14:05:48Z","title":"Verifying Meta-Awareness via Predictive Rewards in Reasoning Models","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-15T15:50:30.476760Z"},"links":{"cited_paper":"/paper/2504.14520","citing_paper":"/paper/2510.03259"},"observation_digest":"sha256:adb04cf9d56e91832cf69f1a4b9bba5013467786447ff629207c0e5c897d4b3e","observation_id":"d795cdaf-31c7-4e31-b172-fad1c89479b0","resolution":{"observed_at":"2026-08-15T15:50:30.476760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:50:30.741094Z","title":"doi: 10.18653/v1/2022.findings-naacl.177","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.03259","last_updated":"2026-05-31T02:55:06Z","snapshot_observed_at":"2026-08-16T20:27:51.024961Z","submitted_at":"2025-09-26T14:05:48Z","title":"Verifying Meta-Awareness via Predictive Rewards in Reasoning Models","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-15T15:50:30.741094Z"},"links":{"citing_paper":"/paper/2510.03259"},"observation_digest":"sha256:41053b6bfabeac98384df055de78b049b4f2b755c1fdcc9a17f9f1a8bfe8fd78","observation_id":"2408906d-ff44-4368-87b2-87ed76bb0f58","resolution":{"observed_at":"2026-08-15T15:50:30.741094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:50:30.620237Z","title":"Concise: Confidence-guided compression in step-by-step efficient reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03259","last_updated":"2026-05-31T02:55:06Z","snapshot_observed_at":"2026-08-16T20:27:51.024961Z","submitted_at":"2025-09-26T14:05:48Z","title":"Verifying Meta-Awareness via Predictive Rewards in Reasoning Models","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-15T15:50:30.620237Z"},"links":{"citing_paper":"/paper/2510.03259"},"observation_digest":"sha256:c1b1ff2c433ac6e7715098aa497b80625bf59ef58665a28f3fe6134be61e6f55","observation_id":"b1fb6ac6-5973-4bf2-a6e3-a0054b9b547e","resolution":{"observed_at":"2026-08-15T15:50:30.620237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T15:50:30.542674Z","title":"Daya Guo, Dejian Yang, Haowei Zhang, Junxiao Song, Ruoyu Zhang, Runxin Xu, Qihao Zhu, Shirong Ma, Peiyi Wang, Xiao Bi, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03259","last_updated":"2026-05-31T02:55:06Z","snapshot_observed_at":"2026-08-16T20:27:51.024961Z","submitted_at":"2025-09-26T14:05:48Z","title":"Verifying Meta-Awareness via Predictive Rewards in Reasoning Models","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T15:50:30.542674Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2510.03259"},"observation_digest":"sha256:740ba94f0050baaaac9b4777890140f5689fd3c296b4068670062ef9b282c8b1","observation_id":"0a5d3ff6-f692-44ed-8222-d88fffd8cbdd","resolution":{"observed_at":"2026-08-15T15:50:30.542674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-08-17T16:48:59.674177Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-08-15T15:50:30.465339Z","title":"URLhttps://arxiv.org/ abs/2503.04697","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03259","last_updated":"2026-05-31T02:55:06Z","snapshot_observed_at":"2026-08-16T20:27:51.024961Z","submitted_at":"2025-09-26T14:05:48Z","title":"Verifying Meta-Awareness via Predictive Rewards in Reasoning Models","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-15T15:50:30.465339Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2510.03259"},"observation_digest":"sha256:431e0b230a076435a03fbf85685cb13eb4328d95b0db7a602abcbe5d9d0d6966","observation_id":"c00beebe-3387-48e6-a33a-6a1fae0f7fa0","resolution":{"observed_at":"2026-08-15T15:50:30.465339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.03259","last_updated":"2026-05-31T02:55:06Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T20:27:51.024961Z","submitted_at":"2025-09-26T14:05:48Z","title":"Verifying Meta-Awareness via Predictive Rewards in Reasoning Models"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":30,"verified_exact":3,"verified_fuzzy":3},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 1 inbound Pith citation observation for arXiv:2510.03259."}