{"as_of":"2026-08-21T17:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:060501e2bfd0a3c1ef11d75dc7613f2e91e5225d86ee0310dd985452d567c205","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:24:24.786925Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":26,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T18:21:08.381567Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T04:19:34.020533Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","snapshot_observed_at":"2026-08-16T19:48:43.811387Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06395","snapshot_observed_at":"2026-08-06T23:35:24.315457Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-16T10:19:27.663072Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:24.315457Z"},"links":{"cited_paper":"/paper/2506.06395","citing_paper":"/paper/2506.17219"},"observation_digest":"sha256:fa5f7c734ecab27ddcc32d40b3c64320c8558b6b6139a06dfabc625319246f7a","observation_id":"a7b0ad1c-dfe7-4e4a-adae-ca65f8b91856","resolution":{"observed_at":"2026-08-06T23:35:24.315457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","snapshot_observed_at":"2026-08-16T19:48:43.811387Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06395","snapshot_observed_at":"2026-08-06T14:43:52.966250Z","title":"Confidence is all you need: Few-shot rl fine-tuning of language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18122","last_updated":"2025-07-24T06:17:39Z","snapshot_observed_at":"2026-08-17T18:27:07.201885Z","submitted_at":"2025-07-24T06:17:39Z","title":"Maximizing Prefix-Confidence at Test-Time Efficiently Improves Mathematical Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T14:43:52.966250Z"},"links":{"cited_paper":"/paper/2506.06395","citing_paper":"/paper/2507.18122"},"observation_digest":"sha256:f29a3b2ca2775ee11b08eda76579cb802cb289904c274e15fdfd5d5e8838f508","observation_id":"bfc426df-37f3-4055-877d-698b692486d3","resolution":{"observed_at":"2026-08-06T14:43:52.966250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","snapshot_observed_at":"2026-08-16T19:48:43.811387Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06395","snapshot_observed_at":"2026-08-15T18:21:08.381567Z","title":"Confidence is all you need: Few-shot rl fine-tuning of language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.18391","last_updated":"2025-07-24T13:14:25Z","snapshot_observed_at":"2026-08-17T14:04:48.290694Z","submitted_at":"2025-07-24T13:14:25Z","title":"Revisiting LLM Reasoning via Information Bottleneck","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T18:21:08.381567Z"},"links":{"cited_paper":"/paper/2506.06395","citing_paper":"/paper/2507.18391"},"observation_digest":"sha256:838d6c2d44be6c7647105cd8a09ce7f7e78d9c3cd94c440c81a3a04e5d217537","observation_id":"b606fae2-3e58-4654-a66b-1e6442e05a64","resolution":{"observed_at":"2026-08-15T18:21:08.381567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","snapshot_observed_at":"2026-08-16T19:48:43.811387Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","version":3},"cited_work":{"arxiv_id":"2506.06395","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06395","snapshot_observed_at":"2026-07-04T04:19:34.020533Z","title":"arXiv preprint arXiv:2506.06395 , year=","venue":null,"work_id":"7732e7d1-769d-48e4-975d-770d911ba6be","year":2025},"citing_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-08-06T15:38:05.011922Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"reference_index":280,"source":"arxiv_source","source_observed_at":"2026-05-18T00:02:24.352947Z"},"links":{"cited_paper":"/paper/2506.06395","citing_paper":"/paper/2509.08827"},"observation_digest":"sha256:90df3c1ff17bad3f194cd24b44e0f929557a02a80b081e4980a74670f4165a46","observation_id":"f726fd13-53e2-436d-a482-265d307afd9b","resolution":{"observed_at":"2026-05-18T00:02:24.731798Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","snapshot_observed_at":"2026-08-16T19:48:43.811387Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","version":3},"cited_work":{"arxiv_id":"2506.06395","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06395","snapshot_observed_at":"2026-07-04T04:19:34.020533Z","title":"arXiv preprint arXiv:2506.06395 , year=","venue":null,"work_id":"7732e7d1-769d-48e4-975d-770d911ba6be","year":2025},"citing_paper":{"arxiv_id":"2509.14234","last_updated":"2026-05-09T12:06:02Z","snapshot_observed_at":"2026-08-13T02:26:26.115035Z","submitted_at":"2025-09-17T17:59:42Z","title":"Compute as Teacher: Turning Inference Compute Into Reference-Free Supervision","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-18T15:45:09.730804Z"},"links":{"cited_paper":"/paper/2506.06395","citing_paper":"/paper/2509.14234"},"observation_digest":"sha256:b2a1abdd4c4f106ac8c10f21b3e886438a3f8fe645cde2b1592f2d907ece4034","observation_id":"0b366e46-e0ea-4246-8b46-8beaf67c8df4","resolution":{"observed_at":"2026-05-18T15:46:34.049081Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","snapshot_observed_at":"2026-08-16T19:48:43.811387Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06395","snapshot_observed_at":"2026-08-04T16:07:33.243783Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:33.243783Z"},"links":{"cited_paper":"/paper/2506.06395","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:e5ce43fea12a80abce658ee6ef95edc2998e80413e87e39636b38a246aff1bf6","observation_id":"0657594b-20a4-42e4-84e5-f1d2760997d2","resolution":{"observed_at":"2026-08-04T16:07:33.243783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","snapshot_observed_at":"2026-08-16T19:48:43.811387Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06395","snapshot_observed_at":"2026-08-04T13:42:31.638150Z","title":"AGIQA-3K: An open database for AI-generated image quality assessment.IEEE Transactions on Circuits and Systems for Video Technology, 34:6833–6846, 2023a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.25787","last_updated":"2026-06-11T06:39:23Z","snapshot_observed_at":"2026-08-18T10:11:01.168025Z","submitted_at":"2025-09-30T04:57:26Z","title":"Self-Evolving Vision-Language Models for Image Quality Assessment via Voting and Ranking","version":5},"reference_index":2010,"source":"pdf_text","source_observed_at":"2026-08-04T13:42:31.638150Z"},"links":{"cited_paper":"/paper/2506.06395","citing_paper":"/paper/2509.25787"},"observation_digest":"sha256:47cde49792a5516cec6794a666cd6c46472c70c216bd2a2ffebb526f41335f3d","observation_id":"5c31a09d-140a-4ba0-b9d4-c89ed43e3847","resolution":{"observed_at":"2026-08-04T13:42:31.638150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","snapshot_observed_at":"2026-08-16T19:48:43.811387Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06395","snapshot_observed_at":"2026-08-04T10:44:30.709604Z","title":"Confidence is all you need: Few-shot rl fine-tuning of language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08977","last_updated":"2026-06-02T08:25:17Z","snapshot_observed_at":"2026-08-16T06:07:54.370427Z","submitted_at":"2025-10-10T03:38:17Z","title":"Breaking the Self-Confirming Loop: Diagnosing and Mitigating Systemic Reward Bias in Self-Rewarding RL","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T10:44:30.709604Z"},"links":{"cited_paper":"/paper/2506.06395","citing_paper":"/paper/2510.08977"},"observation_digest":"sha256:862e5f35d43f7febafecba3a1e22c4ed760dbf8cde3377a17abf1794c44a4ef6","observation_id":"eb0f7f68-99bc-46f6-9fd1-a97d1f67acd1","resolution":{"observed_at":"2026-08-04T10:44:30.709604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","snapshot_observed_at":"2026-08-16T19:48:43.811387Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06395","snapshot_observed_at":"2026-08-03T05:14:19.263434Z","title":"Confidence is all you need: Few-shot rl fine-tuning of language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-12T09:46:52.523380Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:19.263434Z"},"links":{"cited_paper":"/paper/2506.06395","citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:e039e7cc51ee9e59ece0744911e985a87ea22ae3b205fc9ae0ed32216ef99566","observation_id":"80755571-d9f4-4a77-9222-4be56575688e","resolution":{"observed_at":"2026-08-03T05:14:19.263434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","snapshot_observed_at":"2026-08-16T19:48:43.811387Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","version":3},"cited_work":{"arxiv_id":"2506.06395","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06395","snapshot_observed_at":"2026-07-04T04:19:34.020533Z","title":"arXiv preprint arXiv:2506.06395 , year=","venue":null,"work_id":"7732e7d1-769d-48e4-975d-770d911ba6be","year":2025},"citing_paper":{"arxiv_id":"2603.09117","last_updated":"2026-05-27T02:49:05Z","snapshot_observed_at":"2026-08-14T21:08:12.093049Z","submitted_at":"2026-03-10T02:47:59Z","title":"Decoupling Reasoning and Confidence: Resurrecting Calibration in Reinforcement Learning from Verifiable Rewards","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T13:49:11.758336Z"},"links":{"cited_paper":"/paper/2506.06395","citing_paper":"/paper/2603.09117"},"observation_digest":"sha256:f6c5856e2273951e3804a61a892309db254af9a5f36b09c1a199f9343a5d2738","observation_id":"0a48785a-3065-4a6b-a1a4-f3a9b0ac43cd","resolution":{"observed_at":"2026-05-15T13:50:02.385698Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","snapshot_observed_at":"2026-08-16T19:48:43.811387Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06395","snapshot_observed_at":"2026-07-14T20:22:12.729190Z","title":"Li, P., Skripkin, M., Zubrey, A., Kuznetsov, A., and Oseledets, I","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.18375","last_updated":"2026-07-10T23:41:27Z","snapshot_observed_at":"2026-08-07T22:46:43.471693Z","submitted_at":"2026-03-19T00:23:57Z","title":"Relationship-Centered Care: Relatedness and Responsible Design for Human Connections in Mental-Health Care","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-14T20:22:12.729190Z"},"links":{"cited_paper":"/paper/2506.06395","citing_paper":"/paper/2603.18375"},"observation_digest":"sha256:e6b684245476b5aaff368bb304c705c2b16706777f977deb63ecfe5aa238a3ec","observation_id":"7a5f517b-1ed4-42c9-ab8b-c8c24149ceb9","resolution":{"observed_at":"2026-07-14T20:22:12.729190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","snapshot_observed_at":"2026-08-16T19:48:43.811387Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","version":3},"cited_work":{"arxiv_id":"2506.06395","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06395","snapshot_observed_at":"2026-07-04T04:19:34.020533Z","title":"arXiv preprint arXiv:2506.06395 , year=","venue":null,"work_id":"7732e7d1-769d-48e4-975d-770d911ba6be","year":2025},"citing_paper":{"arxiv_id":"2604.03993","last_updated":"2026-04-05T06:30:50Z","snapshot_observed_at":"2026-07-06T22:53:01.835843Z","submitted_at":"2026-04-05T06:30:50Z","title":"Can LLMs Learn to Reason Robustly under Noisy Supervision?","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-13T16:58:42.129870Z"},"links":{"cited_paper":"/paper/2506.06395","citing_paper":"/paper/2604.03993"},"observation_digest":"sha256:fb84d88464c5702380ca2b1685ca2a5ff30141c5e05eea30f9b01b77221762fd","observation_id":"5b8e06bf-4516-44e3-9dd5-59aa413d6e3f","resolution":{"observed_at":"2026-05-13T17:08:01.328397Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","snapshot_observed_at":"2026-08-16T19:48:43.811387Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","version":3},"cited_work":{"arxiv_id":"2506.06395","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06395","snapshot_observed_at":"2026-07-04T04:19:34.020533Z","title":"arXiv preprint arXiv:2506.06395 , year=","venue":null,"work_id":"7732e7d1-769d-48e4-975d-770d911ba6be","year":2025},"citing_paper":{"arxiv_id":"2604.17928","last_updated":"2026-04-20T08:09:01Z","snapshot_observed_at":"2026-08-14T00:24:03.820656Z","submitted_at":"2026-04-20T08:09:01Z","title":"HEALing Entropy Collapse: Enhancing Exploration in Few-Shot RLVR via Hybrid-Domain Entropy Dynamics Alignment","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-10T05:23:08.478393Z"},"links":{"cited_paper":"/paper/2506.06395","citing_paper":"/paper/2604.17928"},"observation_digest":"sha256:bab7e06328a9a02336bca670fe7a6dd650332137cdc361584057a985d6df592e","observation_id":"1b5a1f0a-dbe7-4c35-8427-3e4795804469","resolution":{"observed_at":"2026-05-10T09:23:37.520524Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","snapshot_observed_at":"2026-08-16T19:48:43.811387Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","version":3},"cited_work":{"arxiv_id":"2506.06395","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06395","snapshot_observed_at":"2026-07-04T04:19:34.020533Z","title":"arXiv preprint arXiv:2506.06395 , year=","venue":null,"work_id":"7732e7d1-769d-48e4-975d-770d911ba6be","year":2025},"citing_paper":{"arxiv_id":"2605.01428","last_updated":"2026-05-02T12:59:14Z","snapshot_observed_at":"2026-08-13T04:56:34.015426Z","submitted_at":"2026-05-02T12:59:14Z","title":"Hallucinations Undermine Trust; Metacognition is a Way Forward","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-09T14:29:54.924293Z"},"links":{"cited_paper":"/paper/2506.06395","citing_paper":"/paper/2605.01428"},"observation_digest":"sha256:1e1de5dd64b6825024c0cc03b2c4b02c8b78ad5eba5e779c8331fb70245bcdba","observation_id":"136bdb10-f5df-4391-bbbf-5716b98d57f1","resolution":{"observed_at":"2026-05-11T16:56:07.150385Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","snapshot_observed_at":"2026-08-16T19:48:43.811387Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","version":3},"cited_work":{"arxiv_id":"2506.06395","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06395","snapshot_observed_at":"2026-07-04T04:19:34.020533Z","title":"arXiv preprint arXiv:2506.06395 , year=","venue":null,"work_id":"7732e7d1-769d-48e4-975d-770d911ba6be","year":2025},"citing_paper":{"arxiv_id":"2605.01853","last_updated":"2026-05-03T12:46:41Z","snapshot_observed_at":"2026-08-12T18:09:56.353519Z","submitted_at":"2026-05-03T12:46:41Z","title":"Spatiotemporal Hidden-State Dynamics as a Signature of Internal Reasoning in Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-09T17:20:19.586214Z"},"links":{"cited_paper":"/paper/2506.06395","citing_paper":"/paper/2605.01853"},"observation_digest":"sha256:90480cc11ac4ff360b7fd5083eba492795b6d430c65c05b9787163a7944ea6ee","observation_id":"2225a65a-24bb-45d7-918a-647dc569ecf7","resolution":{"observed_at":"2026-05-11T16:21:08.878934Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","snapshot_observed_at":"2026-08-16T19:48:43.811387Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","version":3},"cited_work":{"arxiv_id":"2506.06395","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06395","snapshot_observed_at":"2026-07-04T04:19:34.020533Z","title":"arXiv preprint arXiv:2506.06395 , year=","venue":null,"work_id":"7732e7d1-769d-48e4-975d-770d911ba6be","year":2025},"citing_paper":{"arxiv_id":"2605.04065","last_updated":"2026-05-07T04:49:30Z","snapshot_observed_at":"2026-08-15T04:21:52.432269Z","submitted_at":"2026-04-11T07:26:04Z","title":"Free Energy-Driven Reinforcement Learning with Adaptive Advantage Shaping for Unsupervised Reasoning in LLMs","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-10T16:58:10.013475Z"},"links":{"cited_paper":"/paper/2506.06395","citing_paper":"/paper/2605.04065"},"observation_digest":"sha256:b5951e511779a5939a1f3357c8f046136d6d4d0d8d8abfd4fe77bb38072b229f","observation_id":"91676cf1-799a-4ac2-8233-5761a453ac46","resolution":{"observed_at":"2026-05-11T07:45:59.928030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","snapshot_observed_at":"2026-08-16T19:48:43.811387Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","version":3},"cited_work":{"arxiv_id":"2506.06395","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06395","snapshot_observed_at":"2026-07-04T04:19:34.020533Z","title":"arXiv preprint arXiv:2506.06395 , year=","venue":null,"work_id":"7732e7d1-769d-48e4-975d-770d911ba6be","year":2025},"citing_paper":{"arxiv_id":"2605.07244","last_updated":"2026-05-08T05:01:40Z","snapshot_observed_at":"2026-08-15T21:47:26.504858Z","submitted_at":"2026-05-08T05:01:40Z","title":"Experience Sharing in Mutual Reinforcement Learning for Heterogeneous Language Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-11T02:02:41.411795Z"},"links":{"cited_paper":"/paper/2506.06395","citing_paper":"/paper/2605.07244"},"observation_digest":"sha256:093807b427b20b54ea7c22cf285624d4cb65cc84f055dfc68b647d42dc4fb02b","observation_id":"65dc5c60-d756-42d2-8f0d-482551526225","resolution":{"observed_at":"2026-05-11T04:00:54.981604Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","snapshot_observed_at":"2026-08-16T19:48:43.811387Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","version":3},"cited_work":{"arxiv_id":"2506.06395","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06395","snapshot_observed_at":"2026-07-04T04:19:34.020533Z","title":"arXiv preprint arXiv:2506.06395 , year=","venue":null,"work_id":"7732e7d1-769d-48e4-975d-770d911ba6be","year":2025},"citing_paper":{"arxiv_id":"2605.13467","last_updated":"2026-05-13T12:55:18Z","snapshot_observed_at":"2026-08-12T16:10:37.480335Z","submitted_at":"2026-05-13T12:55:18Z","title":"PDCR: Perception-Decomposed Confidence Reward for Vision-Language Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-14T19:20:32.435135Z"},"links":{"cited_paper":"/paper/2506.06395","citing_paper":"/paper/2605.13467"},"observation_digest":"sha256:c07614152fa20c18d050a1992c4d09f7defbf265f6d61e57d7fa3ad8cbe94993","observation_id":"0adf9594-fec1-4beb-906f-ffcf2f486f1f","resolution":{"observed_at":"2026-05-14T19:22:50.601594Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","snapshot_observed_at":"2026-08-16T19:48:43.811387Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","version":3},"cited_work":{"arxiv_id":"2506.06395","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06395","snapshot_observed_at":"2026-07-04T04:19:34.020533Z","title":"arXiv preprint arXiv:2506.06395 , year=","venue":null,"work_id":"7732e7d1-769d-48e4-975d-770d911ba6be","year":2025},"citing_paper":{"arxiv_id":"2605.15012","last_updated":"2026-05-14T16:12:30Z","snapshot_observed_at":"2026-08-13T15:58:59.113980Z","submitted_at":"2026-05-14T16:12:30Z","title":"Boosting Reinforcement Learning with Verifiable Rewards via Randomly Selected Few-Shot Guidance","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-15T03:18:26.590871Z"},"links":{"cited_paper":"/paper/2506.06395","citing_paper":"/paper/2605.15012"},"observation_digest":"sha256:d410220395e2c19aee292ae067ef589716fb98dddeed895b2e22ce187ab6b817","observation_id":"0fb3c622-79d3-4020-b0d5-d46f3c71b144","resolution":{"observed_at":"2026-05-15T03:19:43.052901Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","snapshot_observed_at":"2026-08-16T19:48:43.811387Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","version":3},"cited_work":{"arxiv_id":"2506.06395","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06395","snapshot_observed_at":"2026-07-04T04:19:34.020533Z","title":"arXiv preprint arXiv:2506.06395 , year=","venue":null,"work_id":"7732e7d1-769d-48e4-975d-770d911ba6be","year":2025},"citing_paper":{"arxiv_id":"2605.19444","last_updated":"2026-05-27T03:12:51Z","snapshot_observed_at":"2026-07-06T23:30:11.337726Z","submitted_at":"2026-05-19T06:58:44Z","title":"Detecting and Mitigating the Correct-Answer Extinction Window in Test-Time Reinforcement Learning with Majority Voting","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-20T07:20:50.835826Z"},"links":{"cited_paper":"/paper/2506.06395","citing_paper":"/paper/2605.19444"},"observation_digest":"sha256:8413bf63c5aef6a8bcf9d43f44f36bbab2fc5dd397e192fa8f4eae55655ee552","observation_id":"f4b05f7d-a7a9-483f-9ea8-8cd9c4ece2ea","resolution":{"observed_at":"2026-05-20T07:23:06.927905Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","snapshot_observed_at":"2026-08-16T19:48:43.811387Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","version":3},"cited_work":{"arxiv_id":"2506.06395","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06395","snapshot_observed_at":"2026-07-04T04:19:34.020533Z","title":"arXiv preprint arXiv:2506.06395 , year=","venue":null,"work_id":"7732e7d1-769d-48e4-975d-770d911ba6be","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-08-12T03:28:30.781632Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2506.06395","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:6f2837523c4feac1874fb8d534938ba9462d3a0a54cf7090d69f7a33d847718e","observation_id":"c1d205cb-439a-471a-a099-f5e14cd33be0","resolution":{"observed_at":"2026-07-01T20:56:13.714700Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","snapshot_observed_at":"2026-08-16T19:48:43.811387Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","version":3},"cited_work":{"arxiv_id":"2506.06395","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06395","snapshot_observed_at":"2026-07-04T04:19:34.020533Z","title":"arXiv preprint arXiv:2506.06395 , year=","venue":null,"work_id":"7732e7d1-769d-48e4-975d-770d911ba6be","year":2025},"citing_paper":{"arxiv_id":"2606.04503","last_updated":"2026-06-03T06:34:42Z","snapshot_observed_at":"2026-08-14T13:19:33.029253Z","submitted_at":"2026-06-03T06:34:42Z","title":"Smart Picks in the Dark: Towards Efficient RLVR for Reasoning via Tracing Metacognitive Pivots","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T06:55:09.927034Z"},"links":{"cited_paper":"/paper/2506.06395","citing_paper":"/paper/2606.04503"},"observation_digest":"sha256:c7a70aa9085f7039061a2efb12f087973bb3d498b9f26a27c331b64d6331df10","observation_id":"3fcabd54-4272-4f59-805a-86b1790d9ca2","resolution":{"observed_at":"2026-07-02T07:26:46.294521Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","snapshot_observed_at":"2026-08-16T19:48:43.811387Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","version":3},"cited_work":{"arxiv_id":"2506.06395","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06395","snapshot_observed_at":"2026-07-04T04:19:34.020533Z","title":"arXiv preprint arXiv:2506.06395 , year=","venue":null,"work_id":"7732e7d1-769d-48e4-975d-770d911ba6be","year":2025},"citing_paper":{"arxiv_id":"2606.04516","last_updated":"2026-06-03T06:47:50Z","snapshot_observed_at":"2026-07-06T23:44:37.797802Z","submitted_at":"2026-06-03T06:47:50Z","title":"GeoMin: Data-Efficient Semi-Supervised RLVR via Geometric Distribution Modeling","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-28T07:45:43.320339Z"},"links":{"cited_paper":"/paper/2506.06395","citing_paper":"/paper/2606.04516"},"observation_digest":"sha256:7cc2892af3e308bdc32594d2e59e8687cd8760816c0c5a931cbd2fa2be88feb8","observation_id":"83ccfe0e-b653-4d2c-9dac-b0f2cfa1cb3c","resolution":{"observed_at":"2026-07-02T06:06:40.756454Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","snapshot_observed_at":"2026-08-16T19:48:43.811387Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","version":3},"cited_work":{"arxiv_id":"2506.06395","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06395","snapshot_observed_at":"2026-07-04T04:19:34.020533Z","title":"arXiv preprint arXiv:2506.06395 , year=","venue":null,"work_id":"7732e7d1-769d-48e4-975d-770d911ba6be","year":2025},"citing_paper":{"arxiv_id":"2606.11634","last_updated":"2026-06-10T03:56:03Z","snapshot_observed_at":"2026-08-12T13:36:16.324487Z","submitted_at":"2026-06-10T03:56:03Z","title":"Architecture-Aware Reinforcement Learning Makes Sliding-Window Attention Competitive in Math Reasoning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-27T10:18:54.163862Z"},"links":{"cited_paper":"/paper/2506.06395","citing_paper":"/paper/2606.11634"},"observation_digest":"sha256:e07f97cbbe17ff482e0f08d24d288cacba54aa2d8ed0ce4d7b8274e9d53b5951","observation_id":"a1e595f4-6dc3-404d-8ca8-e0eea46b1270","resolution":{"observed_at":"2026-07-03T09:47:59.871201Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","snapshot_observed_at":"2026-08-16T19:48:43.811387Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","version":3},"cited_work":{"arxiv_id":"2506.06395","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06395","snapshot_observed_at":"2026-07-04T04:19:34.020533Z","title":"arXiv preprint arXiv:2506.06395 , year=","venue":null,"work_id":"7732e7d1-769d-48e4-975d-770d911ba6be","year":2025},"citing_paper":{"arxiv_id":"2606.20881","last_updated":"2026-06-18T19:15:50Z","snapshot_observed_at":"2026-08-07T07:30:08.874288Z","submitted_at":"2026-06-18T19:15:50Z","title":"When Do Intrinsic Rewards Work for Code Reasoning? A Comprehensive Study","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-26T17:07:21.486960Z"},"links":{"cited_paper":"/paper/2506.06395","citing_paper":"/paper/2606.20881"},"observation_digest":"sha256:102d21c3ad997bbdcd9d2bda4587e4adefa3107350d2f8afe601356003722c6e","observation_id":"bab38903-170f-4d40-b597-a461b8816476","resolution":{"observed_at":"2026-07-04T04:19:34.022356Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","snapshot_observed_at":"2026-08-16T19:48:43.811387Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06395","snapshot_observed_at":"2026-08-07T10:19:41.827630Z","title":"press/v267/ko25a.html","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06296","last_updated":"2026-08-09T12:07:45Z","snapshot_observed_at":"2026-08-19T10:53:49.716280Z","submitted_at":"2026-08-06T17:18:23Z","title":"On-Policy Self-Distillation without Any Supervision","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:41.827630Z"},"links":{"cited_paper":"/paper/2506.06395","citing_paper":"/paper/2608.06296"},"observation_digest":"sha256:f561e8d157792895b9518e9a3c23bad6847e1e0e456a4d7d61acedea709db01f","observation_id":"f2c04ddc-ed22-4a6b-8056-4cdb81fed65e","resolution":{"observed_at":"2026-08-07T10:19:41.827630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.06395/citation-record","integrity":"/paper/2506.06395/integrity","json":"/paper/2506.06395/citation-record.json","paper":"/paper/2506.06395"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T10:24:24.377877Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","snapshot_observed_at":"2026-08-16T19:48:43.811387Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:24.377877Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.06395"},"observation_digest":"sha256:930a66586f9b241fc41bedca765a067164b7078255a265864d72b4853679cedf","observation_id":"f0385cc3-5f01-4916-aeb6-4aca1a275831","resolution":{"observed_at":"2026-08-07T10:24:24.377877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-20T15:31:01.041088Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-07T10:24:24.420167Z","title":"Qwen technical report.arXiv preprint arXiv:2309.16609, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","snapshot_observed_at":"2026-08-16T19:48:43.811387Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:24.420167Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2506.06395"},"observation_digest":"sha256:794d15a29688b5d09e13583af9e113ae12ebac3ab58b9982d61e40be3588966e","observation_id":"25bce929-3162-4235-bd94-72cf6baab1ad","resolution":{"observed_at":"2026-08-07T10:24:24.420167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.19162","snapshot_observed_at":"2026-08-07T10:24:24.520322Z","title":"Spc: Evolving self-play critic via adversarial games for llm reasoning.arXiv preprint arXiv:2504.19162, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","snapshot_observed_at":"2026-08-16T19:48:43.811387Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:24.520322Z"},"links":{"cited_paper":"/paper/2504.19162","citing_paper":"/paper/2506.06395"},"observation_digest":"sha256:bc326f79c49434aff2c4dbb067186e0b56baba54e4bf2a1b664e6c2c0793d528","observation_id":"a60935ee-dde6-4400-8c29-27d6730082b3","resolution":{"observed_at":"2026-08-07T10:24:24.520322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T10:24:24.548791Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168, 2021","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","snapshot_observed_at":"2026-08-16T19:48:43.811387Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:24.548791Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.06395"},"observation_digest":"sha256:8aa3d4fd3b598f385d85d12460fca6da5ad23d2224594138d877f3238a1737f9","observation_id":"a5a63697-9523-438e-9935-b50034c49f05","resolution":{"observed_at":"2026-08-07T10:24:24.548791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:25.139584Z","title":"Training verifiers to solve math word problems, 2021","venue":null,"work_id":"185f92e7-5d95-4d22-bd31-7a4c3ea80850","year":2021},"citing_paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","snapshot_observed_at":"2026-08-16T19:48:43.811387Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:24.573746Z"},"links":{"citing_paper":"/paper/2506.06395"},"observation_digest":"sha256:ef3a717306c2c39eee897326d1a325ab2ad3c2af55f6b7af662424475616d068","observation_id":"f3e948f6-3226-4c58-8c9a-f9dac71cdc30","resolution":{"observed_at":"2026-08-07T10:24:25.145528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:25.121002Z","title":"Evalchemy: Automatic evals for llms, 2024","venue":null,"work_id":"bae4e6da-a1e8-43cf-ace8-72c4e9f22367","year":2024},"citing_paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","snapshot_observed_at":"2026-08-16T19:48:43.811387Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:24.589221Z"},"links":{"citing_paper":"/paper/2506.06395"},"observation_digest":"sha256:b7716e12b4bded1c02313c1b9d122baa54a39be8dad873a39b23f2a45a04c6a0","observation_id":"34376507-921d-4aa4-84dd-2e75bb0394ab","resolution":{"observed_at":"2026-08-07T10:24:25.128092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T10:24:24.604801Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","snapshot_observed_at":"2026-08-16T19:48:43.811387Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:24.604801Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.06395"},"observation_digest":"sha256:45d49daaefa5c74f37822fc953285e7c05d33bf6a95394d5608fa9ea59944f51","observation_id":"ec6c734a-ce12-4135-972f-d7448f132af8","resolution":{"observed_at":"2026-08-07T10:24:24.604801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14196","last_updated":"2024-01-26T09:23:11Z","snapshot_observed_at":"2026-08-06T22:40:28.707813Z","submitted_at":"2024-01-25T14:17:53Z","title":"DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14196","snapshot_observed_at":"2026-08-07T10:24:24.614813Z","title":"Deepseek-coder: When the large language model meets programming–the rise of code intelligence","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","snapshot_observed_at":"2026-08-16T19:48:43.811387Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:24.614813Z"},"links":{"cited_paper":"/paper/2401.14196","citing_paper":"/paper/2506.06395"},"observation_digest":"sha256:561e99263cc9683c342186f19ad94d1b42c153c404df9aa2631c934c7593de85","observation_id":"acd03621-def7-4ce8-8627-b0353544e97a","resolution":{"observed_at":"2026-08-07T10:24:24.614813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-07T10:24:24.624793Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems.arXiv preprint arXiv:2402.14008, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","snapshot_observed_at":"2026-08-16T19:48:43.811387Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:24.624793Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2506.06395"},"observation_digest":"sha256:14c94f5d12c0152914de0e8cf8f87ba8c20c839f8ed367d417b1b5ed71f78abd","observation_id":"2602154c-cc1e-43d2-9bf9-6bbd3b08a05d","resolution":{"observed_at":"2026-08-07T10:24:24.624793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:24.633027Z","title":"Measuring massive multitask language understanding.Proceedings of the International Conference on Learning Representations (ICLR), 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","snapshot_observed_at":"2026-08-16T19:48:43.811387Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:24.633027Z"},"links":{"citing_paper":"/paper/2506.06395"},"observation_digest":"sha256:de5ac60f97c806244682270a0327429d8e658dd31bbd17d331ec8034b29f38f3","observation_id":"bf3d1a66-1da3-42e3-afa3-a46e03d8a014","resolution":{"observed_at":"2026-08-07T10:24:24.633027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-08-21T04:25:41.592030Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-07T10:24:24.643359Z","title":"Measuring mathematical problem solving with the math dataset.arXiv preprint arXiv:2103.03874, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","snapshot_observed_at":"2026-08-16T19:48:43.811387Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:24.643359Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2506.06395"},"observation_digest":"sha256:fb4f51665c22d38fab72539ef307d81ca760578413c48b35f34fa9a661a73583","observation_id":"ca2afed7-b944-4fab-87b0-569a5b564642","resolution":{"observed_at":"2026-08-07T10:24:24.643359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:24.652806Z","title":"Measuring mathematical problem solving with the math dataset.NeurIPS, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","snapshot_observed_at":"2026-08-16T19:48:43.811387Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:24.652806Z"},"links":{"citing_paper":"/paper/2506.06395"},"observation_digest":"sha256:183bd89c02e84c98c520038bb0c2ad89403f80cb9866edd13e8d7e1bd62a7b82","observation_id":"d2b3a446-3282-4565-b297-577d8e3a4712","resolution":{"observed_at":"2026-08-07T10:24:24.652806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-17T14:11:00.232598Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-07T10:24:24.663552Z","title":"T\\\" ulu 3: Pushing frontiers in open language model post-training.arXiv preprint arXiv:2411.15124, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","snapshot_observed_at":"2026-08-16T19:48:43.811387Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:24.663552Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2506.06395"},"observation_digest":"sha256:51b62eccaf710b40550e91a1d56794072e5a1dc941a3eed44317366ab18cca1e","observation_id":"744166e6-7752-41a8-9cfa-c805b0bcef76","resolution":{"observed_at":"2026-08-07T10:24:24.663552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:24.685376Z","title":"Numinamath: The largest public dataset in ai4maths with 860k pairs of competition math problems and solutions.Hugging Face repository, 13:9, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","snapshot_observed_at":"2026-08-16T19:48:43.811387Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:24.685376Z"},"links":{"citing_paper":"/paper/2506.06395"},"observation_digest":"sha256:39321f4a01952aed67516100368b8a79876a5412e459aa7a4dff802f3e41322c","observation_id":"ebfdc093-9a0a-4435-9381-159df18db4e3","resolution":{"observed_at":"2026-08-07T10:24:24.685376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-18T18:18:37.449517Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T10:24:24.692747Z","title":"Deepseek-v3 technical report.arXiv preprint arXiv:2412.19437, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","snapshot_observed_at":"2026-08-16T19:48:43.811387Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:24.692747Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.06395"},"observation_digest":"sha256:b237d38585d44d9ee186a8549fe1ba953726777151fa79a1c821ecf1df009776","observation_id":"39af67f3-817a-4648-8860-cff01d02a93c","resolution":{"observed_at":"2026-08-07T10:24:24.692747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08967","last_updated":"2024-12-13T04:44:11Z","snapshot_observed_at":"2026-08-16T14:26:54.639216Z","submitted_at":"2024-01-17T04:43:21Z","title":"ReFT: Reasoning with Reinforced Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08967","snapshot_observed_at":"2026-08-07T10:24:24.701431Z","title":"Reft: Reasoning with reinforced fine-tuning.arXiv preprint arXiv:2401.08967, 3, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","snapshot_observed_at":"2026-08-16T19:48:43.811387Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:24.701431Z"},"links":{"cited_paper":"/paper/2401.08967","citing_paper":"/paper/2506.06395"},"observation_digest":"sha256:49e2fa06ed58847d7e745ff554d916a4ac2b29b0c77762fae9b31cc05e09803b","observation_id":"bc871d76-c04e-4477-881b-39ea09382062","resolution":{"observed_at":"2026-08-07T10:24:24.701431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:24.710826Z","title":"Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","snapshot_observed_at":"2026-08-16T19:48:43.811387Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:24.710826Z"},"links":{"citing_paper":"/paper/2506.06395"},"observation_digest":"sha256:ca0bcacf0a3844f0c3dcc9d76ceccafb26752e921bf76d7eaae409cd28d09574","observation_id":"8693aa70-2e9b-46b7-b29c-0809c2fc14ce","resolution":{"observed_at":"2026-08-07T10:24:24.710826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:24.721564Z","title":"Direct preference optimization: Your language model is secretly a reward model.Advances in Neural Information Processing Systems, 36:53728–53741, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","snapshot_observed_at":"2026-08-16T19:48:43.811387Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:24.721564Z"},"links":{"citing_paper":"/paper/2506.06395"},"observation_digest":"sha256:d205485310b420098231fe957667c5f99a252a474cf8978e63f00f1a51c2ad0c","observation_id":"c3f09791-8594-43aa-ac55-612b59c5fcf4","resolution":{"observed_at":"2026-08-07T10:24:24.721564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T10:24:24.731345Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","snapshot_observed_at":"2026-08-16T19:48:43.811387Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:24.731345Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.06395"},"observation_digest":"sha256:ed17357c0b51ad5c609c5517382466289b5ec33a39c5da31584abb400edc64af","observation_id":"6d9e2248-f6ed-4d03-98a9-0fae86185402","resolution":{"observed_at":"2026-08-07T10:24:24.731345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:24:24.744921Z","title":"Qwq-32b: Embracing the power of reinforcement learning, March 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","snapshot_observed_at":"2026-08-16T19:48:43.811387Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:24.744921Z"},"links":{"citing_paper":"/paper/2506.06395"},"observation_digest":"sha256:6f7c232a7767187fc0fc762c36ab24f4d721e457f1d6a7db4607336151b6c0a2","observation_id":"a1635733-65a9-48b1-a985-b3287d33c85f","resolution":{"observed_at":"2026-08-07T10:24:24.744921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-08-20T14:18:10.920944Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-07T10:24:24.758614Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","snapshot_observed_at":"2026-08-16T19:48:43.811387Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:24.758614Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2506.06395"},"observation_digest":"sha256:d0d3f26ec26ee166bb89e03033c9933b55e7d9605e165177c38af5e11fe62c5e","observation_id":"54c1b0b8-9e28-4160-ae5f-bdb20ac72d4b","resolution":{"observed_at":"2026-08-07T10:24:24.758614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03335","last_updated":"2025-10-16T08:23:36Z","snapshot_observed_at":"2026-08-11T20:12:00.210052Z","submitted_at":"2025-05-06T09:08:00Z","title":"Absolute Zero: Reinforced Self-play Reasoning with Zero Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.03335","snapshot_observed_at":"2026-08-07T10:24:24.773742Z","title":"Absolute zero: Reinforced self-play reasoning with zero data.arXiv preprint arXiv:2505.03335, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","snapshot_observed_at":"2026-08-16T19:48:43.811387Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:24.773742Z"},"links":{"cited_paper":"/paper/2505.03335","citing_paper":"/paper/2506.06395"},"observation_digest":"sha256:0b392e842f1c4909d5ae31f137a1608672ba146a9a5387cee97c3865dfa66deb","observation_id":"e8665494-fd5b-4915-b6a6-ca21438b272f","resolution":{"observed_at":"2026-08-07T10:24:24.773742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16084","last_updated":"2025-06-30T15:59:26Z","snapshot_observed_at":"2026-08-18T00:41:23.294797Z","submitted_at":"2025-04-22T17:59:56Z","title":"TTRL: Test-Time Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16084","snapshot_observed_at":"2026-08-07T10:24:24.786925Z","title":"Ttrl: Test-time reinforcement learning.arXiv preprint arXiv:2504.16084, 2025","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","snapshot_observed_at":"2026-08-16T19:48:43.811387Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:24.786925Z"},"links":{"cited_paper":"/paper/2504.16084","citing_paper":"/paper/2506.06395"},"observation_digest":"sha256:4939f9b69767ba0ace09d7a5d92a2e97759492ce7dc988487d48c9b8afa75797","observation_id":"0cb293c4-1fa1-4ded-af98-3ac56e326fbc","resolution":{"observed_at":"2026-08-07T10:24:24.786925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T19:48:43.811387Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 26 inbound Pith citation observations for arXiv:2506.06395."}