{"as_of":"2026-08-19T04:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:340e372e564ae7502105b8e10c8d62146047a2811a96ad9fc596c9054081a21d","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:35:40.426831Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":15,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T12:41:42.259895Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T00:04:22.690995Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.24726","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.24726","snapshot_observed_at":"2026-07-08T00:04:22.690995Z","title":"Reflect, retry, reward: Self-improving llms via reinforcement learning.CoRR, abs/2505.24726","venue":"cs.CL","work_id":"ecb84483-19cb-4784-b3a2-87a9d79d2850","year":2025},"citing_paper":{"arxiv_id":"2507.13334","last_updated":"2025-07-21T17:48:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T17:50:36Z","title":"A Survey of Context Engineering for Large Language Models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-13T20:58:45.060041Z"},"links":{"cited_paper":"/paper/2505.24726","citing_paper":"/paper/2507.13334"},"observation_digest":"sha256:7dc52a3d2e8325c8e2d81464d87e07218ef41f41ddc183ea6d61946ca5517210","observation_id":"a667597f-34d6-4b4d-9ba0-6732f76f3c75","resolution":{"observed_at":"2026-05-13T20:58:45.141925Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.24726","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.24726","snapshot_observed_at":"2026-07-08T00:04:22.690995Z","title":"Reflect, retry, reward: Self-improving llms via reinforcement learning.CoRR, abs/2505.24726","venue":"cs.CL","work_id":"ecb84483-19cb-4784-b3a2-87a9d79d2850","year":2025},"citing_paper":{"arxiv_id":"2508.13654","last_updated":"2026-04-21T03:24:34Z","snapshot_observed_at":"2026-08-11T04:49:10.568001Z","submitted_at":"2025-08-19T09:04:13Z","title":"Input-Time Scaling: Adding Noise and Irrelevance into Less-Is-More Drastically Improves Reasoning Performance and Efficiency","version":6},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T22:42:53.663354Z"},"links":{"cited_paper":"/paper/2505.24726","citing_paper":"/paper/2508.13654"},"observation_digest":"sha256:a04599f6165218fe8f2d1076ac8539746e4e0f5cc8bf6a6522578778d80266ec","observation_id":"4ce0801e-0b98-4eb3-a5ea-bb705d2d323a","resolution":{"observed_at":"2026-05-18T22:46:53.907850Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.24726","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.24726","snapshot_observed_at":"2026-07-08T00:04:22.690995Z","title":"Reflect, retry, reward: Self-improving llms via reinforcement learning.CoRR, abs/2505.24726","venue":"cs.CL","work_id":"ecb84483-19cb-4784-b3a2-87a9d79d2850","year":2025},"citing_paper":{"arxiv_id":"2509.21743","last_updated":"2026-03-31T22:32:08Z","snapshot_observed_at":"2026-08-17T12:57:06.767729Z","submitted_at":"2025-09-26T01:17:35Z","title":"Retrieval-of-Thought: Efficient Reasoning via Reusing Thoughts","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T13:42:07.883909Z"},"links":{"cited_paper":"/paper/2505.24726","citing_paper":"/paper/2509.21743"},"observation_digest":"sha256:fb6e0bf08f43644a865fb22651f365ac0035827d26069ab5ac17c0275dac9506","observation_id":"cebbe30e-d707-4075-8231-559d79d3907a","resolution":{"observed_at":"2026-05-18T13:42:38.721025Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24726","snapshot_observed_at":"2026-08-04T12:41:42.259895Z","title":"10 Preprint Shelly Bensal, Umar Jamil, Christopher Bryant, Melisa Russak, Kiran Kamble, Dmytro Mo- zolevskyi, Muayad Ali, and Waseem AlShikh","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.02919","last_updated":"2026-05-29T16:16:27Z","snapshot_observed_at":"2026-08-16T00:02:01.126285Z","submitted_at":"2025-10-03T11:46:04Z","title":"Self-Reflective Generation at Test Time","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T12:41:42.259895Z"},"links":{"cited_paper":"/paper/2505.24726","citing_paper":"/paper/2510.02919"},"observation_digest":"sha256:d58736245cd7fa6d35ee7c1abff162580b78f0af7e3387806189fed8307a0d31","observation_id":"be380109-018d-4b57-8c52-e97617f69d9d","resolution":{"observed_at":"2026-08-04T12:41:42.259895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.24726","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.24726","snapshot_observed_at":"2026-07-08T00:04:22.690995Z","title":"Reflect, retry, reward: Self-improving llms via reinforcement learning.CoRR, abs/2505.24726","venue":"cs.CL","work_id":"ecb84483-19cb-4784-b3a2-87a9d79d2850","year":2025},"citing_paper":{"arxiv_id":"2601.12538","last_updated":"2026-01-18T18:58:23Z","snapshot_observed_at":"2026-08-04T22:42:23.171653Z","submitted_at":"2026-01-18T18:58:23Z","title":"Agentic Reasoning for Large Language Models","version":1},"reference_index":288,"source":"pdf_text","source_observed_at":"2026-05-17T15:14:25.558878Z"},"links":{"cited_paper":"/paper/2505.24726","citing_paper":"/paper/2601.12538"},"observation_digest":"sha256:d7f59fb005062fe3b09da6764761cb65a994a8210200b82881e4e7e2859f38e5","observation_id":"2c6e74c5-d46e-4cb1-afb7-3b1f56757a43","resolution":{"observed_at":"2026-05-17T15:14:26.410357Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.24726","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.24726","snapshot_observed_at":"2026-07-08T00:04:22.690995Z","title":"Reflect, retry, reward: Self-improving llms via reinforcement learning.CoRR, abs/2505.24726","venue":"cs.CL","work_id":"ecb84483-19cb-4784-b3a2-87a9d79d2850","year":2025},"citing_paper":{"arxiv_id":"2605.08401","last_updated":"2026-05-15T12:46:04Z","snapshot_observed_at":"2026-08-11T06:44:47.502612Z","submitted_at":"2026-05-08T19:06:55Z","title":"AIPO: Learning to Reason from Active Interaction","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T01:17:28.124867Z"},"links":{"cited_paper":"/paper/2505.24726","citing_paper":"/paper/2605.08401"},"observation_digest":"sha256:46a811f3284e9bf3117fbc4beef6344a9ae8cce4d62e3bafd2c1d7772bb4770d","observation_id":"afb29695-d9ba-4290-944c-d6dcef50184a","resolution":{"observed_at":"2026-05-12T08:06:31.794258Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.24726","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.24726","snapshot_observed_at":"2026-07-08T00:04:22.690995Z","title":"Reflect, retry, reward: Self-improving llms via reinforcement learning.CoRR, abs/2505.24726","venue":"cs.CL","work_id":"ecb84483-19cb-4784-b3a2-87a9d79d2850","year":2025},"citing_paper":{"arxiv_id":"2605.08401","last_updated":"2026-05-15T12:46:04Z","snapshot_observed_at":"2026-08-11T06:44:47.502612Z","submitted_at":"2026-05-08T19:06:55Z","title":"AIPO: Learning to Reason from Active Interaction","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-19T18:07:27.492419Z"},"links":{"cited_paper":"/paper/2505.24726","citing_paper":"/paper/2605.08401"},"observation_digest":"sha256:ede31fd9f035419a2fe36d1921f8013e80b53a704aa2172a8445ecac65be2003","observation_id":"b762b6cf-007e-4468-9520-1324bb89998d","resolution":{"observed_at":"2026-05-19T18:07:42.262051Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.24726","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.24726","snapshot_observed_at":"2026-07-08T00:04:22.690995Z","title":"Reflect, retry, reward: Self-improving llms via reinforcement learning.CoRR, abs/2505.24726","venue":"cs.CL","work_id":"ecb84483-19cb-4784-b3a2-87a9d79d2850","year":2025},"citing_paper":{"arxiv_id":"2605.09395","last_updated":"2026-05-16T07:36:34Z","snapshot_observed_at":"2026-07-31T09:17:50.243143Z","submitted_at":"2026-05-10T07:47:09Z","title":"Empowering VLMs for Few-Shot Multimodal Time Series Classification via Tailored Agentic Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T04:40:23.895430Z"},"links":{"cited_paper":"/paper/2505.24726","citing_paper":"/paper/2605.09395"},"observation_digest":"sha256:e207087187ebcc31a0a081657ca3f7393a78abbb76b3c67e27e0a890cb131f79","observation_id":"d6678781-0785-4e35-aee2-0c6a59a5bc0b","resolution":{"observed_at":"2026-05-12T06:01:25.376226Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.24726","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.24726","snapshot_observed_at":"2026-07-08T00:04:22.690995Z","title":"Reflect, retry, reward: Self-improving llms via reinforcement learning.CoRR, abs/2505.24726","venue":"cs.CL","work_id":"ecb84483-19cb-4784-b3a2-87a9d79d2850","year":2025},"citing_paper":{"arxiv_id":"2605.09395","last_updated":"2026-05-16T07:36:34Z","snapshot_observed_at":"2026-07-31T09:17:50.243143Z","submitted_at":"2026-05-10T07:47:09Z","title":"Empowering VLMs for Few-Shot Multimodal Time Series Classification via Tailored Agentic Reasoning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-20T22:48:49.322744Z"},"links":{"cited_paper":"/paper/2505.24726","citing_paper":"/paper/2605.09395"},"observation_digest":"sha256:cf96291000cb70b7a9010e3a54a04b24ac4a087e6a87958105bf0e6350e4dd76","observation_id":"b2731606-a626-4501-b535-cf4aa6885698","resolution":{"observed_at":"2026-05-20T22:49:10.314539Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.24726","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.24726","snapshot_observed_at":"2026-07-08T00:04:22.690995Z","title":"Reflect, retry, reward: Self-improving llms via reinforcement learning.CoRR, abs/2505.24726","venue":"cs.CL","work_id":"ecb84483-19cb-4784-b3a2-87a9d79d2850","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-08-12T03:28:30.781632Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":158,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2505.24726","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:e62ff4b3565e8b87197103c87e1cb48f8da4a166052deaffe1a1c3b75d08135b","observation_id":"d07f7d49-830e-40ee-9429-65ec56ffab8a","resolution":{"observed_at":"2026-07-01T20:56:13.720223Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.24726","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.24726","snapshot_observed_at":"2026-07-08T00:04:22.690995Z","title":"Reflect, retry, reward: Self-improving llms via reinforcement learning.CoRR, abs/2505.24726","venue":"cs.CL","work_id":"ecb84483-19cb-4784-b3a2-87a9d79d2850","year":2025},"citing_paper":{"arxiv_id":"2606.13316","last_updated":"2026-07-31T08:57:20Z","snapshot_observed_at":"2026-08-13T10:34:20.953214Z","submitted_at":"2026-06-11T13:10:48Z","title":"ReSum: Synergizing LLM Reasoning and Summarization with Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T06:39:34.199607Z"},"links":{"cited_paper":"/paper/2505.24726","citing_paper":"/paper/2606.13316"},"observation_digest":"sha256:cca32dbbc65594fa265742abfc125640a3f8f320fa08366e870e59068a617b02","observation_id":"dd02e5db-fb1c-4588-b3fd-7b9a18e0a419","resolution":{"observed_at":"2026-07-03T15:08:33.453282Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24726","snapshot_observed_at":"2026-08-03T02:12:16.219670Z","title":"Bensal, U","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13316","last_updated":"2026-07-31T08:57:20Z","snapshot_observed_at":"2026-08-13T10:34:20.953214Z","submitted_at":"2026-06-11T13:10:48Z","title":"ReSum: Synergizing LLM Reasoning and Summarization with Reinforcement Learning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T02:12:16.219670Z"},"links":{"cited_paper":"/paper/2505.24726","citing_paper":"/paper/2606.13316"},"observation_digest":"sha256:d77461288449f95904f7ed0ab24a7eb0021da245e79b9b60ed463947f53c7804","observation_id":"7134ada1-c2e2-46d9-9fa5-bf9de84df25e","resolution":{"observed_at":"2026-08-03T02:12:16.219670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24726","snapshot_observed_at":"2026-07-12T00:33:06.488657Z","title":"Reflect, retry, reward: Self-improving LLMs via reinforcement learning.arXiv preprint arXiv:2505.24726,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03702","last_updated":"2026-07-04T04:45:05Z","snapshot_observed_at":"2026-08-17T10:03:04.544228Z","submitted_at":"2026-07-04T04:45:05Z","title":"Agent Reinforcement Learning via Pivotal-Aware Self-Feedback Retry","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T00:33:06.488657Z"},"links":{"cited_paper":"/paper/2505.24726","citing_paper":"/paper/2607.03702"},"observation_digest":"sha256:ad48738fce729ce7262410754afc9183b3fb4b7bca1bf0e100c67d0176f6c353","observation_id":"959d28d3-e55a-4719-a13c-ac9a3d57164b","resolution":{"observed_at":"2026-07-12T00:33:06.488657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.24726","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.24726","snapshot_observed_at":"2026-07-08T00:04:22.690995Z","title":"Reflect, retry, reward: Self-improving llms via reinforcement learning.CoRR, abs/2505.24726","venue":"cs.CL","work_id":"ecb84483-19cb-4784-b3a2-87a9d79d2850","year":2025},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-08-19T04:43:08.967042Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":1},"reference_index":151,"source":"arxiv_source","source_observed_at":"2026-07-07T23:59:38.702609Z"},"links":{"cited_paper":"/paper/2505.24726","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:b161c1a9a8105d5c0e2d054c86b917f56e901dfe0c97894a465e7e2af84650b6","observation_id":"cd2f4927-bba8-4ab2-b334-9ce615378880","resolution":{"observed_at":"2026-07-08T00:04:22.692261Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24726","snapshot_observed_at":"2026-07-11T07:46:49.059192Z","title":"arXiv preprint arXiv:2505.24726 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-08-19T04:43:08.967042Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":2},"reference_index":151,"source":"arxiv_source","source_observed_at":"2026-07-11T07:46:49.059192Z"},"links":{"cited_paper":"/paper/2505.24726","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:0ae2ab93073a6f5bc134b2138784ee04afaf4a5e613418e815c5063b3fe52104","observation_id":"782637b5-80bb-422a-9834-55f9aa088fb6","resolution":{"observed_at":"2026-07-11T07:46:49.059192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.24726/citation-record","integrity":"/paper/2505.24726/integrity","json":"/paper/2505.24726/citation-record.json","paper":"/paper/2505.24726"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:34.861649Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:34.861649Z"},"links":{"citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:72c00b8f10609a8a7992376342d674f553565dc815d50f05db38dd713fffa061","observation_id":"9b9ff29d-d9cf-4137-85b9-8e79fd5e86f0","resolution":{"observed_at":"2026-08-07T12:35:34.861649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:34.960301Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:34.960301Z"},"links":{"citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:e1b6e23b14b58ecc175407b45d5d1e0e565f74d66cc0e779cdd324c8f93d10fc","observation_id":"5c883d1e-40c5-4807-8656-7b743d85b4b3","resolution":{"observed_at":"2026-08-07T12:35:34.960301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-17T03:25:04.404839Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-07T12:35:35.083696Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:35.083696Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:43ef72925af3524727eb92d089f2a85ffd9917c819338b51e1355353b43a34f7","observation_id":"3b2dcd2d-6c02-4f85-9673-068e45be6863","resolution":{"observed_at":"2026-08-07T12:35:35.083696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:35.259812Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:35.259812Z"},"links":{"citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:d63439dd32fd449005e76bdede2c41f45d5fcf117d70ea17dc82065b81beb9e9","observation_id":"956def62-0880-44ac-8938-04c0604a95dc","resolution":{"observed_at":"2026-08-07T12:35:35.259812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.starsem-1.22","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":null,"work_id":"f9542f79-beb8-4703-bf10-70d84c2d1e7f","year":2023},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:35.409519Z"},"links":{"citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:768319433412b98f8265cb72073ef1ac7e1422cd06b2fe9446d15322dae81679","observation_id":"3023ca1a-1ca2-48b4-bb0b-26130eaf3afd","resolution":{"observed_at":"2026-08-07T12:35:40.840220Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-07T12:35:35.568647Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:35.568647Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:bfbca508c0e1e04ee9c500a8b0027d5949d711540e4cc68ec2521f1c08d394f9","observation_id":"1a66e9ab-d617-413c-829c-94811bb8051b","resolution":{"observed_at":"2026-08-07T12:35:35.568647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T12:35:35.832113Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:35.832113Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:fcbe189c155e04c4606279b72e8e05f32c751ca26942c95345bce797b52aa389","observation_id":"63f1c250-c8ee-4e31-b444-9d6d0efdd326","resolution":{"observed_at":"2026-08-07T12:35:35.832113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11001","last_updated":"2025-04-15T09:18:21Z","snapshot_observed_at":"2026-08-16T12:40:59.446268Z","submitted_at":"2025-04-15T09:18:21Z","title":"ReZero: Enhancing LLM search ability by trying one-more-time","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11001","snapshot_observed_at":"2026-08-07T12:35:35.992263Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:35.992263Z"},"links":{"cited_paper":"/paper/2504.11001","citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:9e67fe370c008848c583e6db2e80f24b8701ec31df95ab16fae344979c3e6282","observation_id":"48c8d135-793a-4674-80d6-dc6505968bc6","resolution":{"observed_at":"2026-08-07T12:35:35.992263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:36.205203Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:36.205203Z"},"links":{"citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:1364c616de9b8ad7c84fabc2be1786159fa3947e1a0e27300504d3ff3e260ca9","observation_id":"5889e0bd-b0e3-4df6-9ed9-b9dcd554087d","resolution":{"observed_at":"2026-08-07T12:35:36.205203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T12:35:36.351366Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:36.351366Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:ee6a7dfdb5804b90ec3ed62257559cc1d5ef7f39f3f1f31f6351b83da0bde9c2","observation_id":"53714535-dfd3-4a37-967c-cf26cc185c26","resolution":{"observed_at":"2026-08-07T12:35:36.351366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:36.415581Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:36.415581Z"},"links":{"citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:ad940ce6da4ce45a08680c021e8d71663b3552e98f1fbcbdb51e42d84ece44be","observation_id":"34b6c8ef-a99b-4405-a181-c033fad9e685","resolution":{"observed_at":"2026-08-07T12:35:36.415581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-08-16T18:00:58.008096Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-07T12:35:36.557807Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:36.557807Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:a0189a0d6821836f36cd40ae9bd4a854e83cc0069890e69369bc2fe421198a1f","observation_id":"1ee72f43-7db4-4f1a-a9df-fdfd65ad5220","resolution":{"observed_at":"2026-08-07T12:35:36.557807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:36.636735Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:36.636735Z"},"links":{"citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:7689252eaa5033ef76805becc6e667087e7f57d9400125ab2caf37acbfdf5e16","observation_id":"01b10b17-ef42-4ad3-8070-76876adfe558","resolution":{"observed_at":"2026-08-07T12:35:36.636735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:36.738019Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:36.738019Z"},"links":{"citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:d3ff829227f5ae8810d582a495949de82f6c8ad43704b7fa876833a7da4c69eb","observation_id":"09642e74-6af0-4d90-8c7c-a9d1a5ee1eac","resolution":{"observed_at":"2026-08-07T12:35:36.738019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:43.022852Z","title":null,"venue":null,"work_id":"c49ab486-5442-45d5-a2d5-d6477fbbc620","year":2025},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:36.863086Z"},"links":{"citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:225f8bf651b8f44a202700b8d4eb1d03ae776ae51d684f8c1f5450a3d5494de5","observation_id":"c7878b40-7727-4454-98d5-0f3700fc303f","resolution":{"observed_at":"2026-08-07T12:35:43.087654Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:36.957944Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:36.957944Z"},"links":{"citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:6dcfffcb05277d0b17e66199c9e872fe23f64dff13c07a29c19237621d4ea17d","observation_id":"53328d92-8663-4c04-81a8-1470c472d2c5","resolution":{"observed_at":"2026-08-07T12:35:36.957944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00515","last_updated":"2024-11-10T22:02:27Z","snapshot_observed_at":"2026-08-14T16:40:35.729198Z","submitted_at":"2024-06-01T17:48:15Z","title":"A Survey on Large Language Models for Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00515","snapshot_observed_at":"2026-08-07T12:35:37.056537Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:37.056537Z"},"links":{"cited_paper":"/paper/2406.00515","citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:4808b0a10de14d908bf7b311aca288c90fa662959c970f97fb560d3f61bea54f","observation_id":"9e2e5de6-cd90-47f5-b1d6-7060f75b29d5","resolution":{"observed_at":"2026-08-07T12:35:37.056537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:37.174034Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:37.174034Z"},"links":{"citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:c748c5b4e267edfcd42ceb72a4d8cecfe8a1c7fa1666f568b01337039d8b5233","observation_id":"04d92912-ce03-4e3f-8e69-d21f4706a7bb","resolution":{"observed_at":"2026-08-07T12:35:37.174034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10105","last_updated":"2024-04-14T01:15:31Z","snapshot_observed_at":"2026-08-16T14:59:40.231658Z","submitted_at":"2023-09-18T19:28:48Z","title":"Understanding Catastrophic Forgetting in Language Models via Implicit Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10105","snapshot_observed_at":"2026-08-07T12:35:37.237089Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:37.237089Z"},"links":{"cited_paper":"/paper/2309.10105","citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:d32070e6845c5cb2274a238d311e4a8c75218a3bb9a5095ddce07a3af7bb93e7","observation_id":"1541ad01-913f-4259-a889-09f58ef76593","resolution":{"observed_at":"2026-08-07T12:35:37.237089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12917","last_updated":"2024-10-04T17:28:45Z","snapshot_observed_at":"2026-08-16T03:33:39.637646Z","submitted_at":"2024-09-19T17:16:21Z","title":"Training Language Models to Self-Correct via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12917","snapshot_observed_at":"2026-08-07T12:35:37.311069Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:37.311069Z"},"links":{"cited_paper":"/paper/2409.12917","citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:6ea2ea067596709325d191d2fb33928d51542e94494d69e9023608c0cbc52a44","observation_id":"7fe7c305-c796-4728-8633-132075ffb7a0","resolution":{"observed_at":"2026-08-07T12:35:37.311069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:37.411678Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:37.411678Z"},"links":{"citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:7824fe07ac300d71192ca2aa7ff84132049d2d1cb9e8e9b2dd8a326be38f0caa","observation_id":"5cbfd8cb-edec-4ca0-8209-690b52d2dfc7","resolution":{"observed_at":"2026-08-07T12:35:37.411678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-18T07:08:35.277799Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-07T12:35:37.503027Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:37.503027Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:d29e503b2d051c51293b6ca27dbde90e113ebd2fc24f3dc45ab1e433a8e234dd","observation_id":"0b82f9e9-4aab-4d41-aa95-17b48f455999","resolution":{"observed_at":"2026-08-07T12:35:37.503027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:42.811261Z","title":null,"venue":null,"work_id":"43fa2b8c-e0e2-4f1c-b0ea-50a4d04bdaea","year":2016},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:37.598472Z"},"links":{"citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:a15ab0906924fde24c6df29c372e5af8749443fe97d858a4342f40ad5e0176b3","observation_id":"d4b09f2b-dbd3-4689-bafb-059b08b030d2","resolution":{"observed_at":"2026-08-07T12:35:42.897758Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00902","last_updated":"2025-03-02T14:02:03Z","snapshot_observed_at":"2026-08-18T23:41:42.580898Z","submitted_at":"2025-03-02T14:02:03Z","title":"Instruct-of-Reflection: Enhancing Large Language Models Iterative Reflection Capabilities via Dynamic-Meta Instruction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.00902","snapshot_observed_at":"2026-08-07T12:35:37.669914Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:37.669914Z"},"links":{"cited_paper":"/paper/2503.00902","citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:03f423b4eb9555ca394e98c0cd73b36fcc6fd702affcf7d3d9123eefb75b06d6","observation_id":"3576f0f6-14d8-4d0b-b505-566183825cff","resolution":{"observed_at":"2026-08-07T12:35:37.669914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:42.558597Z","title":null,"venue":null,"work_id":"8beee9f5-0da3-4b60-a4e3-e54014d277ca","year":2024},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:37.756243Z"},"links":{"citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:20996299fc4c218bcf04678591aa1cad577eaa7c7db31725cec82ed2ebfde524","observation_id":"9997fed6-014f-4fa3-862a-65087ae21702","resolution":{"observed_at":"2026-08-07T12:35:42.649406Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:42.309163Z","title":null,"venue":null,"work_id":"7cb850e2-846e-4966-a538-1a9b36046861","year":2024},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:37.873250Z"},"links":{"citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:6c8c6671ed13b21a8eefc50f736fe3ad5dffb9c1fee38b6c11dfb2f824164b10","observation_id":"11ae6f74-d7e9-4c7b-a813-6b023325a1f7","resolution":{"observed_at":"2026-08-07T12:35:42.400357Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:42.139734Z","title":null,"venue":null,"work_id":"fa89daf9-e568-4884-bfda-0be50f04c7d6","year":2017},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:37.976934Z"},"links":{"citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:a42738c34099b4dfb3c6e9a70c27a442e88698dee2e39c9aebdae46755a1b6e1","observation_id":"7c946d2e-a0a2-42c5-aa15-3cf6328d92dd","resolution":{"observed_at":"2026-08-07T12:35:42.207703Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:38.088525Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:38.088525Z"},"links":{"citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:d65d9c918ed645837b762f76c9639af6c48c4a7e56858fbac176562c3549b9fd","observation_id":"97e5b161-4742-443a-ae01-c04c694f00b6","resolution":{"observed_at":"2026-08-07T12:35:38.088525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15466","last_updated":"2025-08-17T18:23:42Z","snapshot_observed_at":"2026-08-18T18:36:47.577763Z","submitted_at":"2025-04-21T22:29:02Z","title":"Learning Adaptive Parallel Reasoning with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15466","snapshot_observed_at":"2026-08-07T12:35:38.172948Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:38.172948Z"},"links":{"cited_paper":"/paper/2504.15466","citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:72519ecd6efd28ff4c31692904363b0ae53449dcd35162f010e0e8c57407da72","observation_id":"aa751dfe-6a10-4d89-a3c1-a93ec7d09798","resolution":{"observed_at":"2026-08-07T12:35:38.172948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:41.984314Z","title":null,"venue":null,"work_id":"85195b57-0199-46a4-b3f1-5aec437bfaee","year":2025},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:38.271932Z"},"links":{"citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:816da5d973cdb4a709a5f7576c57ed7d2dc022dc4df9012691d7345baa84f7c0","observation_id":"983b2f28-0bfc-438c-865e-fa5d93f2dacd","resolution":{"observed_at":"2026-08-07T12:35:42.055686Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17439","last_updated":"2025-05-30T15:19:51Z","snapshot_observed_at":"2026-08-18T19:06:23.632289Z","submitted_at":"2025-03-21T17:59:10Z","title":"LEMMA: Learning from Errors for MatheMatical Advancement in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17439","snapshot_observed_at":"2026-08-07T12:35:38.363254Z","title":"Vicky Zhao, Conghui He, and Lijun Wu","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:38.363254Z"},"links":{"cited_paper":"/paper/2503.17439","citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:782b43fa3fd449578f3d89bb043328e6754502fe8967428e7d0d144259e4130d","observation_id":"75b95565-6a73-42ce-ba8a-5f485c757876","resolution":{"observed_at":"2026-08-07T12:35:38.363254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12813","last_updated":"2023-03-08T23:41:49Z","snapshot_observed_at":"2026-08-16T13:28:02.541688Z","submitted_at":"2023-02-24T18:48:43Z","title":"Check Your Facts and Try Again: Improving Large Language Models with External Knowledge and Automated Feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12813","snapshot_observed_at":"2026-08-07T12:35:38.436062Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:38.436062Z"},"links":{"cited_paper":"/paper/2302.12813","citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:9af1d4c304f80d0c26a0aabc284ed5b3f113446fb3118500e51b7e6d58cf57b2","observation_id":"c7cecc57-05b5-467a-9235-e4fba1d354e0","resolution":{"observed_at":"2026-08-07T12:35:38.436062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13958","last_updated":"2025-04-16T21:45:32Z","snapshot_observed_at":"2026-08-15T04:58:53.543603Z","submitted_at":"2025-04-16T21:45:32Z","title":"ToolRL: Reward is All Tool Learning Needs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13958","snapshot_observed_at":"2026-08-07T12:35:38.568666Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:38.568666Z"},"links":{"cited_paper":"/paper/2504.13958","citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:ee1a6f61f798cb78af85a2f2952aaa18b8fd46e2dd01c41f8160e9d1987bb6a1","observation_id":"c23a9c6e-29a7-488d-bae5-93536a9ba9a9","resolution":{"observed_at":"2026-08-07T12:35:38.568666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18219","last_updated":"2024-07-26T17:50:27Z","snapshot_observed_at":"2026-08-16T13:31:00.467034Z","submitted_at":"2024-07-25T17:35:59Z","title":"Recursive Introspection: Teaching Language Model Agents How to Self-Improve","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18219","snapshot_observed_at":"2026-08-07T12:35:38.675580Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:38.675580Z"},"links":{"cited_paper":"/paper/2407.18219","citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:4b8c88117230e83f4954adc59d8787dac1709449fa995cc22b82f5fc806920ec","observation_id":"8bccfb7d-e822-47f3-92ed-c01937437e1c","resolution":{"observed_at":"2026-08-07T12:35:38.675580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.06682","last_updated":"2024-10-16T23:19:46Z","snapshot_observed_at":"2026-08-18T17:47:25.338688Z","submitted_at":"2024-05-05T18:56:46Z","title":"Self-Reflection in LLM Agents: Effects on Problem-Solving Performance","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.06682","snapshot_observed_at":"2026-08-07T12:35:38.889507Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:38.889507Z"},"links":{"cited_paper":"/paper/2405.06682","citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:27824d568ef7f4479c1531e6db07f86d65ba395ae34b84d69dc8021616a8dba5","observation_id":"275de774-9fe7-4dc6-af7f-7a46307ec865","resolution":{"observed_at":"2026-08-07T12:35:38.889507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T12:35:38.941943Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:38.941943Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:1555e41d7a2bbd8a634b5820e54be548d857e0854f339c99f0c11c3b35caa2de","observation_id":"9942cffa-1630-492b-ad08-7bf151dd11b5","resolution":{"observed_at":"2026-08-07T12:35:38.941943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T12:35:39.013972Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:39.013972Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:aefc331c5d497b6814635e6190716f96e5e6a0219b760ef95b767b8839effc0a","observation_id":"d2bd7e0c-e0c2-415c-a0dc-b67d52b03bb1","resolution":{"observed_at":"2026-08-07T12:35:39.013972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:39.089985Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:39.089985Z"},"links":{"citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:a6ea948175544f302e06806a148247d8e5097f6e4630a39d33df115b87811c28","observation_id":"77215a42-c208-4c9c-9949-fae72e537a42","resolution":{"observed_at":"2026-08-07T12:35:39.089985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:39.164960Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:39.164960Z"},"links":{"citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:6ac653241fa7e14165ed8d52daf1c17e5d057d6f3661602014c59452094419c2","observation_id":"3ee18af6-9c36-4fb0-8713-0e60c8d392b2","resolution":{"observed_at":"2026-08-07T12:35:39.164960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01574","last_updated":"2024-11-06T02:54:00Z","snapshot_observed_at":"2026-08-17T13:17:07.963143Z","submitted_at":"2024-06-03T17:53:00Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01574","snapshot_observed_at":"2026-08-07T12:35:39.242501Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:39.242501Z"},"links":{"cited_paper":"/paper/2406.01574","citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:1c8832a3b1072c110d3f48cc42a633334cde1c0b2506ff423b446bcad3314f55","observation_id":"02844c99-a114-41f7-9d76-a1a08b570bf3","resolution":{"observed_at":"2026-08-07T12:35:39.242501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:41.738242Z","title":null,"venue":null,"work_id":"ec0d0b12-f1f7-4854-b6c7-2785317891c0","year":2022},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:39.320511Z"},"links":{"citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:107a65f65e235414188ce82be3dbb1af6fee674ad4b1bec0cd5c616245c7ca18","observation_id":"b3709454-5482-4e16-bde9-04e5fbf14a8e","resolution":{"observed_at":"2026-08-07T12:35:41.839084Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:41.549292Z","title":null,"venue":null,"work_id":"e6fde96e-e476-452d-a581-45d2d9571e94","year":2024},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:39.427431Z"},"links":{"citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:302529655a70a44d93ac7739d1b6f1077fcc49ea1b6201fd5da622f32dcf856c","observation_id":"475ad1e2-c136-4ea0-b489-30e396a9f81a","resolution":{"observed_at":"2026-08-07T12:35:41.639978Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10827","last_updated":"2025-05-25T18:05:14Z","snapshot_observed_at":"2026-08-17T06:23:42.617552Z","submitted_at":"2024-12-14T13:12:50Z","title":"Rethinking Chain-of-Thought from the Perspective of Self-Training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10827","snapshot_observed_at":"2026-08-07T12:35:39.496054Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:39.496054Z"},"links":{"cited_paper":"/paper/2412.10827","citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:ca08f4e4832c4c8c82aa7998290dd4e5e0f32c28efe796f4dfaa85846b572ded","observation_id":"7a3a9574-7702-447c-a809-de5cd05f0aa2","resolution":{"observed_at":"2026-08-07T12:35:39.496054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-17T11:08:48.802438Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-07T12:35:39.602927Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:39.602927Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:7ebf916350b479aaa255c198ad3895201eed8ef9fb527c1b05736e878e86dd28","observation_id":"bb982c97-2962-40af-9879-54a35a1185f1","resolution":{"observed_at":"2026-08-07T12:35:39.602927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T12:35:39.687345Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:39.687345Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:d7a556a0f5de352ead1da9356acfc790c28dd9715566a7ac49fab8f8245712b8","observation_id":"c7abd710-2915-4279-ab23-728769dfb765","resolution":{"observed_at":"2026-08-07T12:35:39.687345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:39.783549Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:39.783549Z"},"links":{"citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:bd2935d1e205019f7f9366588bb30fcea101ed65c944ef255885e6ec89b585ac","observation_id":"a2b04294-cced-44c2-8898-8f13660ec3aa","resolution":{"observed_at":"2026-08-07T12:35:39.783549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-08-15T09:37:44.321271Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-07T12:35:39.880812Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:39.880812Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:ed4c1df55ec6df661100a56e7ac818f16c7ce81dc013627a36d96105b5bd95c5","observation_id":"96df79b1-acab-4ed4-830e-2ec77e7bd15d","resolution":{"observed_at":"2026-08-07T12:35:39.880812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:39.948340Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:39.948340Z"},"links":{"citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:45ec999d85db2900f1c7fed2f125d37e48e0fdbc9031f37927e298651287a296","observation_id":"6d3e9429-4f9e-46dd-87b8-9618be2330e3","resolution":{"observed_at":"2026-08-07T12:35:39.948340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:40.097436Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:40.097436Z"},"links":{"citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:b812f0137e19d5946556da6a4dc540d325939bac60413c39e49a9692c49ea396","observation_id":"b7da77fb-c34e-461d-a598-28986c3a01e3","resolution":{"observed_at":"2026-08-07T12:35:40.097436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-14T10:40:26.323157Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-07T12:35:40.252367Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:40.252367Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:de715fdfa28fc71cfcd82d7e0a3257b876a75e929e237e42e58311995f819206","observation_id":"3a4318b2-588c-4f1c-a06d-79e89cc600a5","resolution":{"observed_at":"2026-08-07T12:35:40.252367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:40.426831Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:40.426831Z"},"links":{"citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:3108f79d9f2bb1f02be908a3b89ac67492983e75c9af7c59a51304e131bd0608","observation_id":"993c7cac-ac4c-4875-8537-9b21c8d774d0","resolution":{"observed_at":"2026-08-07T12:35:40.426831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-14T01:02:49.910301Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":50,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 15 inbound Pith citation observations for arXiv:2505.24726."}