{"as_of":"2026-08-15T00:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5be23ffbc02cbe4bd560a2a0a8602683a3e6440f699226abf273dc85c98c951a","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:15:35.267794Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":31,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T23:11:38.110587Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T00:29:15.119817Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":"2506.03106","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-07-04T00:29:15.119817Z","title":"Critique-grpo: Advancing llm reasoning with natural language and numerical feedback","venue":"cs.CL","work_id":"162d9cd7-aaa3-4c80-b5d0-3d38a404c421","year":2025},"citing_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-12T09:43:00.208065Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2503.21776"},"observation_digest":"sha256:e7284376b8dd79fcf968bb1d529c6e94b606bc2dd68670b60250ba51d2d2c706","observation_id":"ef08bf37-6769-454f-b0b7-bcb326090e57","resolution":{"observed_at":"2026-06-09T02:06:03.715193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-08-06T13:47:19.009023Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20278","last_updated":"2025-07-27T13:52:15Z","snapshot_observed_at":"2026-08-09T10:07:04.674945Z","submitted_at":"2025-07-27T13:52:15Z","title":"MoL-RL: Distilling Multi-Step Environmental Feedback into LLMs for Feedback-Independent Reasoning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T13:47:19.009023Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2507.20278"},"observation_digest":"sha256:0467fb16f53f9e0d12b09e395ea90f0d6c9c54d2fe274d6a93c471bfeffe6227","observation_id":"890f6533-5d3c-4937-8e75-fd63a407581d","resolution":{"observed_at":"2026-08-06T13:47:19.009023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-08-04T13:53:36.062617Z","title":"Critique-grpo: Advancing llm reasoning with natural language and numerical feedback.arXiv preprint arXiv:2506.03106,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.25004","last_updated":"2026-06-08T14:01:20Z","snapshot_observed_at":"2026-08-14T03:17:16.835527Z","submitted_at":"2025-09-29T16:29:04Z","title":"CLPO: Curriculum Learning meets Policy Optimization for LLM Reasoning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T13:53:36.062617Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2509.25004"},"observation_digest":"sha256:dde11064dcbe8bcd6e5d7bcdacf805e2b54aaac24270e25cc8461da05daf849b","observation_id":"d5df3f36-6a6e-4d02-a269-d7f95777e969","resolution":{"observed_at":"2026-08-04T13:53:36.062617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-08-04T11:11:12.915233Z","title":"1\"> <problem>[Example problem 1]</problem> <solution>[Correct solution 1]</solution> </example> <example id=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.06672","last_updated":"2026-05-25T01:59:00Z","snapshot_observed_at":"2026-08-04T11:11:09.166918Z","submitted_at":"2025-10-08T05:53:56Z","title":"XRPO: Pushing the limits of GRPO with Targeted Exploration and Exploitation","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T11:11:12.915233Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2510.06672"},"observation_digest":"sha256:6d5337fe6227fb84366cca79c2681d39c9c54db871ace87fd2a2ec94b9d756ca","observation_id":"a04af6ba-5ecc-4578-9d72-008d996753aa","resolution":{"observed_at":"2026-08-04T11:11:12.915233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-08-04T10:53:10.877236Z","title":"cashmere clothing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:10.877236Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:b61cb2fff193c8309c134c6166208669b05e6702aa6fcb8fcc513135a046b1e4","observation_id":"27f1b512-88a9-4cbb-929a-98e9068fa0ce","resolution":{"observed_at":"2026-08-04T10:53:10.877236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":"2506.03106","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-07-04T00:29:15.119817Z","title":"Critique-grpo: Advancing llm reasoning with natural language and numerical feedback","venue":"cs.CL","work_id":"162d9cd7-aaa3-4c80-b5d0-3d38a404c421","year":2025},"citing_paper":{"arxiv_id":"2512.03043","last_updated":"2026-04-28T12:07:36Z","snapshot_observed_at":"2026-08-13T15:37:47.305433Z","submitted_at":"2025-12-02T18:59:52Z","title":"OneThinker: All-in-one Reasoning Model for Image and Video","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-17T02:09:39.820651Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2512.03043"},"observation_digest":"sha256:7e82f12982abafbfd0009d0d01eafa103d985d42d8c8770e8fe7afeaff58b6c8","observation_id":"83044b5c-6cf1-4702-a64e-c12687fbd697","resolution":{"observed_at":"2026-06-09T02:06:03.715193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":"2506.03106","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-07-04T00:29:15.119817Z","title":"Critique-grpo: Advancing llm reasoning with natural language and numerical feedback","venue":"cs.CL","work_id":"162d9cd7-aaa3-4c80-b5d0-3d38a404c421","year":2025},"citing_paper":{"arxiv_id":"2512.16918","last_updated":"2026-04-28T12:04:04Z","snapshot_observed_at":"2026-08-15T00:18:13.891252Z","submitted_at":"2025-12-18T18:59:55Z","title":"AdaTooler-V: Adaptive Tool-Use for Images and Videos","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-16T21:23:33.598026Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2512.16918"},"observation_digest":"sha256:6ef35c85652e588898e10061fbc16267e678509c4d6fdaa7d369c00650a861a9","observation_id":"9af02442-d983-4e7b-b991-45aa307c7da0","resolution":{"observed_at":"2026-06-09T02:06:03.715193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-08-03T15:21:55.984824Z","title":"A , C , D","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.17375","last_updated":"2026-05-26T19:11:48Z","snapshot_observed_at":"2026-08-13T12:36:07.843677Z","submitted_at":"2025-12-19T09:22:11Z","title":"AdvJudge-Zero: Binary Decision Flips in LLM-as-a-Judge via Adversarial Control Tokens","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T15:21:55.984824Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2512.17375"},"observation_digest":"sha256:6c530cd31ca15e644e57d7a8102592f8a292a7fdb2cc411f2bff7b0af088b8b2","observation_id":"3baccb9b-70e2-4b70-be63-a0c3d0af0ffd","resolution":{"observed_at":"2026-08-03T15:21:55.984824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-08-03T05:14:22.180784Z","title":"Critique-grpo: Advancing llm reasoning with natural language and numerical feedback","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-12T09:46:52.523380Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:22.180784Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:36670a6c7dd06fad666f74a3b5dc9c71807567a99cc419fcee95017a119a2185","observation_id":"9fcaacfb-fa23-4a17-aee4-351c5a09750b","resolution":{"observed_at":"2026-08-03T05:14:22.180784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":"2506.03106","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-07-04T00:29:15.119817Z","title":"Critique-grpo: Advancing llm reasoning with natural language and numerical feedback","venue":"cs.CL","work_id":"162d9cd7-aaa3-4c80-b5d0-3d38a404c421","year":2025},"citing_paper":{"arxiv_id":"2603.28767","last_updated":"2026-05-22T17:26:49Z","snapshot_observed_at":"2026-07-06T22:51:09.377351Z","submitted_at":"2026-03-30T17:59:56Z","title":"Gen-Searcher: Reinforcing Agentic Search for Image Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-14T21:18:10.087258Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2603.28767"},"observation_digest":"sha256:0869d728d2f87f2bca23faefb157707fbe6e72927d883d25213c00dad540572e","observation_id":"00596522-fd42-4123-951a-941771bc4d7c","resolution":{"observed_at":"2026-06-09T02:06:03.715193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":"2506.03106","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-07-04T00:29:15.119817Z","title":"Critique-grpo: Advancing llm reasoning with natural language and numerical feedback","venue":"cs.CL","work_id":"162d9cd7-aaa3-4c80-b5d0-3d38a404c421","year":2025},"citing_paper":{"arxiv_id":"2603.28767","last_updated":"2026-05-22T17:26:49Z","snapshot_observed_at":"2026-07-06T22:51:09.377351Z","submitted_at":"2026-03-30T17:59:56Z","title":"Gen-Searcher: Reinforcing Agentic Search for Image Generation","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-25T06:31:13.232880Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2603.28767"},"observation_digest":"sha256:911d7c502067abb042fc284573443094f96ebb57eb65f82f7359655b0892cea1","observation_id":"61bce089-f9ff-404c-b03d-b31eef3ffdeb","resolution":{"observed_at":"2026-06-09T02:06:03.715193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":"2506.03106","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-07-04T00:29:15.119817Z","title":"Critique-grpo: Advancing llm reasoning with natural language and numerical feedback","venue":"cs.CL","work_id":"162d9cd7-aaa3-4c80-b5d0-3d38a404c421","year":2025},"citing_paper":{"arxiv_id":"2604.07941","last_updated":"2026-04-16T04:43:04Z","snapshot_observed_at":"2026-08-11T15:26:25.836864Z","submitted_at":"2026-04-09T08:00:37Z","title":"Large Language Model Post-Training: A Unified View of Off-Policy and On-Policy Learning","version":2},"reference_index":106,"source":"pdf_text","source_observed_at":"2026-05-10T18:28:58.515666Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2604.07941"},"observation_digest":"sha256:7588d0848650fd19487b0e4da704332eb4f9cf98b085c95cf33ef734adbf8194","observation_id":"266e7451-b303-4c0b-a695-4a57d85bcf95","resolution":{"observed_at":"2026-06-09T02:06:03.715193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":"2506.03106","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-07-04T00:29:15.119817Z","title":"Critique-grpo: Advancing llm reasoning with natural language and numerical feedback","venue":"cs.CL","work_id":"162d9cd7-aaa3-4c80-b5d0-3d38a404c421","year":2025},"citing_paper":{"arxiv_id":"2604.23318","last_updated":"2026-04-25T14:11:23Z","snapshot_observed_at":"2026-08-14T21:07:42.900380Z","submitted_at":"2026-04-25T14:11:23Z","title":"Hidden States Know Where Reasoning Diverges: Credit Assignment via Span-Level Wasserstein Distance","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-08T08:05:36.206946Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2604.23318"},"observation_digest":"sha256:f7317483782a9d6a890f37078174c17e38bc8aca868832338a2d20709c99a64d","observation_id":"11c880c2-cb3d-4c40-8b8a-947b0597696c","resolution":{"observed_at":"2026-06-09T02:06:03.715193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":"2506.03106","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-07-04T00:29:15.119817Z","title":"Critique-grpo: Advancing llm reasoning with natural language and numerical feedback","venue":"cs.CL","work_id":"162d9cd7-aaa3-4c80-b5d0-3d38a404c421","year":2025},"citing_paper":{"arxiv_id":"2605.06130","last_updated":"2026-05-12T10:25:23Z","snapshot_observed_at":"2026-08-11T07:53:51.847466Z","submitted_at":"2026-05-07T12:33:30Z","title":"Skill1: Unified Evolution of Skill-Augmented Agents via Reinforcement Learning","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-05-08T10:23:52.522238Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2605.06130"},"observation_digest":"sha256:249e8c51ce5d97d999be931747b25dfd9b92fb00db1bab264abc40917aba7dba","observation_id":"0be93c8b-7545-4a9b-938e-05314ec92922","resolution":{"observed_at":"2026-06-09T02:06:03.715193Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":"2506.03106","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-07-04T00:29:15.119817Z","title":"Critique-grpo: Advancing llm reasoning with natural language and numerical feedback","venue":"cs.CL","work_id":"162d9cd7-aaa3-4c80-b5d0-3d38a404c421","year":2025},"citing_paper":{"arxiv_id":"2605.06130","last_updated":"2026-05-12T10:25:23Z","snapshot_observed_at":"2026-08-11T07:53:51.847466Z","submitted_at":"2026-05-07T12:33:30Z","title":"Skill1: Unified Evolution of Skill-Augmented Agents via Reinforcement Learning","version":2},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-05-11T02:00:00.663355Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2605.06130"},"observation_digest":"sha256:0b8392f01128f982ddce92997a71aff481177859bd40833a07939016b1a560cd","observation_id":"48110f5b-b2ff-4350-abed-0302f3f83bdf","resolution":{"observed_at":"2026-06-09T02:06:03.715193Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":"2506.03106","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-07-04T00:29:15.119817Z","title":"Critique-grpo: Advancing llm reasoning with natural language and numerical feedback","venue":"cs.CL","work_id":"162d9cd7-aaa3-4c80-b5d0-3d38a404c421","year":2025},"citing_paper":{"arxiv_id":"2605.06130","last_updated":"2026-05-12T10:25:23Z","snapshot_observed_at":"2026-08-11T07:53:51.847466Z","submitted_at":"2026-05-07T12:33:30Z","title":"Skill1: Unified Evolution of Skill-Augmented Agents via Reinforcement Learning","version":3},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-05-13T07:17:13.708752Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2605.06130"},"observation_digest":"sha256:d211f575df950ea36296d064e58c84e9f4187012f57d44a6b65f5fbc7bd53432","observation_id":"49fb552d-fa19-4b23-9a97-b8ac7eeb583e","resolution":{"observed_at":"2026-06-09T02:06:03.715193Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":"2506.03106","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-07-04T00:29:15.119817Z","title":"Critique-grpo: Advancing llm reasoning with natural language and numerical feedback","venue":"cs.CL","work_id":"162d9cd7-aaa3-4c80-b5d0-3d38a404c421","year":2025},"citing_paper":{"arxiv_id":"2605.08666","last_updated":"2026-05-09T04:07:20Z","snapshot_observed_at":"2026-08-11T12:21:39.667239Z","submitted_at":"2026-05-09T04:07:20Z","title":"The Cancellation Hypothesis in Critic-Free RL: From Outcome Rewards to Token Credits","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T01:24:03.186413Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2605.08666"},"observation_digest":"sha256:a1a8e15d536d80d219261cb0091f691f5b560fc8aa19fff3a214508fe7dcfeb9","observation_id":"c92ccc7a-cd02-4fe1-bf07-cb4b694efa8a","resolution":{"observed_at":"2026-06-09T02:06:03.715193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":"2506.03106","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-07-04T00:29:15.119817Z","title":"Critique-grpo: Advancing llm reasoning with natural language and numerical feedback","venue":"cs.CL","work_id":"162d9cd7-aaa3-4c80-b5d0-3d38a404c421","year":2025},"citing_paper":{"arxiv_id":"2605.12652","last_updated":"2026-06-01T07:33:52Z","snapshot_observed_at":"2026-08-11T13:23:10.571972Z","submitted_at":"2026-05-12T18:57:44Z","title":"Multi-Rollout On-Policy Distillation via Peer Successes and Failures","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-14T21:29:36.803832Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2605.12652"},"observation_digest":"sha256:d4e5a070bc77dcbebd0ecc7356dad9d2182efbb620f2bed45557c46946d684ec","observation_id":"88a1d0f1-93d7-4601-875a-9bc7a2fa9e35","resolution":{"observed_at":"2026-06-09T02:06:03.715193Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":"2506.03106","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-07-04T00:29:15.119817Z","title":"Critique-grpo: Advancing llm reasoning with natural language and numerical feedback","venue":"cs.CL","work_id":"162d9cd7-aaa3-4c80-b5d0-3d38a404c421","year":2025},"citing_paper":{"arxiv_id":"2605.15224","last_updated":"2026-05-13T08:50:05Z","snapshot_observed_at":"2026-08-08T09:54:59.992034Z","submitted_at":"2026-05-13T08:50:05Z","title":"ICRL: Learning to Internalize Self-Critique with Reinforcement Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-19T17:58:05.817581Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2605.15224"},"observation_digest":"sha256:2f684c98271f74cd5223ff4ff9c230c35c30b4c1efcd2e3dbe2acca198dc3959","observation_id":"1079fdf3-9892-4d3b-833e-04649fba1d4d","resolution":{"observed_at":"2026-06-09T02:06:03.715193Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":"2506.03106","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-07-04T00:29:15.119817Z","title":"Critique-grpo: Advancing llm reasoning with natural language and numerical feedback","venue":"cs.CL","work_id":"162d9cd7-aaa3-4c80-b5d0-3d38a404c421","year":2025},"citing_paper":{"arxiv_id":"2605.17877","last_updated":"2026-07-31T02:25:17Z","snapshot_observed_at":"2026-08-14T16:21:23.906203Z","submitted_at":"2026-05-18T05:39:30Z","title":"PAIR: Prefix-Aware Internal Reward Model for Multi-Turn Agent Optimization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-20T10:41:25.205368Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2605.17877"},"observation_digest":"sha256:180851189e7407dcfe03b08e2f59d35c5dbc1ffa0d77dabcf87f1ed78df4e39b","observation_id":"655f3118-46d8-4a0a-bbeb-1c7b7de284f2","resolution":{"observed_at":"2026-06-09T02:06:03.715193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-08-03T02:23:32.244687Z","title":"Critique-grpo: Advancing llm reasoning with natural language and numerical feedback","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.17877","last_updated":"2026-07-31T02:25:17Z","snapshot_observed_at":"2026-08-14T16:21:23.906203Z","submitted_at":"2026-05-18T05:39:30Z","title":"PAIR: Prefix-Aware Internal Reward Model for Multi-Turn Agent Optimization","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T02:23:32.244687Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2605.17877"},"observation_digest":"sha256:e9e66c00c227118f3135fa789fa749c38a7016571c10f43ce9c1b064a38435bd","observation_id":"257ced7d-efc5-48ce-92a7-13ba8301d3d2","resolution":{"observed_at":"2026-08-03T02:23:32.244687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":"2506.03106","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-07-04T00:29:15.119817Z","title":"Critique-grpo: Advancing llm reasoning with natural language and numerical feedback","venue":"cs.CL","work_id":"162d9cd7-aaa3-4c80-b5d0-3d38a404c421","year":2025},"citing_paper":{"arxiv_id":"2605.18799","last_updated":"2026-05-11T09:22:39Z","snapshot_observed_at":"2026-08-12T12:04:30.856151Z","submitted_at":"2026-05-11T09:22:39Z","title":"ReCrit: Transition-Aware Reinforcement Learning for Scientific Critic Reasoning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-20T22:51:56.666980Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2605.18799"},"observation_digest":"sha256:fb55ea7265c52ee5b8192f73db6e1008e8b6c4e7cbc4c7cf37b69c2d7c2d74cc","observation_id":"903fc1e0-9e56-49c6-8d49-e5453ff4554e","resolution":{"observed_at":"2026-06-09T02:06:03.715193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":"2506.03106","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-07-04T00:29:15.119817Z","title":"Critique-grpo: Advancing llm reasoning with natural language and numerical feedback","venue":"cs.CL","work_id":"162d9cd7-aaa3-4c80-b5d0-3d38a404c421","year":2025},"citing_paper":{"arxiv_id":"2605.18851","last_updated":"2026-05-13T11:04:31Z","snapshot_observed_at":"2026-07-06T23:29:38.069295Z","submitted_at":"2026-05-13T11:04:31Z","title":"STRIDE: Learnable Stepwise Language Feedback for LLM Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-20T20:47:16.236629Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2605.18851"},"observation_digest":"sha256:7d18105077d8b35535416cb9905c215954af01c17b022d5645f40c59fe2fabd0","observation_id":"0b8c0dfe-6fa1-4a06-81dd-689eda059d4e","resolution":{"observed_at":"2026-06-09T02:06:03.715193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":"2506.03106","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-07-04T00:29:15.119817Z","title":"Critique-grpo: Advancing llm reasoning with natural language and numerical feedback","venue":"cs.CL","work_id":"162d9cd7-aaa3-4c80-b5d0-3d38a404c421","year":2025},"citing_paper":{"arxiv_id":"2605.20506","last_updated":"2026-05-19T21:23:24Z","snapshot_observed_at":"2026-08-14T16:10:09.815792Z","submitted_at":"2026-05-19T21:23:24Z","title":"Reinforcing Human Behavior Simulation via Verbal Feedback","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-05-21T07:21:48.649289Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2605.20506"},"observation_digest":"sha256:13c013e2619f34148e5581bbf2264862cb33a385915f78b76741ca568840116b","observation_id":"83749c53-f9af-400e-8a4e-5f7b7a0b53fd","resolution":{"observed_at":"2026-06-09T02:06:03.715193Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":"2506.03106","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-07-04T00:29:15.119817Z","title":"Critique-grpo: Advancing llm reasoning with natural language and numerical feedback","venue":"cs.CL","work_id":"162d9cd7-aaa3-4c80-b5d0-3d38a404c421","year":2025},"citing_paper":{"arxiv_id":"2605.24547","last_updated":"2026-05-23T12:28:14Z","snapshot_observed_at":"2026-08-13T15:55:43.033932Z","submitted_at":"2026-05-23T12:28:14Z","title":"RL with Learnable Textual Feedback: A Bilevel Approach","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T14:36:31.047856Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2605.24547"},"observation_digest":"sha256:2247a3a484d1ab96d7f02592f711aca532280e6ece736d2bf1c10899661ac31d","observation_id":"2c37c286-2716-4642-a16e-14e9f9a86d98","resolution":{"observed_at":"2026-06-30T14:44:45.361285Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":"2506.03106","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-07-04T00:29:15.119817Z","title":"Critique-grpo: Advancing llm reasoning with natural language and numerical feedback","venue":"cs.CL","work_id":"162d9cd7-aaa3-4c80-b5d0-3d38a404c421","year":2025},"citing_paper":{"arxiv_id":"2605.25507","last_updated":"2026-05-26T17:23:26Z","snapshot_observed_at":"2026-08-13T15:47:23.369259Z","submitted_at":"2026-05-25T07:11:50Z","title":"Credit Assignment with Resets in Language Model Reasoning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T21:50:18.827822Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2605.25507"},"observation_digest":"sha256:d87c191a29aebe6c261568009559bba9f29873fcb0a4985a4251f640166e0cae","observation_id":"48d2b711-066b-41b2-9cc9-1acf83b95f91","resolution":{"observed_at":"2026-06-29T21:53:59.255224Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":"2506.03106","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-07-04T00:29:15.119817Z","title":"Critique-grpo: Advancing llm reasoning with natural language and numerical feedback","venue":"cs.CL","work_id":"162d9cd7-aaa3-4c80-b5d0-3d38a404c421","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-08-12T03:28:30.781632Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":189,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:168f57dfa8e4bef4f20914805d4013b7c2084ba07609f23578f31ff2ce596ada","observation_id":"660eefdb-b031-4778-b04d-c84b18bac9e8","resolution":{"observed_at":"2026-07-01T20:56:13.705760Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":"2506.03106","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-07-04T00:29:15.119817Z","title":"Critique-grpo: Advancing llm reasoning with natural language and numerical feedback","venue":"cs.CL","work_id":"162d9cd7-aaa3-4c80-b5d0-3d38a404c421","year":2025},"citing_paper":{"arxiv_id":"2606.18910","last_updated":"2026-06-17T10:37:23Z","snapshot_observed_at":"2026-08-02T21:25:42.997753Z","submitted_at":"2026-06-17T10:37:23Z","title":"REVES: REvision and VErification--Augmented Training for Test-Time Scaling","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-06-26T21:14:15.337979Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2606.18910"},"observation_digest":"sha256:e68549a702546c70973325e522a6e0d5baf673d76f8d2079e17f201952235f3b","observation_id":"5fe53e6d-5bfa-441c-8a6d-0c93514215e6","resolution":{"observed_at":"2026-07-04T00:29:15.122126Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-07-12T00:33:06.488657Z","title":"Xiaoying Zhang, Yipeng Zhang, Hao Sun, Kaituo Feng, Chaochao Lu, Chao Yang, and Helen Meng","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03702","last_updated":"2026-07-04T04:45:05Z","snapshot_observed_at":"2026-08-08T01:16:20.925428Z","submitted_at":"2026-07-04T04:45:05Z","title":"Agent Reinforcement Learning via Pivotal-Aware Self-Feedback Retry","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-12T00:33:06.488657Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2607.03702"},"observation_digest":"sha256:cfc9b31b42aa2705ca053a50df8b3e885bd703728d1f7408b9d772e59ba5460d","observation_id":"c34e7e5f-a8a7-40f4-b444-3fab060e95ae","resolution":{"observed_at":"2026-07-12T00:33:06.488657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-08-01T16:07:59.623378Z","title":"arXiv preprint arXiv:2506.03106 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18110","last_updated":"2026-07-20T16:08:49Z","snapshot_observed_at":"2026-08-13T22:38:23.734771Z","submitted_at":"2026-07-20T16:08:49Z","title":"LLM-as-a-Coach: Experiential Learning for Non-Verifiable Tasks","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-01T16:07:59.623378Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2607.18110"},"observation_digest":"sha256:38e92d3f6e2214b28264f9f902012ae091c74fc73a9b24500a929b43b0b319d0","observation_id":"483e6977-b08e-4d13-b184-6573aeae10e3","resolution":{"observed_at":"2026-08-01T16:07:59.623378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03106","snapshot_observed_at":"2026-08-11T23:11:38.110587Z","title":"arXiv preprint arXiv:2506.03106 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09123","last_updated":"2026-08-10T05:02:28Z","snapshot_observed_at":"2026-08-13T23:41:29.652920Z","submitted_at":"2026-08-10T05:02:28Z","title":"RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T23:11:38.110587Z"},"links":{"cited_paper":"/paper/2506.03106","citing_paper":"/paper/2608.09123"},"observation_digest":"sha256:87776ef4f183934c80b5bad45665d8917548744fc2ed2377a76caba736da3bf5","observation_id":"fe2f8e82-8e4d-4241-9d0c-09b7c8812357","resolution":{"observed_at":"2026-08-11T23:11:38.110587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.03106/citation-record","integrity":"/paper/2506.03106/integrity","json":"/paper/2506.03106/citation-record.json","paper":"/paper/2506.03106"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:35.775839Z","title":"needle in a haystack","venue":null,"work_id":"2585965a-db91-41a1-9eb7-3f77543fb50d","year":null},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.192749Z"},"links":{"citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:0cefb04fe504d375ead84a02624f3bb4d2c99cf9e67db586d027ab2ba7966467","observation_id":"a579f800-b35c-4935-90c5-4a76dec37ed3","resolution":{"observed_at":"2026-08-07T11:15:35.779353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:35.766425Z","title":"While the worst-case complexity remains dimT E(H, ℓ, ϵ)≈O(|S|L), the critique acts as a pruning signal","venue":null,"work_id":"b00124a0-f3ce-4c06-bcb7-b83f8aec10f7","year":null},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.195999Z"},"links":{"citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:6cf59bfc3d15d09445edaf49515f2202624fc25074991bbe8519e7cd55e5b9ee","observation_id":"8f534efd-4ea8-42f6-8d0b-09cda7837070","resolution":{"observed_at":"2026-08-07T11:15:35.769972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:35.687117Z","title":null,"venue":null,"work_id":"1324f9c8-9a39-4645-8fd8-642ec20a320b","year":null},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.222317Z"},"links":{"citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:0f78944978811c25162629be6e4f3ce9fad7a9406d092d94a92a9e5340b7a5c8","observation_id":"b7ad4a6d-2136-4acf-a79a-1b4869b9c1c7","resolution":{"observed_at":"2026-08-07T11:15:35.690194Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:35.170943Z","title":"Wang, Y ., Yue, X., and Chen, W","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.170943Z"},"links":{"citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:3fb4d0ff5e79513237872d92b13132acdd757edadc197646ca1a0d809dcf71b5","observation_id":"90b9b898-9e89-4f9c-ac0c-dbff6c9078c9","resolution":{"observed_at":"2026-08-07T11:15:35.170943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:35.550836Z","title":"The correct maximum value, as derived from a proper analysis, should be 10 3","venue":null,"work_id":"a2e29a58-1c8c-4982-8a31-5a4db33d6660","year":null},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.267794Z"},"links":{"citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:1b04a38eafc035a8ac9e244b7b15b379cab0db30fa5efb65c1d2407dfb34c6c4","observation_id":"ad29d770-e3e6-4bc6-877a-0c21c185e548","resolution":{"observed_at":"2026-08-07T11:15:35.556971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-07T11:15:35.178558Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.178558Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:c605c9e163395b5f91c9e0391d062e4f1b91ca4ae22a4e3e17e94b8c7b63fbd7","observation_id":"ef39f899-e63f-45a1-b692-4364d4fae2ea","resolution":{"observed_at":"2026-08-07T11:15:35.178558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:35.181921Z","title":"Zhang, X., Peng, B., Li, K., Zhou, J., and Meng, H","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.181921Z"},"links":{"citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:2c3c7c4c4c953792ed829f1b2d8a26cb926cdb863877e5829646040fd3fa559d","observation_id":"39b23d80-f7f2-4675-ad68-235586a58802","resolution":{"observed_at":"2026-08-07T11:15:35.181921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:35.185214Z","title":"correct” and “incorrect","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.185214Z"},"links":{"citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:b218eff4ed79bc96046b19f849ca3f0d845f1431617120f02fbe6b3043584229","observation_id":"0d54d17d-9fa2-43c1-bf9a-a3de9d99d77a","resolution":{"observed_at":"2026-08-07T11:15:35.185214Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:35.785778Z","title":"As illustrated in Figure 8, this function is bounded between (0,1) , where x represents the token probability of the policy","venue":null,"work_id":"3c10ddd5-22f0-4527-9542-10f2ad1de3f4","year":2025},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.189419Z"},"links":{"citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:ccd0adf0408812f3cd0e333351c60364d836a454b42aa14771879d2dceecbbab","observation_id":"5f77a2b8-0532-498f-aa9c-3d95e421f3f1","resolution":{"observed_at":"2026-08-07T11:15:35.789361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:35.756607Z","title":"In this setting, the feedback function is simply the reward itself, fη(a) =r(a)","venue":null,"work_id":"bef469d0-b071-4386-aaa9-8d74c5a68656","year":null},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.199170Z"},"links":{"citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:9dc03895cb2acbd2a0d5a3f0e78c29c12b4758feb0af3342ef75f450dd781527","observation_id":"7ffef02b-96c2-48ce-a18e-b35fb89a5553","resolution":{"observed_at":"2026-08-07T11:15:35.760582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:35.746227Z","title":"The probability of finding the unique optimal solution a∗ is equivalent to sampling the correct element from a set of sizedwithout replacement","venue":null,"work_id":"e1e18130-b3cd-4f6e-ae13-628e71f150d0","year":2024},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.202422Z"},"links":{"citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:2fe5765903e34fd465596a3bd9cec7af5d9de6db0d244cf14789ad1f7b7b6e03","observation_id":"f008ba4f-474c-4083-8873-e2fee8bd2e6d","resolution":{"observed_at":"2026-08-07T11:15:35.750597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:35.735265Z","title":"Since γ≪1 , the gradient magnitude is significantly dampened","venue":null,"work_id":"c8b8d6a0-4d3c-45c0-accd-9e32aa39f205","year":null},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.205872Z"},"links":{"citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:4bdce27fe0c52b1291dca8d4a9c6bb7bcaa2c04661a23799c338307cf6dd8391","observation_id":"1b7aa275-33cb-445b-9173-d95966e02ccb","resolution":{"observed_at":"2026-08-07T11:15:35.739780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:35.724752Z","title":"weaker refinement,","venue":null,"work_id":"9a8ffab6-a46e-46e6-929b-e9f72830e73a","year":2017},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.209183Z"},"links":{"citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:0bfebf9a2171f2e86caba06fe4acd9a3bad98332a2dad940f3c8e6d9bdc6011d","observation_id":"9f3ca082-9d4f-44c2-8694-c307e8481ab4","resolution":{"observed_at":"2026-08-07T11:15:35.729061Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:35.705661Z","title":null,"venue":null,"work_id":"32744851-d3e9-4567-aeee-244ac017e3e9","year":null},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.215979Z"},"links":{"citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:6a20b14efd22bc17de8e3ba8a3f710fcbd3f076d61b1a03ad54471f578cdb398","observation_id":"119a2374-8a19-4e5b-94a6-3c2f71405470","resolution":{"observed_at":"2026-08-07T11:15:35.708975Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:35.695863Z","title":null,"venue":null,"work_id":"8ea537b8-4a26-4a70-9196-125b7e143c3f","year":null},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.219150Z"},"links":{"citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:33c3e5ec2f5aaf97382a744b6ccb63312babe4e418178f20b3af6dfadbb96a9c","observation_id":"c9c10e5b-01ee-4e8c-9b10-4407e713a172","resolution":{"observed_at":"2026-08-07T11:15:35.699270Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:35.677628Z","title":"Conclusion:","venue":null,"work_id":"cd587ac7-3be4-4eab-acb6-a412bd5b10c6","year":null},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.225726Z"},"links":{"citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:73c7810b043e1c616575c8b2e7e34dbdb654f64a0a791df441248cd20e760a6f","observation_id":"7b28c74e-0063-4c28-baa5-b1582b90f90b","resolution":{"observed_at":"2026-08-07T11:15:35.680966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:35.667945Z","title":"Calculate the cosine of the angle of the axial section of the cone at the vertex which is also the apex of the cone","venue":null,"work_id":"b0086454-1bc6-4c57-8ac0-0dd0985f1d94","year":null},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.229585Z"},"links":{"citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:d8f0cbd72a68d84553f6115571ab0ee2ee816f3856a1e0303e1ef72d3505869c","observation_id":"459c337b-f614-44a2-b336-4b4a4742ad76","resolution":{"observed_at":"2026-08-07T11:15:35.671451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:35.657941Z","title":"Wait, let me check that again","venue":null,"work_id":"2c1cc4fc-b68c-43d8-9730-91c353faafee","year":null},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.233555Z"},"links":{"citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:65fee4b7999c0b8392786c536af0a6b1368cd277ac3952a0b790f2237203ed94","observation_id":"b3b5fbd5-10bb-4732-bb84-ca5c18c21d16","resolution":{"observed_at":"2026-08-07T11:15:35.661156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:35.648676Z","title":null,"venue":null,"work_id":"ff00833f-b2e2-4638-a52f-f153f1148d59","year":null},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.237179Z"},"links":{"citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:a7f3703ca0d59bc38ec585d8c0dd9ee7ae80730489c6a94b5a4608aff2e111c5","observation_id":"28757a41-8f8a-4084-a7b3-6f5e700fdf57","resolution":{"observed_at":"2026-08-07T11:15:35.651769Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:35.628249Z","title":"Therefore, the exact value is − 9 100, and the approximate decimal is −0.09","venue":null,"work_id":"fce19641-e47c-498c-9a23-bead5599fa21","year":null},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.244109Z"},"links":{"citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:e645cfe0a108682d9b011b0bbab828d9c672787328088d8f3b94d503da42f619","observation_id":"13b69af0-af44-488c-b3ad-25abf3a3b693","resolution":{"observed_at":"2026-08-07T11:15:35.632214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:35.617086Z","title":"Alternatively, if I think about angles: A is arcsin(0.4), which is in the first quadrant, B is arcsin(0.5) which is π/6, also first quadrant","venue":null,"work_id":"1694f268-0342-40e0-ac7a-78d006477585","year":null},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.247160Z"},"links":{"citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:67f2957e6172a8af7eb24ad8256fa413622ce2c47e8007173524cfa7478e6844","observation_id":"f59290c6-e1c1-4789-ab3b-44eb96d8ac3c","resolution":{"observed_at":"2026-08-07T11:15:35.621418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:35.607072Z","title":"Alternatively, using complex numbers or other methods? Maybe not necessary","venue":null,"work_id":"e1268f08-ac71-4648-a0f2-907c39532a8d","year":null},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.250430Z"},"links":{"citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:9099d39e970a0c8d73e47671b7bfccc0493acbf91566e0ef842b402ae558359f","observation_id":"93a02610-6565-4c74-b972-b2944de36dba","resolution":{"observed_at":"2026-08-07T11:15:35.610767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:35.596639Z","title":"The trigonometric substitution should be used more carefully, ensuring that the constraint is satisfied throughout","venue":null,"work_id":"d3fa0996-764c-424f-b3fa-83dd398eacac","year":null},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.254352Z"},"links":{"citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:7740c9c0543bae8c289275faaf807198562adff23f5dba6872d8acec75af8e89","observation_id":"f43a9e87-3503-4e60-8d7d-88999f07724e","resolution":{"observed_at":"2026-08-07T11:15:35.600273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:35.585956Z","title":"The identities used do not lead to a valid simplification of the expression","venue":null,"work_id":"80ec3eea-285c-41b5-bda5-75b949c30e5b","year":null},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.257744Z"},"links":{"citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:5393e1b3f213bbb8792ef703963c939dc6132b77cb54f9a07799072bacffbf13","observation_id":"38bb0bc3-ed9d-43a2-a587-2e083088dddc","resolution":{"observed_at":"2026-08-07T11:15:35.589374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:35.575668Z","title":"The derivative should be taken with respect to the correct variables, and the critical points should be found accurately","venue":null,"work_id":"0aba2c33-aee0-4bb1-b1d3-5fb94fcb5711","year":null},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.261000Z"},"links":{"citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:a3605e9fd952f93d6f9235322643734335f984a32173c5e1eabe54a97f6c697f","observation_id":"1857b7b4-4f3e-4372-939d-e47bc3240fc5","resolution":{"observed_at":"2026-08-07T11:15:35.579589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:35.564109Z","title":"The values chosen fora,b, andcdo not satisfy the constraintabc+a+c=b","venue":null,"work_id":"613888e2-4ff4-49a7-8a15-a60290baae70","year":null},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.264265Z"},"links":{"citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:66e29751f4eea4762133dd964b5192eab3337414e042c3e23c27a9d84542111e","observation_id":"47df313b-3674-4c95-a2a8-6db297b6c724","resolution":{"observed_at":"2026-08-07T11:15:35.568539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:35.638350Z","title":"Therefore, the value of the original expression is −9 100","venue":null,"work_id":"fde54428-de86-4982-bc97-e99a98e1a9b2","year":null},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.240692Z"},"links":{"citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:b8c702bbb6335361b7cfe23cdf249117d227f479a953dd7a216478f4077b681b","observation_id":"fe9f3e00-79b7-48ae-8afb-028fe77f3064","resolution":{"observed_at":"2026-08-07T11:15:35.641688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:15:35.715300Z","title":"Wait,","venue":null,"work_id":"604d2eef-114d-4ad8-8462-e28aca45080d","year":2025},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":150,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.212533Z"},"links":{"citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:cd2e124a4e619c05241419d7b60d0f44e450d543323212dbcaf4a51c6e928650","observation_id":"9a8caf7d-b4f7-4f1e-96d6-2abf3d3b9665","resolution":{"observed_at":"2026-08-07T11:15:35.718737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-07T11:15:35.163327Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":155,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.163327Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:05fc1cc2f7248b8cf6d03607e0463d2da32b71d4a23177e3b6db421379b989e4","observation_id":"25931b4a-6bc6-4e11-96a3-e127664f2d9a","resolution":{"observed_at":"2026-08-07T11:15:35.163327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T11:15:35.167088Z","title":"Shao, Z., Wang, P., Zhu, Q., Xu, R., Song, J., Bi, X., Zhang, H., Zhang, M., Li, Y ., Wu, Y ., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.167088Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:467d75780d6958b68c02131c51d17aa37c78d10cb16b349887e2326f2db7c94c","observation_id":"8ffcab6a-b67c-4d0d-9558-9ec2d5b83103","resolution":{"observed_at":"2026-08-07T11:15:35.167088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-08-13T12:34:54.476684Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-07T11:15:35.158495Z","title":"Lin, T.-Y ., Goyal, P., Girshick, R., He, K., and Doll ´ar, P","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.158495Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:2e8662fe0f3f787451fb917be6844aa57ced623dec8d0fc1f19d81df53a7b6b6","observation_id":"d350a58a-8bf7-4c42-8595-7e3dbfa237f4","resolution":{"observed_at":"2026-08-07T11:15:35.158495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14945","last_updated":"2025-06-22T00:18:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-21T08:09:13Z","title":"Learning to Reason under Off-Policy Guidance","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14945","snapshot_observed_at":"2026-08-07T11:15:35.175237Z","title":"Yan, J., Li, Y ., Hu, Z., Wang, Z., Cui, G., Qu, X., Cheng, Y ., and Zhang, Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback","version":7},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:35.175237Z"},"links":{"cited_paper":"/paper/2504.14945","citing_paper":"/paper/2506.03106"},"observation_digest":"sha256:02a4bb2294ee8b487957c8185fcd77fc8d22c60ab274f4f2bd61533d535de6d9","observation_id":"45364875-fb18-435c-8de7-197aa7aacc8a","resolution":{"observed_at":"2026-08-07T11:15:35.175237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.03106","last_updated":"2026-06-06T08:11:21Z","latest_version":7,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-13T12:35:32.895109Z","submitted_at":"2025-06-03T17:39:02Z","title":"Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":19},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 31 inbound Pith citation observations for arXiv:2506.03106."}