{"as_of":"2026-08-11T09:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7d55073f206a71741cc1c603a12a557e52a822066f98755f12cb71b258316e29","coverage":[{"denominator":77,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":77,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:49:51.597998Z","state":"measured"},{"denominator":77,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":77,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.06310/citation-record","integrity":"/paper/2608.06310/integrity","json":"/paper/2608.06310/citation-record.json","paper":"/paper/2608.06310"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:52.739198Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"03ddd226-3430-4cea-a009-50071a08f4fc","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:45.244621Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:cf7f102a4d38c1d995811741865d34949ae5b70ea84058b88e6bff6138e499fd","observation_id":"b12cabb1-843c-474d-a18d-35c787b36ab9","resolution":{"observed_at":"2026-08-07T05:49:52.743820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:52.724524Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":"8098ebaa-8a17-4782-a0f0-81ca94c599fd","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:45.347881Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:c37a3705105a53cc319f5ebf10da43b49f19cc556e074990914a9f044dee411f","observation_id":"22df6d52-8ba6-4011-9982-cd97d2cc0ea1","resolution":{"observed_at":"2026-08-07T05:49:52.729886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05236","last_updated":"2026-02-25T13:17:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-07T08:36:05Z","title":"Unified Reward Model for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05236","snapshot_observed_at":"2026-08-07T05:49:45.440896Z","title":"arXiv preprint arXiv:2503.05236 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:45.440896Z"},"links":{"cited_paper":"/paper/2503.05236","citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:7faff5705fdb7835ea92ccb6acc937f804fd77916126b79579928461fa35bb98","observation_id":"874c2201-b413-4803-bccf-15fc82642af2","resolution":{"observed_at":"2026-08-07T05:49:45.440896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:52.710301Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":"71372aa4-bbe8-40b3-bfb4-4230c0703ad5","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:45.553185Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:d866bf2726e431c2fc6c1f23f1f9b4244c48b9f3acdd09b5f2d7e7595ac45c56","observation_id":"872aecdc-9cd9-4a4f-a1a1-b8c05bff6acf","resolution":{"observed_at":"2026-08-07T05:49:52.714983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:52.694310Z","title":"Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":"e51a33b5-5a26-4a16-8c9f-f7cb488020eb","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:45.641778Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:a589fe5601e5704214ff84a00620fa205b9c66515cee645844a7f8d906bb86fa","observation_id":"f2875dae-92c1-47ac-88bf-3db3247f8185","resolution":{"observed_at":"2026-08-07T05:49:52.699831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-11T04:55:17.296477Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.10527","snapshot_observed_at":"2026-08-07T05:49:45.723481Z","title":"arXiv preprint arXiv:2505.10527 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:45.723481Z"},"links":{"cited_paper":"/paper/2505.10527","citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:632df4b2af19a40d853003b8f0768e0f5e470d654bbea7d64dc5ac61b42dde81","observation_id":"e834e349-dfe1-4c35-b6a7-699bc4d1b514","resolution":{"observed_at":"2026-08-07T05:49:45.723481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:52.679352Z","title":"Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":"997c92b9-af18-48e2-903a-9c03a615d620","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:45.828879Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:284a4c2b5aebcad41383dda2ea8b3e1f77280d8f100f55611bf08b7800ce9bcb","observation_id":"e1eae25c-98dc-46f4-bd31-67057d34c166","resolution":{"observed_at":"2026-08-07T05:49:52.684677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:52.664656Z","title":"Reward is enough: Llms are in-context reinforcement learners , volume =","venue":null,"work_id":"c669ab73-23cc-4d42-b5af-62a01de6ac96","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:45.901475Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:4c3fe642dd7b156f67cba8bd6fdf7a18cceac224b0f6c92c281d5ec4940c2797","observation_id":"5ac76aea-1516-4274-aa1a-c86127d9e040","resolution":{"observed_at":"2026-08-07T05:49:52.669302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:52.650029Z","title":null,"venue":null,"work_id":"c63e8441-716d-4900-a215-931691c6bb11","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:45.971684Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:ce9931559609f1d876ba5125e6818504b9df6b1beee25c59584738ea79c7f39f","observation_id":"d9c87546-9603-4be6-9e86-b1c393da434a","resolution":{"observed_at":"2026-08-07T05:49:52.654417Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:52.636353Z","title":"Scaling laws for neural language models , volume =","venue":null,"work_id":"fe9eecab-a5d2-4235-ad61-8accba2890df","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:46.075861Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:682f654a5b100100b34979f981ecd365044278fb0495421a4a7f8c5e8311e78d","observation_id":"88ac1e2a-c41b-44a4-821e-b08628422215","resolution":{"observed_at":"2026-08-07T05:49:52.640904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:52.620990Z","title":"Large language models are not fair evaluators , year =","venue":null,"work_id":"c67bb63e-124e-40e0-aa96-942fe9473bf5","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:46.128006Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:a54ef25e434cb340873627c942f633b1487c7e5b9857b5b6c9bb098ce33f2b0f","observation_id":"3c3453f5-e0ce-45b3-8d12-65c133728908","resolution":{"observed_at":"2026-08-07T05:49:52.626147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:52.606329Z","title":"Theoretical and empirical evaluation of data reduction for exact Kemeny rank aggregation , volume =","venue":null,"work_id":"60c25c0b-d334-42d2-be28-b535b311d97f","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:46.200418Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:3d8f09c0c216ebc634aee26c35b92fbe3202d88da666b50232ebe51d410d77a9","observation_id":"a26e3229-0fc7-499a-9efc-b1b29c362500","resolution":{"observed_at":"2026-08-07T05:49:52.610894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:52.592026Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"828fcbd9-14eb-486d-88ae-6cfcb2699a83","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:46.264080Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:c9fde0fd71a201fe6e18acd84ea2ce1b3b9a0fdcd3bd99bf93595ce0f0266733","observation_id":"abc954f5-9411-4fb6-88fb-fb668c94d847","resolution":{"observed_at":"2026-08-07T05:49:52.596995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:52.576461Z","title":"Improved parameterized algorithms for the Kemeny aggregation problem , year =","venue":null,"work_id":"b4228339-b0ef-488c-95ca-f8939d468221","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:46.349746Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:dd9c3a629ef8ce8710edf6840742219622fbd3976131274e0fb9ce6a9e9eb207","observation_id":"a288283c-417e-43f7-b702-0afebe30db57","resolution":{"observed_at":"2026-08-07T05:49:52.581671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:52.561622Z","title":"Are we done with mmlu? , year =","venue":null,"work_id":"ac2beea6-779a-460b-8104-619ed5281cb1","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:46.436711Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:74cb514bcb6dc1aa07c816010476e81628b246483ff33a5d5ee4ab1f461a28ba","observation_id":"a3233059-6b6a-45b9-9c8d-52dbd3cd32d7","resolution":{"observed_at":"2026-08-07T05:49:52.566449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:52.546368Z","title":"Length-controlled alpacaeval: A simple debiasing of automatic evaluators , year =","venue":null,"work_id":"6ca443cd-3696-4aea-99fe-bf3d2a75c474","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:46.503362Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:01df86ca9de590c1bc96f4ab8e2fcccf2f6432a04f3b3e9f4e583ead1933e56d","observation_id":"9dddf58f-edbd-4289-ae91-9ba7ba432359","resolution":{"observed_at":"2026-08-07T05:49:52.550882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:52.532129Z","title":"Let's Verify Step by Step , year =","venue":null,"work_id":"8d6b9fd3-625d-495d-b78c-2c137370b040","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:46.594152Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:0e3bea3982302feea095163d76e43e78e07a3976eeae771db2042df4c87d57bb","observation_id":"3fd36120-3b59-402d-8147-bfbd4713ea10","resolution":{"observed_at":"2026-08-07T05:49:52.536480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:52.517879Z","title":"Gpqa: A graduate-level google-proof q&a benchmark , year =","venue":null,"work_id":"3014012c-8c20-41e8-bcf9-33ffca09d7fa","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:46.638322Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:3e7088033e7696437b35b0ca136e8d4e7d38affb121267dde1932982f81b2894","observation_id":"cfcb2e39-e491-480b-a1b7-85d637b189bc","resolution":{"observed_at":"2026-08-07T05:49:52.522331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:52.503450Z","title":"From crowdsourced data to high-quality benchmarks: Arena-hard and benchbuilder pipeline , volume =","venue":null,"work_id":"1398f6b9-f39b-43ab-a62a-051538ab11ac","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:46.727147Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:6b6840389b1fcdf57839ddec0ac88833a1ffed74c0e93f9648acab097d74e729","observation_id":"0fa929c0-9b64-4521-a979-12c017d6a46f","resolution":{"observed_at":"2026-08-07T05:49:52.508036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:52.488788Z","title":"Wildbench: Benchmarking llms with challenging tasks from real users in the wild , volume =","venue":null,"work_id":"92d740d0-e501-4250-88b5-632f3e9e440b","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:46.762252Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:229260c4ee95c8fa57d1a54b1b93bbc5654405835acd17cd7c3417f5fd6b4eee","observation_id":"3fe14d06-9186-4c56-9830-380a238aacd7","resolution":{"observed_at":"2026-08-07T05:49:52.493263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:52.473526Z","title":"Hashimoto , howpublished =","venue":null,"work_id":"76b01c6c-36fa-4ae9-9f7e-83a25a5b115d","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:46.900604Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:238a43047345627fff083e843b5e22425618711965964d35864faccd5d49dbd7","observation_id":"3e82869b-6700-4aab-a177-234bab8f057f","resolution":{"observed_at":"2026-08-07T05:49:52.478353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:52.458347Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward , year =","venue":null,"work_id":"73b2661b-54bb-42ee-b27d-e159706baf54","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:47.007901Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:bc6ef8948201828e8973c2c1c2fcdd7b7121e2fa6262a4d9a4a9c8deaea86e84","observation_id":"355a6e70-0d2d-43f0-89b1-a2fda7ff1101","resolution":{"observed_at":"2026-08-07T05:49:52.462913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:52.443088Z","title":"HelpSteer3-Preference: Open Human-Annotated Preference Data across Diverse Tasks and Languages , volume =","venue":null,"work_id":"556b7dfd-d3fb-463e-a1bf-69bd2094b8b6","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:47.133870Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:95e67f0497fef36f88e009d8e42485c206fa8a63b5647690173c3250b34e2ac1","observation_id":"19117320-1377-4f01-b117-5727f531c0b1","resolution":{"observed_at":"2026-08-07T05:49:52.448710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:52.426614Z","title":"Qwen2 technical report , volume =","venue":null,"work_id":"64e6c117-3e73-441a-8204-10131490fdba","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:47.251853Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:8ebd1d7d94590d26c14acf1299adefcb8ac6d05f58aa72ef7b811b4ca5edb583","observation_id":"9d034b94-468a-43be-adde-ba6bbeade5ea","resolution":{"observed_at":"2026-08-07T05:49:52.431704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:52.410350Z","title":"The llama 3 herd of models , volume =","venue":null,"work_id":"5dbd94f7-fca5-4e27-b8e3-135c1f42b851","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:47.388928Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:be02bd8739d8c4177ea27252be0223e7931825c2f70cd07aef9a90bf6a8aac31","observation_id":"365a72b4-5c00-4d89-bb4f-1ce13ea0d5f8","resolution":{"observed_at":"2026-08-07T05:49:52.415158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:52.396100Z","title":"Rrhf: Rank responses to align language models with human feedback without tears , year =","venue":null,"work_id":"9fe26132-9f6c-4640-adf0-f157aecc039c","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:47.473399Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:b271df903898e5c56049a79103fd0b6323f0dc3f917ea61ec96681e761128916","observation_id":"e5370f44-3ffc-4801-8fbe-d55fc5530a3a","resolution":{"observed_at":"2026-08-07T05:49:52.400745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:52.380818Z","title":"A computational study of the Kemeny rule for preference aggregation , year =","venue":null,"work_id":"757e0231-23fc-4429-95f7-123ca9871c6a","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:47.596594Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:754ff2b22742ecb1a79c02b3fb837d4191e798f19cb1d76dc86dd99b9806333d","observation_id":"85fedc31-14ce-4255-b22b-5d720dbc7908","resolution":{"observed_at":"2026-08-07T05:49:52.385608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:52.366262Z","title":"Judgebench: A benchmark for evaluating llm-based judges , year =","venue":null,"work_id":"9575ce3a-3028-4c3a-b49d-94e81f76df46","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:47.725278Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:ecc1d04b5acfac74a437dd8d0e0689214d34f784d3528e69d82e83473801a0ee","observation_id":"59d360b3-9b3d-456f-8839-3bdac42719d9","resolution":{"observed_at":"2026-08-07T05:49:52.371174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:52.350853Z","title":"Rm-bench: Benchmarking reward models of language models with subtlety and style , year =","venue":null,"work_id":"e024d317-6299-4281-8040-b975e7e1a5da","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:47.767357Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:6cb672c8339d5e37c4afb9af3795eea2e315d69966a22af4448fd19bed5f2cd1","observation_id":"76e7c7a9-8a8b-4d97-8ccb-726744604d13","resolution":{"observed_at":"2026-08-07T05:49:52.356201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:47.826230Z","title":"Proximal policy optimization algorithms , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:47.826230Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:335e07c0626b2bae0b4d9c91600e4560165053de2b52e2690056a1f6e105683f","observation_id":"fa601f3e-928d-4972-b376-ebb6eb3ad227","resolution":{"observed_at":"2026-08-07T05:49:47.826230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:52.327536Z","title":"Rank analysis of incomplete block designs: I","venue":null,"work_id":"204686f0-6a04-4a0f-bfb4-7bf1ce30bdaa","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:47.882955Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:b159ec6d392d7c2e82c876f22a2fe01fe8f3dde73ac31d0aadca3135c99fc203","observation_id":"9ff36b12-62a6-450f-bea7-5ed06b613eb1","resolution":{"observed_at":"2026-08-07T05:49:52.331929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:52.312806Z","title":"Reinforcement Learning with Verifiable Rewards: GRPO's Effective Loss, Dynamics, and Success Amplification , year =","venue":null,"work_id":"ac371dac-43ad-4e36-9a3a-5b76099aa441","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:47.917984Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:c3f7e6afd1d8299cb4f5823e21620519b54f34c8f8ecabb6a4e3c5b7caba4312","observation_id":"85e72548-907a-4bea-85fa-b08ebf5e0fd7","resolution":{"observed_at":"2026-08-07T05:49:52.317716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:52.299072Z","title":"Language models that think, chat better , year =","venue":null,"work_id":"cb4acbcd-bc95-4fd8-b121-58f244bf48c2","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:47.979978Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:f40e30a9f4b73760231e2460e00bafe1f71f5488444c80b84de7e5e6675bec0a","observation_id":"8a42ff62-ad78-4892-9759-5b79eb8f1844","resolution":{"observed_at":"2026-08-07T05:49:52.303692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:52.285711Z","title":"Dissecting Long Reasoning Models: An Empirical Study , year =","venue":null,"work_id":"16f304e6-90b9-43a6-ae41-62a8cbd68c3e","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:48.040116Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:c4bad7cad9eafb87ca0388aefd9e52bcbf0adc03e6620f0ac018d92e6dcdd139","observation_id":"ef34f03e-4bb5-40be-849c-abb9c80bb355","resolution":{"observed_at":"2026-08-07T05:49:52.290057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:52.270699Z","title":"Reinforcement learning with verifiable rewards implicitly incentivizes correct reasoning in base llms , year =","venue":null,"work_id":"64c3ec58-74c1-49be-8d0e-7f221a3f47e6","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:48.103572Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:807283b7f0d6005e755e0b638f2bd6a30600afa9ddb2919d624aa04f516ba05a","observation_id":"defa5713-cebe-4c74-93d7-09fa59f6532f","resolution":{"observed_at":"2026-08-07T05:49:52.275348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:52.256963Z","title":null,"venue":null,"work_id":"44afbded-8bf6-4934-9801-1ded3851d629","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:48.168385Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:d283b112c3bfd2d80776ae0cb3fd3db640ab422c7d90038bf3f331bae81aa406","observation_id":"b4c28ff7-c18d-4f2b-ac58-2b744eb86fe8","resolution":{"observed_at":"2026-08-07T05:49:52.261521Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:52.242527Z","title":"Pre-Trained Policy Discriminators are General Reward Models , year =","venue":null,"work_id":"d14d91cf-ac06-46de-a4c4-4d3dc1db8c18","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:48.209023Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:d082905f114821382a1f2df65c795e19f1fa34d7d5cd6c277848226caf11e3db","observation_id":"1b3741e8-8e3a-45a2-9816-bb41d5a2b51c","resolution":{"observed_at":"2026-08-07T05:49:52.247207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:52.227212Z","title":"Dynamic Reward Adjustment in Multi-Reward Reinforcement Learning for Counselor Reflection Generation , year =","venue":null,"work_id":"d1bc0994-1ed4-472f-a2bf-41e67b21a1a1","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:48.289493Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:dd934f517987ebc79337f4d71758b47383be61f178ca9a336c1e75b0c3c3100d","observation_id":"ea53c487-dc4c-4eeb-ba1a-bdbd04c02b01","resolution":{"observed_at":"2026-08-07T05:49:52.231862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:52.212000Z","title":"Contrastive Preference Optimization: Pushing the Boundaries of","venue":null,"work_id":"c63cc71d-8d88-45c5-86ec-7433d8dc86ed","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:48.361116Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:e6514ae3b8d1b4331ce2d67a5a191082665321fbf5f3ea919379298b2374b9ff","observation_id":"91696147-46b0-43a5-866b-90ec5bcbbe09","resolution":{"observed_at":"2026-08-07T05:49:52.217493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:52.197732Z","title":"From system 1 to system 2: A survey of reasoning large language models , year =","venue":null,"work_id":"7135ba69-8362-4290-891a-e7952b74dd69","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:48.425028Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:1191e2f4627215db18b0fdbf9b3bfbb23c3e8c47b4e4bb9dd27d21171232868a","observation_id":"e2cfe807-ba89-40b6-af9b-ae97d316bef8","resolution":{"observed_at":"2026-08-07T05:49:52.202329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:52.182180Z","title":null,"venue":null,"work_id":"92a06e6c-b9c2-4429-876a-90648b22d070","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:48.464368Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:19854c9baee2e2e142d3aacab5edf13cbd847fca780b65497cedefac0c7187a4","observation_id":"42037de2-a9df-499d-9cc1-42189ddef0e3","resolution":{"observed_at":"2026-08-07T05:49:52.187097Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:52.166966Z","title":"Prior constraints-based reward model training for aligning large language models , year =","venue":null,"work_id":"f9046273-c6d6-4ade-a668-8ef06ce94244","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:48.548703Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:905c394446cb73e9376d618a1cc4aaf0acaaf8fd5acdbd8345299160185e7d58","observation_id":"b566abb0-1aa6-4453-b6c6-97ae51c03c6d","resolution":{"observed_at":"2026-08-07T05:49:52.171582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:52.151418Z","title":"Improving In-Context Learning via Sequentially Selection and Preference Alignment for Few-Shot Aspect-Based Sentiment Analysis , year =","venue":null,"work_id":"18900709-6568-40c4-bcf2-e6e47dd58a10","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:48.602152Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:e95890c363b87ae1af35ac6f15dc0fecdaf78d3717c8040429c86e1af1628a57","observation_id":"de7f27d8-4851-4122-94fc-73e36ae6b8bd","resolution":{"observed_at":"2026-08-07T05:49:52.156190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:52.136471Z","title":"Qwen-audio: Advancing universal audio understanding via unified large-scale audio-language models , year =","venue":null,"work_id":"a86675ed-e4ee-477f-8c7b-fb5e04c9ace8","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:48.696057Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:6fd255cb6fe79430d9365e1a675fcc9c0881594416d04b6e3bd0e7e8793e6c7d","observation_id":"119bb83d-96b8-4f36-a699-fe18ba729caa","resolution":{"observed_at":"2026-08-07T05:49:52.141183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:52.121299Z","title":"Manning and Stefano Ermon and Chelsea Finn , booktitle =","venue":null,"work_id":"7ceea925-2eb1-4282-b4ba-4b764877144b","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:48.746417Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:37bfe32ff4d6fe71afc9e8bc7ee9aece5ee7652c4cf11a8fb7c3f695c174e7fd","observation_id":"38c72927-3206-40a4-98de-0a66f7aa5a28","resolution":{"observed_at":"2026-08-07T05:49:52.126244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:52.107162Z","title":"Discriminative Reranking for Neural Machine Translation , year =","venue":null,"work_id":"c2f85cec-0e1b-420f-8381-240cf1f53ff1","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:48.800135Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:9dee823d7b9054a3760f52ea53a9835d7c97970b032ed7fbc7837669ea757153","observation_id":"5f6a0495-ddc0-49fa-8cfd-e859a86ded4f","resolution":{"observed_at":"2026-08-07T05:49:52.111466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:48.894739Z","title":"Dapo: An open-source llm reinforcement learning system at scale , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:48.894739Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:df1a715f3455b0378427db7376ff6784c0537b78612ad6b4542431f8ee1d25cd","observation_id":"e4bcb13c-a52a-4763-809d-d513742ce78b","resolution":{"observed_at":"2026-08-07T05:49:48.894739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:48.962879Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:48.962879Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:197091f29f020ba524bb8bdc85cc0a0effb99553f17972db9c6272505d821d0b","observation_id":"5b28d81b-3420-4344-b60c-6f5b0b42fc86","resolution":{"observed_at":"2026-08-07T05:49:48.962879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:52.072811Z","title":"Generative reward modeling via synthetic criteria preference learning , year =","venue":null,"work_id":"ce71d35b-ac64-40ae-9fab-6c557a468cd2","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:49.006947Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:c00e16517a19d15b8e5e42bb774f64f87c47c8be4031ea8409ff5d89eb295344","observation_id":"057e7e02-d2c4-4063-a2e4-9bb69bf4c57a","resolution":{"observed_at":"2026-08-07T05:49:52.077498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:52.058297Z","title":"Unified multimodal chain-of-thought reward model through reinforcement fine-tuning , year =","venue":null,"work_id":"ee5ebcb9-cbed-450b-bfaa-d902af94351a","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:49.013516Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:b4327b10db8f18381dc97c431f65783790a4752a925b061d88906f75191d3940","observation_id":"6efafa89-5f2b-4bb9-9ea4-e4d74a342fb2","resolution":{"observed_at":"2026-08-07T05:49:52.062854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:52.043232Z","title":"Rm-r1: Reward modeling as reasoning , year =","venue":null,"work_id":"26be5c7e-443f-407d-bfcd-a50faa4aa655","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:49.112945Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:45e79df9a2d34535b36a38afbee1424e68a09a4b02817861a9798137f091c663","observation_id":"d03689ab-3acf-429a-b7ab-fc5322fbf02f","resolution":{"observed_at":"2026-08-07T05:49:52.048217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:52.029474Z","title":"Reward reasoning model , year =","venue":null,"work_id":"6fcafbae-4771-4a1f-b438-762e31520196","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:49.193651Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:b5554d1a24a8dac85e8e0a3d42a7af1a4e224a7e62bd39973e8d2abb4e273f93","observation_id":"cce62ad7-7a71-4235-b790-53db65196ea3","resolution":{"observed_at":"2026-08-07T05:49:52.033753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:52.014236Z","title":"GRAM-R ^2 : Self-Training Generative Foundation Reward Models for Reward Reasoning , year =","venue":null,"work_id":"73758b8f-8f6b-40a2-876a-8d2242efc99d","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:49.259871Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:8edc7263cd6de64966f61519593f8adc653c12d4ad1a2152511b5fdcf6a61060","observation_id":"2b9f8ed9-f566-4459-9c84-dc3dbcae46fc","resolution":{"observed_at":"2026-08-07T05:49:52.019979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:51.998856Z","title":"GRAM: A Generative Foundation Reward Model for Reward Generalization , year =","venue":null,"work_id":"80eb7dd4-8781-4eb4-b42e-eb0822e1f3aa","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:49.377175Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:a7cd26e40dabd0abe01df9c01036d51b9100104dd992d9c817b267c47258e070","observation_id":"fe4d15e3-bc62-408c-851f-2489c4f00019","resolution":{"observed_at":"2026-08-07T05:49:52.003423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:51.982656Z","title":"Inference-time scaling for generalist reward modeling , year =","venue":null,"work_id":"ad465875-5118-4dbd-a318-1109825f2871","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:49.520356Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:343b88042a5d403ecc9c49f3499e80d6951c22bf8a5eb003848b07a3f9f6a48f","observation_id":"fc0e704b-c1bf-4185-b0f1-5273ea7b7dab","resolution":{"observed_at":"2026-08-07T05:49:51.988506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:51.967348Z","title":"Reward Model Ensembles Help Mitigate Overoptimization , year =","venue":null,"work_id":"8efad0e9-ae16-4e49-ac02-03096bd40d93","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:49.726109Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:b5ee0db28bcbb6699fadf422b1afa86d5b2536be517a8806e1f3a6020458c55c","observation_id":"5a571064-f449-4e59-bd29-3d741065ed9a","resolution":{"observed_at":"2026-08-07T05:49:51.971964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:51.952000Z","title":"Skywork-Reward-V2: Scaling Preference Data Curation via Human-AI Synergy , year =","venue":null,"work_id":"da72f8e7-251f-41e4-b594-8ee509a57071","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:49.855495Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:5b64937d9b271108aad2cc865f6075284792d001280841bce121b3de30eef5d6","observation_id":"8b55f41c-0c8f-4224-a776-77118909d455","resolution":{"observed_at":"2026-08-07T05:49:51.956432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:51.936765Z","title":"Rovrm: A robust visual reward model optimized via auxiliary textual preference data , year =","venue":null,"work_id":"63e20f82-0518-424d-84f0-7678561d93c2","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:49.961442Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:65901c3f8e53559e42e15e73241effb5c066ea164872f8b383b2cd8548350e39","observation_id":"0c1242af-9be7-489e-b125-e1785b84d53a","resolution":{"observed_at":"2026-08-07T05:49:51.942367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:51.921244Z","title":"Specialist or Generalist? Instruction Tuning for Specific","venue":null,"work_id":"9709e93c-1965-494f-884e-ff56b040970b","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:50.136217Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:4586a57cacd69bacdcdf148dbf8f12193d7dcbae55cab5f5c9980d727b4baa44","observation_id":"b1d32292-7cd2-4a90-bbde-433e37e585c5","resolution":{"observed_at":"2026-08-07T05:49:51.926107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:51.903399Z","title":"Unveiling the Generalization Power of Fine-Tuned Large Language Models , year =","venue":null,"work_id":"e64cde03-0d93-4bd2-afcf-cf2ad4a7fa8f","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:50.196702Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:c4740010dc9c37bced0c0cf4eb15f562dd3e66726f6ca693a7bd03d78fa8465b","observation_id":"ea9c6137-14cb-4ddb-8dad-99dcf3f0622d","resolution":{"observed_at":"2026-08-07T05:49:51.911106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:50.258977Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:50.258977Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:f63f79a881ca47b10f3c59fe715ac13f95229a3160bff352dac4d1602e9919f8","observation_id":"aef914da-2aac-4694-baa9-bfca318d3932","resolution":{"observed_at":"2026-08-07T05:49:50.258977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:50.354120Z","title":"Chi and Quoc V","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:50.354120Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:f8d8ab5dec317e1174d08c7dbc36532ce20e22d3e318b59bd65de0e64fb28674","observation_id":"823d99c6-f758-4b11-a3bd-c88f0f608d21","resolution":{"observed_at":"2026-08-07T05:49:50.354120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:51.868164Z","title":"Scaling instruction-finetuned language models , year =","venue":null,"work_id":"aaefb4cb-b79b-4bf5-a87a-2beb0dd71474","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:50.450939Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:fb817ff8b0b3c6b3816058504994cd97a7df2f34e35edb827d22d3716b4abece","observation_id":"bf973903-1f16-46b4-ac31-9a8109a64c7e","resolution":{"observed_at":"2026-08-07T05:49:51.873938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:51.852228Z","title":"ArXiv preprint , title =","venue":null,"work_id":"61e795e5-a0f9-4b8d-9f1a-5b9f49b78895","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:50.550071Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:f33b8f548c718f69e22c5b035e3aa1421dd695b11af72fa8335b8b3f6168311b","observation_id":"22f12c7c-1afd-4d0a-bd3a-4081930d89c9","resolution":{"observed_at":"2026-08-07T05:49:51.856887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:51.836193Z","title":"Generative verifiers: Reward modeling as next-token prediction , year =","venue":null,"work_id":"6797ccee-63de-4b85-88da-b174a917dc21","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:50.632006Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:c842c02f5895d90ed69a1a0f358fa46bde3c1796312fa6ed06a26bee2f34c4b9","observation_id":"bc442f6e-970a-4c0d-ac49-e85517058b0d","resolution":{"observed_at":"2026-08-07T05:49:51.841712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:51.820787Z","title":"Foundations of large language models , year =","venue":null,"work_id":"4bea75e5-a383-438e-809b-07ddf4347ad0","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:50.787906Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:0e48822c625b08e29a8cd029e363d0db850ffa9cb49cff73f2c18cf9de78803e","observation_id":"9680b05a-c1c1-4367-81c7-ec56d5854582","resolution":{"observed_at":"2026-08-07T05:49:51.825586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:51.803905Z","title":"Step-level verifier-guided hybrid test-time scaling for large language models , year =","venue":null,"work_id":"795e7592-effc-41c7-8208-07b5c99470a1","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:50.928739Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:898840d2b68ffc8daeac1e9c4399b1d10e5f8fdd08c8364032634ef60804c457","observation_id":"d3e6dc32-ce32-44c9-ae07-f5a2d468a4ab","resolution":{"observed_at":"2026-08-07T05:49:51.808971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:51.785965Z","title":"s1: Simple test-time scaling , year =","venue":null,"work_id":"4c73efb0-313f-4514-8278-9d98b52980b1","year":2025},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:51.061742Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:d7f5b6dd9185a08b67ac68f44e9dfe1f87e7809fdb649eabbe6bb7bc9e71eec1","observation_id":"f1499bb0-3728-49e7-ba81-b386ef8fedb2","resolution":{"observed_at":"2026-08-07T05:49:51.791856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:51.767971Z","title":"Ziegler and Ryan Lowe and Chelsea Voss and Alec Radford and Dario Amodei and Paul F","venue":null,"work_id":"48541a7e-66aa-4ecb-a887-a3e026cc6b3a","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:51.131325Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:bb5b95f88f42a46d48694e758fc749bf184d17481f5ca664e032fb2564a8d38f","observation_id":"6962bda8-8b9a-482d-885d-ab4b684d4b79","resolution":{"observed_at":"2026-08-07T05:49:51.773679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:51.752414Z","title":"Christiano and Jan Leike and Tom B","venue":null,"work_id":"c4b98f4b-dc95-4c1f-b7fe-0000d7a2bb84","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:51.254831Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:73abf57b2182eb08f35c0eeeaaef6bcad3834be4fdeebfd52044c228d5cb46a9","observation_id":"2e27ccf8-bc49-44e0-8a17-e6ad72a664fb","resolution":{"observed_at":"2026-08-07T05:49:51.757551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:51.735022Z","title":"Pku-saferlhf: Towards multi-level safety alignment for llms with human preference , year =","venue":null,"work_id":"70af9fbd-25d9-47c3-9125-2e5fbd8ed1b6","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:51.270033Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:3481b5e475c49e13c123eedb2eb31029add431d64907a9e4489e6abf73c2439b","observation_id":"8475e862-f0f7-479e-9626-806ee73707bc","resolution":{"observed_at":"2026-08-07T05:49:51.739933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:51.396419Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:51.396419Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:f353746fa57fb2000fbfab15468ea51f451dccae5250218d89ac581cfe7f4932","observation_id":"c4d27562-bd7a-497e-9384-c35c7d3df281","resolution":{"observed_at":"2026-08-07T05:49:51.396419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:51.709684Z","title":"Hybrid alignment training for large language models , year =","venue":null,"work_id":"a133ff06-a7c1-4623-acb7-9fd36218e7c3","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:51.461846Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:52ae17b27977c116193d6afda4ca93f5278a8932f59a2e07716054c51f2a067d","observation_id":"6a7abe3c-2669-44aa-a261-06f63631e3f5","resolution":{"observed_at":"2026-08-07T05:49:51.714830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:51.691787Z","title":null,"venue":null,"work_id":"a76925c8-dff5-4203-b5df-ec482b14e0d8","year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:51.540240Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:909be107f61a57a5d50a03e91425d298b90f3abf6cf88d33777e566ce53e8f23","observation_id":"42a3a541-e686-4a72-8b1d-e169d7cf4070","resolution":{"observed_at":"2026-08-07T05:49:51.698270Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:51.589012Z","title":"Scaling Learning Algorithms Towards","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:51.589012Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:603f5221d66987783c5344cdce8d6cc4256e575f2bc9937a310f32674feb5f20","observation_id":"4fe81ff3-0c90-4e39-99a0-995292c5cf9f","resolution":{"observed_at":"2026-08-07T05:49:51.589012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:51.593444Z","title":"and Osindero, Simon and Teh, Yee Whye , journal =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:51.593444Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:6716bc91799bf7ed228c0950854dc7625cf763e2c66712508b92972669867834","observation_id":"85bf7a5a-2af4-417c-ad49-306fdf7e79fd","resolution":{"observed_at":"2026-08-07T05:49:51.593444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:51.597998Z","title":"2016 , publisher=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:51.597998Z"},"links":{"citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:cfb501059f3c26e92f5a323302eb38d2f09dff21095942d6da7f8a3c550567f8","observation_id":"88a5e574-b9ad-4d50-83de-e772ac4b4c88","resolution":{"observed_at":"2026-08-07T05:49:51.597998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T23:13:15.850802Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction"},"reference_resolution":{"displayed":77,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":0,"verified_fuzzy":62},"total_outbound_references":77},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 77 of 77 outbound references and 0 inbound Pith citation observations for arXiv:2608.06310."}