{"as_of":"2026-08-12T10:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1b62591fedb687e2b65ba3630f84be5e4dbd42a0697d2d9e6ad8f072745dfd3b","coverage":[{"denominator":87,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":87,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:34:53.874909Z","state":"measured"},{"denominator":102,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":102,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":15,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:15:37.528799Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T06:49:38.201535Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14674","snapshot_observed_at":"2026-08-07T12:15:37.528799Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00178","last_updated":"2025-07-22T18:01:11Z","snapshot_observed_at":"2026-08-07T23:16:23.624156Z","submitted_at":"2025-05-30T19:33:41Z","title":"Tournament of Prompts: Evolving LLM Instructions Through Structured Debates and Elo Ratings","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:15:37.528799Z"},"links":{"cited_paper":"/paper/2505.14674","citing_paper":"/paper/2506.00178"},"observation_digest":"sha256:8aadb90c172964d3afbd6efc41e6adab7bc55232ab954689b3972c086f5f57ee","observation_id":"aab485b9-07c5-43db-a0cd-505f144055de","resolution":{"observed_at":"2026-08-07T12:15:37.528799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"cited_work":{"arxiv_id":"2505.14674","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14674","snapshot_observed_at":"2026-07-04T06:49:38.201535Z","title":"arXiv preprint arXiv:2505.14674 , year=","venue":null,"work_id":"6329708f-a68b-495d-8809-ef6742c84f90","year":2025},"citing_paper":{"arxiv_id":"2507.17746","last_updated":"2025-10-03T01:55:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-23T17:57:55Z","title":"Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-13T06:07:56.678339Z"},"links":{"cited_paper":"/paper/2505.14674","citing_paper":"/paper/2507.17746"},"observation_digest":"sha256:21198461ed162181c6e5a23d816080ef9316261e6faf1286b5ae601bbf97beb4","observation_id":"04ec0a88-7b73-41a4-92c7-b46d6cf7ab9b","resolution":{"observed_at":"2026-05-13T06:07:56.760173Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14674","snapshot_observed_at":"2026-08-06T14:51:26.527647Z","title":"Hassid, M., Synnaeve, G., Adi, Y ., and Schwartz, R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17797","last_updated":"2025-07-23T15:22:51Z","snapshot_observed_at":"2026-08-10T02:41:58.892312Z","submitted_at":"2025-07-23T15:22:51Z","title":"GenSelect: A Generative Approach to Best-of-N","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:26.527647Z"},"links":{"cited_paper":"/paper/2505.14674","citing_paper":"/paper/2507.17797"},"observation_digest":"sha256:724c29bd9532efcd39e4ea9cdde7347adbf9ab7ad763ab0cb4dea5a2d74cd9e7","observation_id":"a2818eef-f5ce-4311-b868-782e9556d367","resolution":{"observed_at":"2026-08-06T14:51:26.527647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"cited_work":{"arxiv_id":"2505.14674","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14674","snapshot_observed_at":"2026-07-04T06:49:38.201535Z","title":"arXiv preprint arXiv:2505.14674 , year=","venue":null,"work_id":"6329708f-a68b-495d-8809-ef6742c84f90","year":2025},"citing_paper":{"arxiv_id":"2508.03556","last_updated":"2026-06-01T05:14:12Z","snapshot_observed_at":"2026-08-06T04:27:04.622929Z","submitted_at":"2025-08-05T15:25:24Z","title":"VRPRM: Process Reward Modeling via Visual Reasoning","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-22T12:20:17.430881Z"},"links":{"cited_paper":"/paper/2505.14674","citing_paper":"/paper/2508.03556"},"observation_digest":"sha256:2c60b231bc0442ae51f6e70ae7f0ffa8fcf747c068daac55f70ac36416759e80","observation_id":"cf18a61e-8d83-4445-8171-7d29f8bc4780","resolution":{"observed_at":"2026-05-22T12:21:30.995972Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14674","snapshot_observed_at":"2026-08-06T04:27:05.207869Z","title":"arXiv preprint arXiv:2505.14674","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03556","last_updated":"2026-06-01T05:14:12Z","snapshot_observed_at":"2026-08-06T04:27:04.622929Z","submitted_at":"2025-08-05T15:25:24Z","title":"VRPRM: Process Reward Modeling via Visual Reasoning","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T04:27:05.207869Z"},"links":{"cited_paper":"/paper/2505.14674","citing_paper":"/paper/2508.03556"},"observation_digest":"sha256:ced6e43e563508500bd6efe9f2650cf70f8082cb14a9704276d1013537609861","observation_id":"a5c71336-4ebc-41fc-83b2-a6491ddc19d0","resolution":{"observed_at":"2026-08-06T04:27:05.207869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"cited_work":{"arxiv_id":"2505.14674","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14674","snapshot_observed_at":"2026-07-04T06:49:38.201535Z","title":"arXiv preprint arXiv:2505.14674 , year=","venue":null,"work_id":"6329708f-a68b-495d-8809-ef6742c84f90","year":2025},"citing_paper":{"arxiv_id":"2509.00084","last_updated":"2026-04-27T15:34:36Z","snapshot_observed_at":"2026-08-11T14:24:53.285716Z","submitted_at":"2025-08-27T06:51:48Z","title":"Learning to Refine: Self-Refinement of Parallel Reasoning in LLMs","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-18T21:16:15.703057Z"},"links":{"cited_paper":"/paper/2505.14674","citing_paper":"/paper/2509.00084"},"observation_digest":"sha256:b38b8a109b8bed4e1757db797c12d45c469b0b093e9cfe1d3930a9bd8b02b669","observation_id":"25a4676c-98de-4856-8bc4-f4660d2fd46d","resolution":{"observed_at":"2026-05-18T21:16:50.971419Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"cited_work":{"arxiv_id":"2505.14674","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14674","snapshot_observed_at":"2026-07-04T06:49:38.201535Z","title":"arXiv preprint arXiv:2505.14674 , year=","venue":null,"work_id":"6329708f-a68b-495d-8809-ef6742c84f90","year":2025},"citing_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-08-06T15:38:05.011922Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"reference_index":173,"source":"arxiv_source","source_observed_at":"2026-05-18T00:02:24.352947Z"},"links":{"cited_paper":"/paper/2505.14674","citing_paper":"/paper/2509.08827"},"observation_digest":"sha256:2cabe9df3999ba60a1a0c6c8b19261a4c7bdf0b650d94e7c2f5e75c94010ac6b","observation_id":"589bb886-b043-4291-8a39-8c5ed8c35d8c","resolution":{"observed_at":"2026-05-18T00:05:31.631151Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14674","snapshot_observed_at":"2026-08-04T16:07:29.589806Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-04T16:07:24.699834Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:29.589806Z"},"links":{"cited_paper":"/paper/2505.14674","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:35765da50d8faa218aa94fbd537332b08ea7656500806a17227149f2872f9a54","observation_id":"c3900aa1-9feb-460d-9ceb-9b19a2dc5c8d","resolution":{"observed_at":"2026-08-04T16:07:29.589806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"cited_work":{"arxiv_id":"2505.14674","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14674","snapshot_observed_at":"2026-07-04T06:49:38.201535Z","title":"arXiv preprint arXiv:2505.14674 , year=","venue":null,"work_id":"6329708f-a68b-495d-8809-ef6742c84f90","year":2025},"citing_paper":{"arxiv_id":"2510.24235","last_updated":"2026-04-20T06:29:42Z","snapshot_observed_at":"2026-08-11T05:20:44.938077Z","submitted_at":"2025-10-28T09:43:47Z","title":"PaTaRM: Bridging Pairwise and Pointwise Signals via Preference-Aware Task-Adaptive Reward Modeling","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-18T03:15:57.744706Z"},"links":{"cited_paper":"/paper/2505.14674","citing_paper":"/paper/2510.24235"},"observation_digest":"sha256:1e2ba099e69e520c0543aff2fe5fac99579a65d39fbb492584f2b4d8e3ff47c7","observation_id":"5ee2d70b-a2a2-46cf-ad4e-9e71f89c5c87","resolution":{"observed_at":"2026-05-18T03:20:49.334817Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14674","snapshot_observed_at":"2026-08-04T07:43:24.151892Z","title":"Reward reasoning model.arXiv preprint arXiv:2505.14674,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.24636","last_updated":"2026-07-01T11:59:43Z","snapshot_observed_at":"2026-08-07T23:16:25.258712Z","submitted_at":"2025-10-28T17:02:46Z","title":"OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T07:43:24.151892Z"},"links":{"cited_paper":"/paper/2505.14674","citing_paper":"/paper/2510.24636"},"observation_digest":"sha256:c5f409b1761b252e06726ec40839765fe20a8d814b89079b99a2514b4d4b65c1","observation_id":"c37af3d7-af75-4336-af67-24164bd603c7","resolution":{"observed_at":"2026-08-04T07:43:24.151892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14674","snapshot_observed_at":"2026-08-02T18:14:50.408504Z","title":"Reward reasoning model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14473","last_updated":"2026-07-15T10:22:14Z","snapshot_observed_at":"2026-08-10T15:49:13.116299Z","submitted_at":"2026-03-15T16:31:51Z","title":"AI Can Learn Scientific Taste","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T18:14:50.408504Z"},"links":{"cited_paper":"/paper/2505.14674","citing_paper":"/paper/2603.14473"},"observation_digest":"sha256:1be8facf50de7ce6fed13d283967410560220119d1af7ece70023026a79c0319","observation_id":"7a625218-dee7-4b6e-b395-3d97d857f5b3","resolution":{"observed_at":"2026-08-02T18:14:50.408504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"cited_work":{"arxiv_id":"2505.14674","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14674","snapshot_observed_at":"2026-07-04T06:49:38.201535Z","title":"arXiv preprint arXiv:2505.14674 , year=","venue":null,"work_id":"6329708f-a68b-495d-8809-ef6742c84f90","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-08-12T03:28:30.781632Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":155,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2505.14674","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:009b87d05d1cc808d241ea588f1904ea0e5ef9476f165a064d8471ae7a7dc27d","observation_id":"e63bc315-3599-4d2c-9fd4-993a8f2154b0","resolution":{"observed_at":"2026-07-01T20:56:13.571928Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"cited_work":{"arxiv_id":"2505.14674","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14674","snapshot_observed_at":"2026-07-04T06:49:38.201535Z","title":"arXiv preprint arXiv:2505.14674 , year=","venue":null,"work_id":"6329708f-a68b-495d-8809-ef6742c84f90","year":2025},"citing_paper":{"arxiv_id":"2606.08147","last_updated":"2026-06-06T12:56:08Z","snapshot_observed_at":"2026-08-07T03:25:50.518862Z","submitted_at":"2026-06-06T12:56:08Z","title":"Biological Reasoning-Informed Regression for Interpretable Regulatory DNA Activity Prediction","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T19:01:43.892354Z"},"links":{"cited_paper":"/paper/2505.14674","citing_paper":"/paper/2606.08147"},"observation_digest":"sha256:185c1cff14d6f89be68c6428aafa46677552050c72d5533b591cbbe982871625","observation_id":"ad125d65-8338-4ff8-b3a2-25cb045d814e","resolution":{"observed_at":"2026-07-02T22:17:26.268285Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"cited_work":{"arxiv_id":"2505.14674","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14674","snapshot_observed_at":"2026-07-04T06:49:38.201535Z","title":"arXiv preprint arXiv:2505.14674 , year=","venue":null,"work_id":"6329708f-a68b-495d-8809-ef6742c84f90","year":2025},"citing_paper":{"arxiv_id":"2606.21627","last_updated":"2026-06-19T17:30:56Z","snapshot_observed_at":"2026-08-11T09:26:15.451027Z","submitted_at":"2026-06-19T17:30:56Z","title":"Counsel: A Meta-Evaluation Dataset for Agentic Tasks","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-26T14:07:59.446478Z"},"links":{"cited_paper":"/paper/2505.14674","citing_paper":"/paper/2606.21627"},"observation_digest":"sha256:9a932031a4614300d4e3ef713ade1b288c13c8d656f398305fa534d4b5505a05","observation_id":"d329b7c8-0292-4432-947f-e065d7525ebf","resolution":{"observed_at":"2026-07-04T06:49:38.204971Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14674","snapshot_observed_at":"2026-08-01T18:24:04.760985Z","title":"Reward reasoning model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17317","last_updated":"2026-07-19T16:01:11Z","snapshot_observed_at":"2026-08-07T23:16:24.147023Z","submitted_at":"2026-07-19T16:01:11Z","title":"TAPAS: Throughput-adaptive Perception for Autonomous Systems","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T18:24:04.760985Z"},"links":{"cited_paper":"/paper/2505.14674","citing_paper":"/paper/2607.17317"},"observation_digest":"sha256:c7a40ddcfee2237d4b25dd872b330b645e69dfc0e3142650735929a9463c2442","observation_id":"12a1c266-d55d-436a-b877-aadc29b49771","resolution":{"observed_at":"2026-08-01T18:24:04.760985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.14674/citation-record","integrity":"/paper/2505.14674/integrity","json":"/paper/2505.14674/citation-record.json","paper":"/paper/2505.14674"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T15:34:50.218433Z","title":"GPT-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:50.218433Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:263616775a680a7f1673a974cd2051dfca7f5831a11b3c2607b567ef6d0797b7","observation_id":"2b5dc76e-1feb-4983-8214-fa8e19d1cf8a","resolution":{"observed_at":"2026-08-07T15:34:50.218433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17387","last_updated":"2025-02-24T18:14:01Z","snapshot_observed_at":"2026-08-07T23:15:28.158449Z","submitted_at":"2025-02-24T18:14:01Z","title":"Big-Math: A Large-Scale, High-Quality Math Dataset for Reinforcement Learning in Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17387","snapshot_observed_at":"2026-08-07T15:34:50.264050Z","title":"Big-math: A large-scale, high-quality math dataset for reinforcement learning in language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:50.264050Z"},"links":{"cited_paper":"/paper/2502.17387","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:8ffa9cc9ef89edf3b26a5e928332344ebec1ae5dffb2638580679ed417759bb1","observation_id":"ef46c4eb-d007-43dd-bcac-af4fe3fbe2f0","resolution":{"observed_at":"2026-08-07T15:34:50.264050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17195","last_updated":"2025-01-27T15:09:08Z","snapshot_observed_at":"2026-08-10T13:41:04.760064Z","submitted_at":"2025-01-27T15:09:08Z","title":"Atla Selene Mini: A General Purpose Evaluation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17195","snapshot_observed_at":"2026-08-07T15:34:50.298845Z","title":"Atla selene mini: A general purpose evaluation model.arXiv preprint arXiv:2501.17195, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:50.298845Z"},"links":{"cited_paper":"/paper/2501.17195","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:b877fd520b52ae6cb51e594c098b09c8e1eb1cdcee291c2c6ef45c641d17317b","observation_id":"10d6e181-a23c-4326-a1ea-b681e34819c8","resolution":{"observed_at":"2026-08-07T15:34:50.298845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:50.335857Z","title":"The claude 3 model family: Opus, sonnet, haiku.Claude-3 Model Card, 1:1, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:50.335857Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:95971af01cda1cdc343a0cbc61cdcb628caca3a161f91377658cab77dcb98609","observation_id":"324dd137-dbb8-4b26-ad1d-bfb5723149e7","resolution":{"observed_at":"2026-08-07T15:34:50.335857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.emnlp-main.1219","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":null,"work_id":"3ac70652-05d0-4445-8653-93d8ee6dca4d","year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:50.375780Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:572d55e8a10a8d67e8d4393ebcb2037822212fa33c82fc034131d26064ea8fad","observation_id":"abb5fcfe-f89d-4712-9a0a-c907f47bcfec","resolution":{"observed_at":"2026-08-07T15:34:54.013847Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-07T15:34:50.406624Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback.arXiv preprint arXiv:2204.05862, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:50.406624Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:498e2e29f724149b45cc9afb70eae34d9cf8f0b44e98a336f8dd283afc165465","observation_id":"47b45be1-fd2f-4c65-b61d-eb409a76aef7","resolution":{"observed_at":"2026-08-07T15:34:50.406624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-07T15:34:50.446245Z","title":"Constitutional ai: Harmlessness from ai feedback.arXiv preprint arXiv:2212.08073, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:50.446245Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:b6ae23d8a98f1773988c623dc1d6216aa8d362e7f727d5af998c2e62e371f450","observation_id":"f6cb77be-ec9f-4514-991a-2a89a49521dc","resolution":{"observed_at":"2026-08-07T15:34:50.446245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-07T15:34:50.491218Z","title":"Large language monkeys: Scaling inference compute with repeated sampling.arXiv preprint arXiv:2407.21787, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:50.491218Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:381fda8f96c3fae00f807f19dfb898166d31f586a53e1b58fd5c3114ba7c0fa8","observation_id":"c9e244ad-e186-419b-a6b6-3427b84bc06e","resolution":{"observed_at":"2026-08-07T15:34:50.491218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:50.535585Z","title":"Language models are few-shot learners.Advances in neural information processing systems, 33:1877–1901, 2020","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:50.535585Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:0eb610d95612ff2c5883186c5862ed8f35c356f7cad8fd2b563a3e4b2b54b336","observation_id":"7d2dc476-2b95-4d48-8f9e-b5fce7fb796a","resolution":{"observed_at":"2026-08-07T15:34:50.535585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:50.592474Z","title":"Sparks of artificial general intelligence: Early experiments with GPT-4, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:50.592474Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:d76bb285f3528494c10eb5af5e077d4245e7f4e443e10853f310326eba02f848","observation_id":"b2be30d7-3095-4200-b422-7a1795082215","resolution":{"observed_at":"2026-08-07T15:34:50.592474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16256","last_updated":"2024-10-21T17:56:51Z","snapshot_observed_at":"2026-08-12T06:17:21.169907Z","submitted_at":"2024-10-21T17:56:51Z","title":"CompassJudger-1: All-in-one Judge Model Helps Model Evaluation and Evolution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16256","snapshot_observed_at":"2026-08-07T15:34:50.638608Z","title":"Compassjudger-1: All-in-one judge model helps model evaluation and evolution.arXiv preprint arXiv:2410.16256, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:50.638608Z"},"links":{"cited_paper":"/paper/2410.16256","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:00788d55274846be8ce61f0fe16d7c0257dcc474585ac9e82ec8a2656822c4b0","observation_id":"f46c7d44-57de-479f-95fe-2c2c9e4dd482","resolution":{"observed_at":"2026-08-07T15:34:50.638608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:50.684754Z","title":"Judgelrm: Large reasoning models as a judge.arXiv preprint arXiv:2504.00050, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:50.684754Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:c3458f7d2baee9c62135d46107be8279409bc7bb36b5da8c749b74a0bab3b636","observation_id":"ecaf28c3-59e1-4e5f-9512-4f3d20541476","resolution":{"observed_at":"2026-08-07T15:34:50.684754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:50.725027Z","title":"Seal: Steerable reasoning calibration of large language models for free","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:50.725027Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:662eb60661dc0b412dedba4699594351888399512c0fae36dae3b4b755107c02","observation_id":"a6981fcf-1d7b-42ff-b33b-3da231f42faf","resolution":{"observed_at":"2026-08-07T15:34:50.725027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:50.777215Z","title":"Rm-r1: Reward modeling as reasoning.arXiv preprint arXiv:2505.02387, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:50.777215Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:6e31324c15ace8ab9b00fcf5bb7a19a438f20a1ca6c7a529df08aba6fb85ef30","observation_id":"89dbad2b-12a3-4097-97aa-2fe0d4550f18","resolution":{"observed_at":"2026-08-07T15:34:50.777215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:50.819870Z","title":"Christiano, Jan Leike, Tom B","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:50.819870Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:7635bfb2ebb0dc090db1e920b78b96f3b66fd5ec2b7ab41d9c14cb65de53ef4e","observation_id":"4325b17c-a6d6-41a3-89e8-0f630abe60e5","resolution":{"observed_at":"2026-08-07T15:34:50.819870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T15:34:50.852224Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168, 2021","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:50.852224Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:1013b65b8ca129139e101293174f4a9513424dcbbbaf70eb35780403e62e72a8","observation_id":"1c864530-7a15-455c-a7f2-e29d36148472","resolution":{"observed_at":"2026-08-07T15:34:50.852224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:50.904944Z","title":"Elo.The Rating of Chessplayers, Past and Present","venue":null,"work_id":null,"year":1978},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:50.904944Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:547ecff46daab9e8e6ecb249067880191a5b8c7e9ff17a3a7446d7762d71306a","observation_id":"99b94b53-9660-4767-8b08-eb18dde2642a","resolution":{"observed_at":"2026-08-07T15:34:50.904944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:50.948093Z","title":"Gonzalez, and Ion Stoica","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:50.948093Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:e4f7ff056a4bbbe331a66bd33a0391a537c4ee8ebec6a79a70a3c8e844503883","observation_id":"7e5287c2-99f5-44e1-9322-1a6eb4ea874c","resolution":{"observed_at":"2026-08-07T15:34:50.948093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15115","last_updated":"2024-11-27T11:58:50Z","snapshot_observed_at":"2026-08-10T16:59:31.408159Z","submitted_at":"2024-10-19T13:53:50Z","title":"On Designing Effective RL Reward at Training Time for LLM Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15115","snapshot_observed_at":"2026-08-07T15:34:50.993826Z","title":"On designing effective rl reward at training time for llm reasoning.arXiv preprint arXiv:2410.15115, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:50.993826Z"},"links":{"cited_paper":"/paper/2410.15115","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:531d9fdefa1ae5cd098b3c0c066675fdad1483813adbee1814f69eff97a4cce1","observation_id":"5f88e40d-533c-4b66-bd39-e43d86ce9f77","resolution":{"observed_at":"2026-08-07T15:34:50.993826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:51.045534Z","title":"Scaling laws for reward model overoptimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:51.045534Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:ef75cbca716ac346f912eac21f96755c6f036058ec777c1360f17c81aca2ef78","observation_id":"033762ca-1f77-4f47-a0ad-dbf9d7e01395","resolution":{"observed_at":"2026-08-07T15:34:51.045534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-02T10:23:50.881300Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15594","snapshot_observed_at":"2026-08-07T15:34:51.098716Z","title":"A survey on llm-as-a-judge.arXiv preprint arXiv:2411.15594, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:51.098716Z"},"links":{"cited_paper":"/paper/2411.15594","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:6334f14a628407662bfe096b45da1a106de9f08ab8dae90dc27405cbdc01f96c","observation_id":"ca1e8f79-71e1-4408-afda-e93bfc3593fb","resolution":{"observed_at":"2026-08-07T15:34:51.098716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T15:34:51.142179Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:51.142179Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:d3ca1407a2e1c6e445d17783fd7bf7d89e05d633cf497bef1d2c73f84722a3d5","observation_id":"9251b517-e7ab-4e26-8341-e109762f8faf","resolution":{"observed_at":"2026-08-07T15:34:51.142179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:51.178507Z","title":"Mcranker: Generating diverse criteria on-the-fly to improve pointwise llm rankers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:51.178507Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:de247fdf2a5cf4e848d2542612fb7d72fa148c3d4029f558fdcd49b0cd1ea14c","observation_id":"f8aff6e2-39e4-47fe-9c9e-541080cb20fd","resolution":{"observed_at":"2026-08-07T15:34:51.178507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:51.224822Z","title":"Skywork open reasoner series","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:51.224822Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:b0355bff38d7b4e54470a457e5ba39607708c9f1148013057acc2dbb9451a16e","observation_id":"8b2953dc-7c4b-4ecd-a612-2d49d768aa75","resolution":{"observed_at":"2026-08-07T15:34:51.224822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:55.954276Z","title":"Measuring mathematical problem solving with the MATH dataset","venue":null,"work_id":"34aad050-b87a-4f47-9d51-9090acba04cb","year":2021},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:51.259139Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:726a5aacc585043fc1da10feb193795d0ade0fb8e6e810b2c49b28fedcd292ac","observation_id":"e6099a2b-3bf3-4ae4-aec6-0aec91939039","resolution":{"observed_at":"2026-08-07T15:34:55.958482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T15:34:51.300610Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:51.300610Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:52eb3a551afe32c22b8609790b8310bb832499115e0b4f836845a285fd7bf55c","observation_id":"f12a8b94-3cf5-4ae0-851e-f9a5556d8a5d","resolution":{"observed_at":"2026-08-07T15:34:51.300610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T15:34:51.337869Z","title":"Openai o1 system card.arXiv preprint arXiv:2412.16720, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:51.337869Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:7d845b32ff07919380d28093b5016b3a5097bf3f98a60541ae77533973872b6d","observation_id":"31bd0b84-c20e-4a88-b147-8b2dd8f52a19","resolution":{"observed_at":"2026-08-07T15:34:51.337869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:51.370094Z","title":"LLM-blender: Ensembling large language models with pairwise ranking and generative fusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:51.370094Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:547f551b00d8b8d2a6cd97417c4dd10d44ee1a4ee8ac24a7f633a9f983f68693","observation_id":"536d8b20-32fd-46c3-a843-3794f23bc031","resolution":{"observed_at":"2026-08-07T15:34:51.370094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:51.410454Z","title":"SWE-bench: Can language models resolve real-world github issues? InThe Twelfth International Conference on Learning Representations, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:51.410454Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:f9d06c91264af580d145fb314c29fa00d7ccd0fa5b094fb79c442f0299ee971a","observation_id":"cd8e1793-3b22-41ac-acd8-1db43cb79403","resolution":{"observed_at":"2026-08-07T15:34:51.410454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-07T15:34:51.450665Z","title":"Scaling laws for neural language models.arXiv preprint arXiv:2001.08361, 2020","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:51.450665Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:27ebc8cf297ab1d92a17f9804f0b9af24b88232166277f89cb154fa28c94be30","observation_id":"825d3a07-6a2b-4c64-aec2-07b755b4daa0","resolution":{"observed_at":"2026-08-07T15:34:51.450665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:51.493581Z","title":"Maple: Multi-modal prompt learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:51.493581Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:c69567a8ab36592f5ccb853336eacd639023e426ba65c8fae4fe2b4822f30524","observation_id":"8afb08ed-a533-41f1-a60d-44f323f602d8","resolution":{"observed_at":"2026-08-07T15:34:51.493581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:51.527785Z","title":"Prometheus 2: An open source language model specialized in evaluating other language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:51.527785Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:3293fc4ecfaa685278b5d85c492cd5dbb0e956ae8accb859bcdac8ee32491ccf","observation_id":"95386e55-d1bd-4352-9799-9053ebb635a1","resolution":{"observed_at":"2026-08-07T15:34:51.527785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-10T16:05:13.426341Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-07T15:34:51.610704Z","title":"T\\\" ulu 3: Pushing frontiers in open language model post-training.arXiv preprint arXiv:2411.15124, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:51.610704Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:c85465002512a77ba4c557d069b8319f5608083c6c3bbeb6113663c5832cb2ef","observation_id":"ce635670-f63c-447b-afd0-6a86ceaab1fe","resolution":{"observed_at":"2026-08-07T15:34:51.610704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-07T15:34:51.641108Z","title":"Rewardbench: Evaluating reward models for language modeling.arXiv preprint arXiv:2403.13787, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:51.641108Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:40de1a17fff4395ef3ff7ba015e4c40606d97c1d5c991ae26f703e21f4939b95","observation_id":"1ce3f9a5-3861-4ee6-b727-1c15d0e0512d","resolution":{"observed_at":"2026-08-07T15:34:51.641108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:55.932515Z","title":"Generative judge for evaluating alignment","venue":null,"work_id":"7b7b8dde-8658-4ad7-9fd6-af21bdb83207","year":null},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:51.675833Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:c0f225edec6e3b0f2dc5cd7c1aeafa8830c7ca0f0ef63be5ca96bbc90863f3ca","observation_id":"d59bc306-acfb-42b5-9cef-d49b096d8c08","resolution":{"observed_at":"2026-08-07T15:34:55.936539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-11T09:34:38.920981Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-07T15:34:51.745476Z","title":"Gonzalez, and Ion Stoica","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:51.745476Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:a6790c5f1a936d64f600fd68a5c774b047fb6fb3eb1c393a46ad939ade6b37fb","observation_id":"97e93a02-a458-4cf8-bb3d-1fa1e9b98994","resolution":{"observed_at":"2026-08-07T15:34:51.745476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:55.922124Z","title":null,"venue":null,"work_id":"9e86a22e-07da-47a0-a435-8a5e96a6b5b6","year":null},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:51.708821Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:8380ba417ae819e715b7025793def674dc99d636edc105c4f17c7c8b989f4a33","observation_id":"d0dc8f84-b9f5-42c8-8c22-50f1fcd63e53","resolution":{"observed_at":"2026-08-07T15:34:55.926236Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:51.842603Z","title":"Rouge: A package for automatic evaluation of summaries","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:51.842603Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:199c39f15ba853229c2e85cbc1fe3bff54a85148c4b25281aa4c6d1fafbedca3","observation_id":"17a41f16-cc95-4c35-847c-587a961c0c0d","resolution":{"observed_at":"2026-08-07T15:34:51.842603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:51.791581Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:51.791581Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:54ade4db06729fd0431909835df71eec501ae1d5ca30c5ed4e33b779bb7486b9","observation_id":"6ef38318-1a13-4659-b948-b3841db37b33","resolution":{"observed_at":"2026-08-07T15:34:51.791581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13007","last_updated":"2025-02-19T13:35:48Z","snapshot_observed_at":"2026-08-10T18:33:35.580132Z","submitted_at":"2025-01-22T16:49:37Z","title":"PairJudge RM: Perform Best-of-N Sampling with Knockout Tournament","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13007","snapshot_observed_at":"2026-08-07T15:34:51.960784Z","title":"Pairwise rm: Perform best-of-n sampling with knockout tournament.arXiv preprint arXiv:2501.13007, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:51.960784Z"},"links":{"cited_paper":"/paper/2501.13007","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:662f6bf22ddad2aacf3615430c2a2826f892e70346f76dcc51eec8201c097c56","observation_id":"10f0424d-d52f-4e3b-bd01-22350bb450f2","resolution":{"observed_at":"2026-08-07T15:34:51.960784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18451","last_updated":"2024-10-24T06:06:26Z","snapshot_observed_at":"2026-08-07T05:53:12.643515Z","submitted_at":"2024-10-24T06:06:26Z","title":"Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18451","snapshot_observed_at":"2026-08-07T15:34:51.910884Z","title":"Skywork-reward: Bag of tricks for reward modeling in llms.arXiv preprint arXiv:2410.18451, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:51.910884Z"},"links":{"cited_paper":"/paper/2410.18451","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:afc7ab1d532e0a253bea09dd6755b43e1f1da8dd80b5c43f45347590295ab57f","observation_id":"1944545c-20ca-4cd3-a1b0-57e105fd9972","resolution":{"observed_at":"2026-08-07T15:34:51.910884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:55.899341Z","title":"General-reasoner: Advancing llm reasoning across all domains","venue":null,"work_id":"6a055450-5709-41e2-97cd-512c188a6b21","year":2025},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.052327Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:bd1173d18b697cf0a0b34d411017bdc6ca9f5d0f6ebf9586a3dd77e44039b5a0","observation_id":"0f772cdb-2858-463c-9082-4001e982e021","resolution":{"observed_at":"2026-08-07T15:34:55.902751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:51.997784Z","title":"Inference-time scaling for generalist reward modeling.arXiv preprint arXiv:2504.02495, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:51.997784Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:133b30ef8e71129901e4c1eabee0177b215e34f091fb76c7e0b6db25a07a35b0","observation_id":"fbbf5d0d-d666-4fea-beba-18ae91c32152","resolution":{"observed_at":"2026-08-07T15:34:51.997784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:55.887173Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"5635e6ea-38e0-46d0-a1a2-132bb5ac6455","year":2022},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.134440Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:b3102c18d4fb853a4ca76f0df897c788ad80131b33a8fd07c619949e3bed41c5","observation_id":"ca842ffc-23a6-46a5-a14a-e0cee2affeb2","resolution":{"observed_at":"2026-08-07T15:34:55.891726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12832","last_updated":"2024-10-02T17:58:39Z","snapshot_observed_at":"2026-08-03T10:06:52.418096Z","submitted_at":"2024-10-02T17:58:39Z","title":"Generative Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12832","snapshot_observed_at":"2026-08-07T15:34:52.079730Z","title":"Generative reward models.arXiv preprint arXiv:2410.12832, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.079730Z"},"links":{"cited_paper":"/paper/2410.12832","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:676e4ad8af0f2de6b74f39aa424faad5759ed3a5496a08be966225de2cfef8e7","observation_id":"04e333ca-9936-4e0a-b645-56707c172df2","resolution":{"observed_at":"2026-08-07T15:34:52.079730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:52.199462Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.199462Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:3d2cb4191f086e2a2e75b8f0c1b3701352f953b69a7661c0fff70f95d3c130b3","observation_id":"e156917e-cdb5-489a-9e9f-32173197839d","resolution":{"observed_at":"2026-08-07T15:34:52.199462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:52.171617Z","title":"Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.171617Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:ec4199b80905c71ca63f5ace440ba0847828e2a1aa8ce95d1454d79d464acb95","observation_id":"2e9deba9-8e08-489e-9407-3eeaba038f60","resolution":{"observed_at":"2026-08-07T15:34:52.171617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T15:34:52.271529Z","title":"Qwen2.5 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.271529Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:72d04b3870545ea5257ab5fd70ba9966fe677ca22f2ee356f794bee74dc8f6b8","observation_id":"d40c1b1c-1b3f-4874-8d8c-5e9cad63712b","resolution":{"observed_at":"2026-08-07T15:34:52.271529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:52.231093Z","title":"OffsetBias: Leveraging debiased data for tuning evaluators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.231093Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:0a6010c30169498a9ad17a2f923953af3ba3917beb434a69564bfc3c6f44f29f","observation_id":"7f077f48-f53e-4671-8c10-968b40c4aba1","resolution":{"observed_at":"2026-08-07T15:34:52.231093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:55.862659Z","title":"Bradley Knox, Chelsea Finn, and Scott Niekum","venue":null,"work_id":"979072f5-3275-4f30-ad6e-e8c8f801c236","year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.342892Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:859d39622af3e6c975b63cff05e457828302723e0bb6bfb56add6f25f6fbf492","observation_id":"6d207513-7fda-4cb8-bf09-5dedac3090c0","resolution":{"observed_at":"2026-08-07T15:34:55.866191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:52.301877Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.301877Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:3cb12a9eee4f7e240881c8e25ff02d33303f4e58a8deccf80109feb2a2e85923","observation_id":"93b2115a-a6af-4994-afc3-20a88c48f4dd","resolution":{"observed_at":"2026-08-07T15:34:52.301877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T15:34:52.426178Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.426178Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:ab6e40edbd6671cc645946f37c1e9e85c3e7456a81555a70357398a189d752e6","observation_id":"1b28ebea-f75d-48d4-8953-78e11cbea415","resolution":{"observed_at":"2026-08-07T15:34:52.426178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:55.852642Z","title":"The limits of automatic summarisation according to rouge","venue":null,"work_id":"f0ab21c9-1301-4347-ad15-c451ed1844a7","year":2017},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.383058Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:9f3f48e83eb529cf989b9b9d4085da757cd9c9a68d9198bc267d6afa85881569","observation_id":"a5b06b04-de8e-479d-85e1-a53711d9db2d","resolution":{"observed_at":"2026-08-07T15:34:55.856216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:52.496371Z","title":"Skywork critic model se- ries","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.496371Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:85e3266c54c50d123d81935c5bf44ffa67c9e6aa9360ad42b7fa56a59bfbde6a","observation_id":"a9d9763e-c9e5-4662-920b-503fffe91314","resolution":{"observed_at":"2026-08-07T15:34:52.496371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-07T15:34:52.464502Z","title":"HybridFlow: A flexible and efficient RLHF framework","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.464502Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:d8208d900dad4cdce13d7004b46a3f4763c04141c1fab757c5d341b7b57cb866","observation_id":"c60e5510-ccfa-4c84-8520-879502e2d277","resolution":{"observed_at":"2026-08-07T15:34:52.464502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T15:34:52.573985Z","title":"Llama: Open and efficient foundation language models.arXiv preprint arXiv:2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.573985Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:69e823aba1f6498f4509fee804720d1e8aaf083bf4a743d1185cbc56adb0dca9","observation_id":"8540d3f5-3be1-4a25-9b67-af2314e4b64a","resolution":{"observed_at":"2026-08-07T15:34:52.573985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:52.538743Z","title":"Scaling LLM test- time compute optimally can be more effective than scaling parameters for reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.538743Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:ab4d0c81ebccf12ab40700170e260508934f7fa36af92ed66691944f6e090857","observation_id":"cfef8121-af75-407d-85ed-ec9b6453c90e","resolution":{"observed_at":"2026-08-07T15:34:52.538743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06080","last_updated":"2024-01-12T09:46:10Z","snapshot_observed_at":"2026-08-09T19:07:54.536460Z","submitted_at":"2024-01-11T17:56:59Z","title":"Secrets of RLHF in Large Language Models Part II: Reward Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06080","snapshot_observed_at":"2026-08-07T15:34:52.624148Z","title":"Secrets of rlhf in large language models part ii: Reward modeling.arXiv preprint arXiv:2401.06080, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.624148Z"},"links":{"cited_paper":"/paper/2401.06080","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:6ad3cf7bf66a9aeebea3d69b3e3a097f1280e71ba8f20ca2ff7bad6dae310734","observation_id":"a812a115-e4e8-4789-8eca-a48adb5d8948","resolution":{"observed_at":"2026-08-07T15:34:52.624148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:52.593804Z","title":"Foundational autoraters: Taming large language models for better automatic evaluation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.593804Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:1612a3d10376de0196f874924a129afb7a65d3abb2e9da22e45ec7fb5e4e8bf3","observation_id":"9e4f17b6-25e3-441e-a397-57d7508cd05e","resolution":{"observed_at":"2026-08-07T15:34:52.593804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:55.830825Z","title":"Pandalm: An automatic evaluation benchmark for llm instruction tuning optimization","venue":null,"work_id":"162dff6b-6dd4-42c7-8fa7-ef4b74da6d05","year":null},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.701742Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:32be778d990eae21d45fbb34c98896ee7edd3f7bdf5c5e666f9b2a2394871664","observation_id":"72abce9f-4137-4ad2-b582-5787a5b1cfe9","resolution":{"observed_at":"2026-08-07T15:34:55.834388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02666","last_updated":"2024-08-08T17:09:58Z","snapshot_observed_at":"2026-08-08T10:45:45.471332Z","submitted_at":"2024-08-05T17:57:02Z","title":"Self-Taught Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02666","snapshot_observed_at":"2026-08-07T15:34:52.667559Z","title":"Self-taught evaluators.arXiv preprint arXiv:2408.02666, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.667559Z"},"links":{"cited_paper":"/paper/2408.02666","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:e84eb601493a2df5bd1785f1d2794cfbdc83c0c1f8546b812471a9d06fcaf15d","observation_id":"d720deb4-efae-4f39-b636-0d2064001d37","resolution":{"observed_at":"2026-08-07T15:34:52.667559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09528","last_updated":"2023-11-16T03:13:29Z","snapshot_observed_at":"2026-08-10T01:44:07.896255Z","submitted_at":"2023-11-16T03:13:29Z","title":"HelpSteer: Multi-attribute Helpfulness Dataset for SteerLM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09528","snapshot_observed_at":"2026-08-07T15:34:52.819560Z","title":"Helpsteer: Multi-attribute helpfulness dataset for steerlm.arXiv preprint arXiv:2311.09528, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.819560Z"},"links":{"cited_paper":"/paper/2311.09528","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:3958ae041e8d2111583221bad475c2a28816be83cbf40e5f077e27cd6c7798d6","observation_id":"3b22891b-1cb1-4eb9-8f68-fa2c7b066dd8","resolution":{"observed_at":"2026-08-07T15:34:52.819560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:55.819810Z","title":null,"venue":null,"work_id":"45187b9d-aded-4857-8e3e-77e69e7b7856","year":null},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.737656Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:95e13018112d61776e855aeb87c787541b2db3afcfb5de4de35c3bafa7aacb01","observation_id":"341ee96e-1efe-4a1d-bfac-48453a6ff084","resolution":{"observed_at":"2026-08-07T15:34:55.823373Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:55.808896Z","title":"Reinforcement learning for reasoning in large language models with one training example","venue":null,"work_id":"db5e5f52-e94a-4a8a-9b20-090d070f8ce9","year":2025},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.773786Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:7374b64d169aca7a9142085a58673dc1acd0f24b713a7b8424a1cf5835446c7d","observation_id":"34bbcde9-445e-44e9-a73d-b4270e62c790","resolution":{"observed_at":"2026-08-07T15:34:55.813269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:52.940879Z","title":"J1: Incentivizing thinking in llm-as-a-judge via reinforcement learning.arXiv preprint arXiv:2505.10320, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.940879Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:ba165a2d59907b13f85ed7fa2f7476a5b39d19122b6374ec0f6a70224ba7f03a","observation_id":"ba7f0d83-0f17-420d-866d-a61a987a3d3a","resolution":{"observed_at":"2026-08-07T15:34:52.940879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:55.797802Z","title":"Zhang, Makesh Narsimhan Sreedhar, and Oleksii Kuchaiev","venue":null,"work_id":"03c3272c-d63b-43c3-b669-4e92c29d55d7","year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.862712Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:f5d1d43b709b4e8d230a83da126e1013e1c9d6f5239ed391a8a7aa86b32d96fe","observation_id":"514a7db1-078e-4cde-b405-c3bca95521a6","resolution":{"observed_at":"2026-08-07T15:34:55.802137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:52.909489Z","title":"Chi, Quoc V Le, and Denny Zhou","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.909489Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:15b132481c9974b30a53b5ce4d7330262029c3bb8aa15235979ff28ec1a9b5d7","observation_id":"a79a40e6-edfa-40cc-b0df-2f7e4ae87bf4","resolution":{"observed_at":"2026-08-07T15:34:52.909489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:53.021374Z","title":"Inference scaling laws: An empirical analysis of compute-optimal inference for LLM problem-solving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.021374Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:299a889a715847dcb843ee543d0b4645c7f45df8f54033a7595524d5b9752a50","observation_id":"6245467e-b388-4761-9d3c-06b0d0775aed","resolution":{"observed_at":"2026-08-07T15:34:53.021374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:55.775126Z","title":"Metametrics: Calibrating metrics for generation tasks using human preferences","venue":null,"work_id":"0689a3b9-6d93-475e-bf7b-1db5daa8b330","year":2025},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.996374Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:0170a69bf37ba67ed0e631287a973a6d6b99beb01fb0311843c780e84ebf223a","observation_id":"3914fb9b-10c8-4674-9571-b66f9dc9e801","resolution":{"observed_at":"2026-08-07T15:34:55.784727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19594","last_updated":"2024-07-30T01:38:06Z","snapshot_observed_at":"2026-08-12T07:37:43.905795Z","submitted_at":"2024-07-28T21:58:28Z","title":"Meta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a-Meta-Judge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.19594","snapshot_observed_at":"2026-08-07T15:34:53.003907Z","title":"Meta-rewarding language models: Self-improving alignment with llm-as-a-meta-judge.arXiv preprint arXiv:2407.19594, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.003907Z"},"links":{"cited_paper":"/paper/2407.19594","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:833358fef716f41af0a4b51586cacd27a26be238eab302e0bc1786a2556f8982","observation_id":"84ed587f-2345-4098-8b28-592c52a1dbb8","resolution":{"observed_at":"2026-08-07T15:34:53.003907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:55.752053Z","title":"Learning LLM-as-a-judge for preference alignment","venue":null,"work_id":"64a3cc67-61af-4276-a53a-eff393fa4b84","year":2025},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.201510Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:277865d534b475f61fb6987b014eb8206c2dd068f766dfcaab260705e218833e","observation_id":"ed3d3685-5069-4f6d-a549-19afa6aca6af","resolution":{"observed_at":"2026-08-07T15:34:55.759404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-07T15:34:53.085306Z","title":"Qwen2 technical report.arXiv preprint arXiv:2407.10671, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.085306Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:64b9758e4408c56b3cbd4d9519318d41689a8c59ee756e33ebccc73b9c84b046","observation_id":"24c0ae7f-4b60-4b0e-9cc0-07b08648a264","resolution":{"observed_at":"2026-08-07T15:34:53.085306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-07-06T19:17:41.512834Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-07T15:34:53.137028Z","title":"Qwen2.5-math technical report: Toward mathematical expert model via self-improvement.arXiv preprint arXiv:2409.12122, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.137028Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:5eb5a1f77ffba6fb95c581412f85cf5a3a7a31a1bf9c60a3bc6dea6986d462cd","observation_id":"85e6dfe3-c4c2-442f-bd24-53cb550d790f","resolution":{"observed_at":"2026-08-07T15:34:53.137028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:53.349374Z","title":"Self-rewarding language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.349374Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:6fe0be4e7e9efc6415866e9678ec3d6ca4173243725c6a5db33e2f17e8334daa","observation_id":"de494628-796f-48eb-8e34-1871d3509850","resolution":{"observed_at":"2026-08-07T15:34:53.349374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T15:34:53.259571Z","title":"Dapo: An open-source llm reinforcement learning system at scale, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.259571Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:df61fc7a09d1efe6f1c509331c1ecee15550810799c2813b9fab636cf862b37c","observation_id":"a6fdcaf4-4f08-469b-9515-792345129f24","resolution":{"observed_at":"2026-08-07T15:34:53.259571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:55.731135Z","title":"Self-generated critiques boost reward modeling for language models","venue":null,"work_id":"cd2e72f4-f8ae-495a-ab90-ee17974b8fd3","year":2025},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.306879Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:3a2dcb8f1fc6dceb9c90f982cc1b817ff6c7425efde05060e5cd9d06dd4cadcb","observation_id":"e64558c4-476e-4df2-888d-8be1b6db038b","resolution":{"observed_at":"2026-08-07T15:34:55.740256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:53.509079Z","title":"Gonzalez, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.509079Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:3afe5747487cb5a3b80fd9b79ac01ddc39a73dc1c8489949453e63d3b9c2d644","observation_id":"3868ed14-945a-4658-936a-d99a0c28f3ae","resolution":{"observed_at":"2026-08-07T15:34:53.509079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:55.706991Z","title":"Generative verifiers: Reward modeling as next-token prediction","venue":null,"work_id":"1fa3ddf2-4e76-4406-a6a1-df7c7114be01","year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.404561Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:93c8895949435c89bb3a092af5afac25cec89462f13471c2fe49b454b486390a","observation_id":"bf5a87e0-1d19-497d-8395-e141e26afb38","resolution":{"observed_at":"2026-08-07T15:34:55.714358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07301","last_updated":"2025-06-05T16:34:24Z","snapshot_observed_at":"2026-08-03T11:11:25.359494Z","submitted_at":"2025-01-13T13:10:16Z","title":"The Lessons of Developing Process Reward Models in Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07301","snapshot_observed_at":"2026-08-07T15:34:53.466706Z","title":"The lessons of developing process reward models in mathematical reasoning.arXiv preprint arXiv:2501.07301, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.466706Z"},"links":{"cited_paper":"/paper/2501.07301","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:4e27cf33904f026d6d3f4f2af860c45df344d8564c55ce40054419814d79294f","observation_id":"a5b784e3-5bd9-4f6e-949f-953ce030b548","resolution":{"observed_at":"2026-08-07T15:34:53.466706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:55.675943Z","title":"JudgeLM: Fine-tuned large language mod- els are scalable judges","venue":null,"work_id":"9248a066-e519-42ca-83a4-c065fafc7154","year":null},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.658787Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:0887869de67210d82182cca0feb2cdffc0957caaf18cece2ed5f75fa957b69dc","observation_id":"09dd05a2-446f-4202-8241-8fb9c98a7b3c","resolution":{"observed_at":"2026-08-07T15:34:55.686012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:53.545855Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena.Advances in Neural Information Processing Systems, 36:46595–46623, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.545855Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:003cfaf5f1951e77110fb54ed6e10ff3b83aff90fdac3e4f185f1f96d3bb2186","observation_id":"9df9a508-d550-4afe-bdfb-f965df1da3ef","resolution":{"observed_at":"2026-08-07T15:34:53.545855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12328","last_updated":"2025-04-12T16:07:36Z","snapshot_observed_at":"2026-08-07T16:06:17.033571Z","submitted_at":"2025-04-12T16:07:36Z","title":"A Comprehensive Survey of Reward Models: Taxonomy, Applications, Challenges, and Future","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12328","snapshot_observed_at":"2026-08-07T15:34:53.601769Z","title":"A comprehensive survey of reward models: Taxonomy, applications, challenges, and future.arXiv preprint arXiv:2504.12328, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.601769Z"},"links":{"cited_paper":"/paper/2504.12328","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:ecb8f2604d37cffe3778b2a5d880c39ca9a5a0194e5c41bd1abd032af3dd4545","observation_id":"e82255d5-fafd-40d0-857b-3536af06b0d7","resolution":{"observed_at":"2026-08-07T15:34:53.601769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:55.364923Z","title":"Partially Adhered","venue":null,"work_id":"96bf66ed-c058-4ede-869f-3e75824ece2a","year":null},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.781321Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:061dc2add6b594e1f667baf6a2d9df1c9c8efaa38ed00a756bee07a749e01f80","observation_id":"f22bab45-4e75-432a-8778-e7f7e5105b1a","resolution":{"observed_at":"2026-08-07T15:34:55.466419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:55.050032Z","title":"Useful but Incomplete","venue":null,"work_id":"228d0c94-171d-4890-b190-21af508097f4","year":null},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.828691Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:3b604d42d2b43ff50b72f29eda974e932bf0145e68d2a2899e22839053c04b2c","observation_id":"5065b370-aea8-49c4-9f0b-5c6e0df169ea","resolution":{"observed_at":"2026-08-07T15:34:55.250151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:54.768225Z","title":"Not Detailed","venue":null,"work_id":"e9db1e55-855f-4c1a-a488-63da2a69ea22","year":null},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.874909Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:b7941dbe20a9d8029894980b6272ec31a7e321ed7ec6a49c2a27254e76d7486b","observation_id":"51c7af70-e049-4117-9136-927f002999ed","resolution":{"observed_at":"2026-08-07T15:34:54.938238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:51.573946Z","title":"doi: 10.18653/v1/2024.emnlp-main.248","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:51.573946Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:a16c377bc509ee2ae457033163647163f9426a70402cda27fd94c4dac8c2d34a","observation_id":"7be62865-2f07-45af-bfcd-045c54341bcd","resolution":{"observed_at":"2026-08-07T15:34:51.573946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:55.657228Z","title":"\\boxed{Assistant 1}","venue":null,"work_id":"495e6f84-0968-4165-b08c-ca7cef92db81","year":null},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.714483Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:45d216734f2d5335e5a31ff162af2521a83052379e7cea599f5206a8ab0d347d","observation_id":"6be746c7-c633-497b-844a-2731a542c577","resolution":{"observed_at":"2026-08-07T15:34:55.665928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T23:08:09.834867Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model"},"reference_resolution":{"displayed":87,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":68,"verified_exact":1,"verified_fuzzy":18},"total_outbound_references":87},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 87 of 87 outbound references and 15 inbound Pith citation observations for arXiv:2505.14674."}