{"as_of":"2026-08-10T08:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ee9d805b41fe10056588765c3fb8f1c1cb90ccf02e20c58ca8115b1200f2eae0","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:09:56.857674Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T04:27:05.232691Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T20:56:13.265666Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"cited_work":{"arxiv_id":"2505.16265","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16265","snapshot_observed_at":"2026-07-01T20:56:13.265666Z","title":"arXiv preprint arXiv:2505.16265 , year =","venue":null,"work_id":"4ba01bf4-b9f0-48cc-8af7-9f19018b90ec","year":2025},"citing_paper":{"arxiv_id":"2508.03556","last_updated":"2026-06-01T05:14:12Z","snapshot_observed_at":"2026-08-06T04:27:04.622929Z","submitted_at":"2025-08-05T15:25:24Z","title":"VRPRM: Process Reward Modeling via Visual Reasoning","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T12:20:17.430881Z"},"links":{"cited_paper":"/paper/2505.16265","citing_paper":"/paper/2508.03556"},"observation_digest":"sha256:ebe938acf8bc1828075c2f837adc5d4dba58ef64f7e87975b8f6115326697554","observation_id":"09ba2b4f-5426-456b-8e8d-e3b90054b011","resolution":{"observed_at":"2026-05-22T12:21:30.982861Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16265","snapshot_observed_at":"2026-08-06T04:27:05.232691Z","title":"arXiv preprint arXiv:2505.16265","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03556","last_updated":"2026-06-01T05:14:12Z","snapshot_observed_at":"2026-08-06T04:27:04.622929Z","submitted_at":"2025-08-05T15:25:24Z","title":"VRPRM: Process Reward Modeling via Visual Reasoning","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T04:27:05.232691Z"},"links":{"cited_paper":"/paper/2505.16265","citing_paper":"/paper/2508.03556"},"observation_digest":"sha256:1616b309df0903f0fe67fb740d4f971b9e1c0d182b5f2a889753d609087317a7","observation_id":"d56e645e-ecad-49e2-beb1-9b4a70e64d7c","resolution":{"observed_at":"2026-08-06T04:27:05.232691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"cited_work":{"arxiv_id":"2505.16265","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16265","snapshot_observed_at":"2026-07-01T20:56:13.265666Z","title":"arXiv preprint arXiv:2505.16265 , year =","venue":null,"work_id":"4ba01bf4-b9f0-48cc-8af7-9f19018b90ec","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":266,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2505.16265","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:30daa5fa15532bd06d3393350a1851dc74f84bb5ae96b485a7c530c5869e5247","observation_id":"a4e76bdc-41c2-4d56-a2ec-563800eacb62","resolution":{"observed_at":"2026-05-18T19:21:48.839803Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"cited_work":{"arxiv_id":"2505.16265","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16265","snapshot_observed_at":"2026-07-01T20:56:13.265666Z","title":"arXiv preprint arXiv:2505.16265 , year =","venue":null,"work_id":"4ba01bf4-b9f0-48cc-8af7-9f19018b90ec","year":2025},"citing_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-08-06T15:38:05.011922Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"reference_index":196,"source":"arxiv_source","source_observed_at":"2026-05-18T00:02:24.352947Z"},"links":{"cited_paper":"/paper/2505.16265","citing_paper":"/paper/2509.08827"},"observation_digest":"sha256:b414897b28e3513669048c16cc23427505536d1f7f4e905087b675ffb0e72996","observation_id":"d543c8c8-7392-4f7c-a4c7-18eb6997aa46","resolution":{"observed_at":"2026-05-18T00:05:31.521389Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"cited_work":{"arxiv_id":"2505.16265","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16265","snapshot_observed_at":"2026-07-01T20:56:13.265666Z","title":"arXiv preprint arXiv:2505.16265 , year =","venue":null,"work_id":"4ba01bf4-b9f0-48cc-8af7-9f19018b90ec","year":2025},"citing_paper":{"arxiv_id":"2604.27505","last_updated":"2026-05-20T07:08:10Z","snapshot_observed_at":"2026-07-06T23:12:57.730833Z","submitted_at":"2026-04-30T06:54:39Z","title":"Leveraging Verifier-Based Reinforcement Learning in Image Editing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-07T08:00:33.307429Z"},"links":{"cited_paper":"/paper/2505.16265","citing_paper":"/paper/2604.27505"},"observation_digest":"sha256:7b3bddac8f210570ef49b496fb95258d59869d621e9ddb7f7ed9361f77c26f53","observation_id":"6a7b75e1-8549-4c77-a49b-f46d21f74ffc","resolution":{"observed_at":"2026-05-12T10:06:27.574471Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"cited_work":{"arxiv_id":"2505.16265","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16265","snapshot_observed_at":"2026-07-01T20:56:13.265666Z","title":"arXiv preprint arXiv:2505.16265 , year =","venue":null,"work_id":"4ba01bf4-b9f0-48cc-8af7-9f19018b90ec","year":2025},"citing_paper":{"arxiv_id":"2604.27505","last_updated":"2026-05-20T07:08:10Z","snapshot_observed_at":"2026-07-06T23:12:57.730833Z","submitted_at":"2026-04-30T06:54:39Z","title":"Leveraging Verifier-Based Reinforcement Learning in Image Editing","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-21T09:11:02.183133Z"},"links":{"cited_paper":"/paper/2505.16265","citing_paper":"/paper/2604.27505"},"observation_digest":"sha256:df50981f59df71bf61c08ba4c8448b6a4c5ffa39bd250f1f87671bf8febe49bb","observation_id":"7c2feb22-2a50-40a3-a289-dbdae529330b","resolution":{"observed_at":"2026-05-21T09:14:06.015503Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"cited_work":{"arxiv_id":"2505.16265","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16265","snapshot_observed_at":"2026-07-01T20:56:13.265666Z","title":"arXiv preprint arXiv:2505.16265 , year =","venue":null,"work_id":"4ba01bf4-b9f0-48cc-8af7-9f19018b90ec","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":153,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2505.16265","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:eaade041f00cbfc33c27b593b2e16f6b8fe2bb6d657d26aa13553430a5f5a5c2","observation_id":"1c86b97d-afc4-47f6-b8d9-8d25caf5fcec","resolution":{"observed_at":"2026-07-01T20:56:13.267006Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.16265/citation-record","integrity":"/paper/2505.16265/integrity","json":"/paper/2505.16265/citation-record.json","paper":"/paper/2505.16265"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-07T15:09:52.682509Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback.arXiv preprint arXiv:2204.05862, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:52.682509Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:911010dcc762f5b8b4ede0a2df4db0f32a95b9c93fc84534338e0d30d4f73f7d","observation_id":"c58bb891-0435-43ff-9642-7742c8b15d5b","resolution":{"observed_at":"2026-08-07T15:09:52.682509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:52.737506Z","title":"Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:52.737506Z"},"links":{"citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:a8af778a3d759dfe3975b9e435ace7f7c1a589f4ff7a74ffe5023d2dc106c2b5","observation_id":"59bfa91b-2909-4427-9ccd-c67d9ec13674","resolution":{"observed_at":"2026-08-07T15:09:52.737506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:52.808601Z","title":"Self-instruct: Aligning language models with self-generated in- structions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:52.808601Z"},"links":{"citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:321c2fd319b49afea50a4e48312fee4f10cc45380d49cad1ceec2d50a240c1b0","observation_id":"f07ae36f-c76b-4d7c-8c1f-f222743a2dc6","resolution":{"observed_at":"2026-08-07T15:09:52.808601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:52.870219Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:52.870219Z"},"links":{"citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:b0257aeaf39add2c86b7a6e69a5978e5a644632743704cfc561bc6dce08abb23","observation_id":"43a330cc-1fed-4d3c-9827-4ac2971ef4f5","resolution":{"observed_at":"2026-08-07T15:09:52.870219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-08-07T15:09:52.975342Z","title":"Solving math word problems with process-and outcome-based feedback.arXiv preprint arXiv:2211.14275, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:52.975342Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:9dc1e82d326add9ddbecb2bb40bb67af79c7c1b0617031266501110633309092","observation_id":"d72f5654-f8a9-48f7-8ff6-9ad313727da2","resolution":{"observed_at":"2026-08-07T15:09:52.975342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:53.051311Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:53.051311Z"},"links":{"citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:569278af58cfc5db6ee74f9a1d45d830a9fc5d0d63588eb338941a34d541a9ca","observation_id":"923b156a-bd74-4bff-985b-e3b4802d60f3","resolution":{"observed_at":"2026-08-07T15:09:53.051311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08935","last_updated":"2024-02-19T14:07:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-14T13:41:54Z","title":"Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08935","snapshot_observed_at":"2026-08-07T15:09:53.131349Z","title":"Math-shepherd: Verify and reinforce llms step-by-step without human annotations.arXiv preprint arXiv:2312.08935, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:53.131349Z"},"links":{"cited_paper":"/paper/2312.08935","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:2e0312fea3fde2ac3d1f62836a779086f5d758ae1b0839d6302717d344b2b852","observation_id":"a518297f-2337-45c0-949c-ee65ff909fff","resolution":{"observed_at":"2026-08-07T15:09:53.131349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-07T15:09:53.173407Z","title":"Teaching large language models to reason with reinforcement learning.arXiv preprint arXiv:2403.04642, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:53.173407Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:4ff0109164066ab4a174f1f87877b027c7e361f41aaf1c3b3d613c4895b280ad","observation_id":"d19f54ef-db2a-4b5b-867e-f353c9648dd4","resolution":{"observed_at":"2026-08-07T15:09:53.173407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:59.526695Z","title":"Beavertails: Towards improved safety alignment of LLM via a human-preference dataset","venue":null,"work_id":"5b97b110-cd6d-4f9c-94dd-5ac982416b22","year":2023},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:53.261459Z"},"links":{"citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:0fbff19456d03773b7f27e977c51aae7474ddfa596fec249c1d40d9dd7b9b02f","observation_id":"95b87412-9d1f-44a2-84a9-81f256e99745","resolution":{"observed_at":"2026-08-07T15:09:59.615816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:53.325000Z","title":"Safe rlhf: Safe reinforcement learning from human feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:53.325000Z"},"links":{"citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:175af7c2145a7db7a34ad7599455655ca6b12a226a9b8e313f586374c1db55b5","observation_id":"b8da442f-c411-4031-8c19-ccdcebc0bbe0","resolution":{"observed_at":"2026-08-07T15:09:53.325000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01111","last_updated":"2024-11-02T02:22:21Z","snapshot_observed_at":"2026-08-08T06:48:58.388827Z","submitted_at":"2024-11-02T02:22:21Z","title":"Rule Based Rewards for Language Model Safety","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01111","snapshot_observed_at":"2026-08-07T15:09:53.390130Z","title":"Rule based rewards for language model safety.arXiv preprint arXiv:2411.01111, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:53.390130Z"},"links":{"cited_paper":"/paper/2411.01111","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:9b7224966425d3a59ffbcf55b7d719aad0ff2dba84cb842a5aa620a2d81e23f5","observation_id":"1be1e9ba-9aab-4af3-9a66-735e7c64dbff","resolution":{"observed_at":"2026-08-07T15:09:53.390130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:53.452403Z","title":"Deep reinforcement learning from human preferences.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:53.452403Z"},"links":{"citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:e772cc695c63eefd5e80000accec51b219e5d3bd392d0aeb4fe6703a7eae73e1","observation_id":"6a542a66-92af-4f80-9787-089b613587b3","resolution":{"observed_at":"2026-08-07T15:09:53.452403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:59.255426Z","title":"Ziegler, Ryan Lowe, Chelsea V oss, Alec Radford, Dario Amodei, and Paul F","venue":null,"work_id":"5bdb053f-471a-4dd0-b5c4-a71d40a5a89d","year":2020},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:53.539620Z"},"links":{"citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:dc5c1425e61cbc861f1bc2cfa4884601cc1d2b5c9a95b195a1cbfe517bb6973b","observation_id":"9714b577-6cec-468a-b8b7-8700d92a58cb","resolution":{"observed_at":"2026-08-07T15:09:59.370846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09244","last_updated":"2024-08-16T23:59:29Z","snapshot_observed_at":"2026-08-06T16:36:51.551387Z","submitted_at":"2023-12-14T18:59:04Z","title":"Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09244","snapshot_observed_at":"2026-08-07T15:09:53.635786Z","title":"Helping or herding? reward model ensembles mitigate but do not eliminate reward hacking.arXiv preprint arXiv:2312.09244, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:53.635786Z"},"links":{"cited_paper":"/paper/2312.09244","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:306701aea9df33496501a1dba68b0da1e84be82a2d45617e1bae701cfb1ab461","observation_id":"f9169d0a-e4b5-4e96-b42f-62d01dd8571c","resolution":{"observed_at":"2026-08-07T15:09:53.635786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:53.734461Z","title":"Scaling laws for reward model overoptimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:53.734461Z"},"links":{"citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:ce8b52b74248f82c36f437393041445b18cc136893a5b77f449025c94f284017","observation_id":"2e3a2de9-5eb9-4149-98b7-fb67fb6bd51f","resolution":{"observed_at":"2026-08-07T15:09:53.734461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-09T00:20:15.609286Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-08-07T15:09:53.852749Z","title":"Direct language model alignment from online ai feedback.arXiv preprint arXiv:2402.04792, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:53.852749Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:98af12560a96652468fbf324671483fcf976f775fb065e5fee315be2813d3eb0","observation_id":"9cb827c2-9926-4f6e-8717-aabe5f2532a0","resolution":{"observed_at":"2026-08-07T15:09:53.852749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13156","last_updated":"2025-02-27T16:30:42Z","snapshot_observed_at":"2026-07-06T19:18:27.644746Z","submitted_at":"2024-09-20T01:46:07Z","title":"RRM: Robust Reward Model Training Mitigates Reward Hacking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.13156","snapshot_observed_at":"2026-08-07T15:09:53.954441Z","title":"Rrm: Robust reward model training mitigates reward hacking","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:53.954441Z"},"links":{"cited_paper":"/paper/2409.13156","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:6dc4fa3f9b015d9faa5b7e756dbfbf82e24f1653c579c79fe6c5476d3d731056","observation_id":"31781822-1fb8-43b9-b342-af1f9554021d","resolution":{"observed_at":"2026-08-07T15:09:53.954441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20850","last_updated":"2024-10-18T15:43:02Z","snapshot_observed_at":"2026-07-06T18:23:19.450809Z","submitted_at":"2024-05-31T14:33:07Z","title":"Improving Reward Models with Synthetic Critiques","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20850","snapshot_observed_at":"2026-08-07T15:09:54.077941Z","title":"Improving reward models with synthetic critiques.arXiv preprint arXiv:2405.20850, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:54.077941Z"},"links":{"cited_paper":"/paper/2405.20850","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:d6ebce9c46070cc7bedc38ab431861192b145b71eae157b61b2607974f351b67","observation_id":"aa3293c5-7248-418f-b6d0-259228f7611e","resolution":{"observed_at":"2026-08-07T15:09:54.077941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11791","last_updated":"2024-08-21T17:24:15Z","snapshot_observed_at":"2026-08-10T02:45:59.371931Z","submitted_at":"2024-08-21T17:24:15Z","title":"Critique-out-Loud Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11791","snapshot_observed_at":"2026-08-07T15:09:54.211281Z","title":"Critique-out-loud reward models.arXiv preprint arXiv:2408.11791, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:54.211281Z"},"links":{"cited_paper":"/paper/2408.11791","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:d275459c59704929cf4be3bff3f2c4607e1c45e63b75f385f57ed40299050b5a","observation_id":"73873e99-f590-43c3-8f88-36992110828b","resolution":{"observed_at":"2026-08-07T15:09:54.211281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12832","last_updated":"2024-10-02T17:58:39Z","snapshot_observed_at":"2026-08-03T10:06:52.418096Z","submitted_at":"2024-10-02T17:58:39Z","title":"Generative Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12832","snapshot_observed_at":"2026-08-07T15:09:54.317164Z","title":"Generative reward models.arXiv preprint arXiv:2410.12832, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:54.317164Z"},"links":{"cited_paper":"/paper/2410.12832","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:6207d8ad2287259eddd1d5834136477780724b70ba716db57b18f202fb4f5aa8","observation_id":"02278e09-b24d-478b-8dae-36186b32ead0","resolution":{"observed_at":"2026-08-07T15:09:54.317164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16646","last_updated":"2025-02-09T07:53:38Z","snapshot_observed_at":"2026-08-07T22:19:32.261381Z","submitted_at":"2024-11-25T18:28:26Z","title":"Self-Generated Critiques Boost Reward Modeling for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16646","snapshot_observed_at":"2026-08-07T15:09:54.445894Z","title":"Self-generated critiques boost reward modeling for language models.arXiv preprint arXiv:2411.16646, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:54.445894Z"},"links":{"cited_paper":"/paper/2411.16646","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:eebf08b5044304b17d912b360768ece0807d63c77b9315e5a6f7dcb7b84fbdea","observation_id":"faf6a9ce-0c08-4f47-8de0-a77a1dec0b40","resolution":{"observed_at":"2026-08-07T15:09:54.445894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:59.074657Z","title":"Generative verifiers: Reward modeling as next-token prediction","venue":null,"work_id":"48410410-295e-455a-ab75-7bd27b9b4b68","year":2025},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:54.584180Z"},"links":{"citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:26929631bfa11428e7de9a1dec27e3540bdd0a55a739833de11ea64d81e44807","observation_id":"ab3d36a6-1f52-434c-a252-04f94a95dbe2","resolution":{"observed_at":"2026-08-07T15:09:59.140897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:54.673142Z","title":"Learning to reason with llms.OpenAI Blog, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:54.673142Z"},"links":{"citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:061c8d6e01e5dee4dcbdb3fd2ad117c769764ebf25c987937c27dd658c0f9209","observation_id":"ca8cef68-5cf3-4bfc-9169-7caea7e48c55","resolution":{"observed_at":"2026-08-07T15:09:54.673142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T15:09:54.768046Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:54.768046Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:5edaf0890c5615a4f9f2d82644d5da5690ff0d3a6d21b3414281f613ec9bfd69","observation_id":"c2ca967b-49ae-483d-a002-177acfefe3f3","resolution":{"observed_at":"2026-08-07T15:09:54.768046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-07T15:09:54.919059Z","title":"s1: Simple test-time scaling.arXiv preprint arXiv:2501.19393, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:54.919059Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:abb67f85286ae2b53077d74de976b8eb8e4817e9d75ee1e70378655db59d912d","observation_id":"d056e02f-8513-4fec-955c-7b8b41f8f23e","resolution":{"observed_at":"2026-08-07T15:09:54.919059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T15:09:55.000866Z","title":"Llama: Open and efficient foundation language models.arXiv preprint arXiv:2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:55.000866Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:ceeb44a94b558eaff85c54e6b35dd0c1b0cfd76d61d3cfc663682b3182f68e61","observation_id":"d21f3082-9dce-4316-a9f9-2f06c95f2fcf","resolution":{"observed_at":"2026-08-07T15:09:55.000866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T15:09:55.146505Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:55.146505Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:4b089713247691f2faedf5e0f0143edb7a7ecff49c12ead632068c21d1e1a1d3","observation_id":"b3c836f0-fc4e-4263-b699-052ca9d012b6","resolution":{"observed_at":"2026-08-07T15:09:55.146505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:55.283280Z","title":"RM-bench: Benchmarking reward models of language models with subtlety and style","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:55.283280Z"},"links":{"citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:e47a6862ef0a345c2e062c42d73d08f8f60269e4b35565960de24187293ceb0b","observation_id":"d6f6d54b-6ec2-4a63-9475-00a3d0475250","resolution":{"observed_at":"2026-08-07T15:09:55.283280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:55.398260Z","title":"Rank analysis of incomplete block designs: I","venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:55.398260Z"},"links":{"citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:fe9c0c867452f7c09649e4c56eb8a5d9069b6d6faabfc5767fbe3f13bd69db73","observation_id":"00e257ad-035a-4abd-8868-118ac98e178b","resolution":{"observed_at":"2026-08-07T15:09:55.398260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T15:09:55.488038Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:55.488038Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:d53bf2b2a6a8e89903d1c80de6bd7768869dc1d605cf8e72c98d469109ff4d7c","observation_id":"1f30d9f2-2268-4864-8233-10613ff33b72","resolution":{"observed_at":"2026-08-07T15:09:55.488038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T15:09:55.548298Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:55.548298Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:05f2b2f6446c6aad4f9752ba0d13169238763eb4d1c2a091f2d55d1f9b88c3db","observation_id":"82111220-12b3-46b0-8fc2-b0f3719e97c0","resolution":{"observed_at":"2026-08-07T15:09:55.548298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:55.607193Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena.Advances in Neural Information Processing Systems, 36:46595–46623, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:55.607193Z"},"links":{"citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:d455e150badc958decec99f1c18fa6982c41ed8c4d2257f03c679d09d2bd544e","observation_id":"315b6cf5-c3f8-4782-a3d8-6976fb258f4a","resolution":{"observed_at":"2026-08-07T15:09:55.607193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11874","last_updated":"2025-02-25T11:04:02Z","snapshot_observed_at":"2026-08-03T12:57:24.468891Z","submitted_at":"2024-05-20T08:30:13Z","title":"xFinder: Large Language Models as Automated Evaluators for Reliable Evaluation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11874","snapshot_observed_at":"2026-08-07T15:09:55.688065Z","title":"xfinder: Robust and pinpoint answer extraction for large language models.arXiv preprint arXiv:2405.11874, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:55.688065Z"},"links":{"cited_paper":"/paper/2405.11874","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:295cff0b65706641cd0f223bb8a37de51341b163a1219accee28afa7c9830d3b","observation_id":"405f8c7c-4d30-4e61-a0bd-a7d3597ff81a","resolution":{"observed_at":"2026-08-07T15:09:55.688065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:58.804020Z","title":"Chain of thought prompting elicits reasoning in large language models","venue":null,"work_id":"ca004e5c-f019-44cd-916a-0a8ea659b2ee","year":2022},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:55.756393Z"},"links":{"citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:c47ccc21fd144e14a4ae2d075210657f1070c36b901deea0eaa78d30c6f7b886","observation_id":"ea497a77-b5f1-46f0-a748-54aa1e3ede75","resolution":{"observed_at":"2026-08-07T15:09:58.870900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-07T15:09:55.832125Z","title":"Self-consistency improves chain of thought reasoning in language models.arXiv preprint arXiv:2203.11171, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:55.832125Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:10c3eb975735386ef36b6b3f25b082eb8d0e3bb85cea3609689f66dcccd6481d","observation_id":"4755a606-83be-4f69-839a-7730e7adbc10","resolution":{"observed_at":"2026-08-07T15:09:55.832125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:55.913418Z","title":"Tree of thoughts: Deliberate problem solving with large language models.Ad- vances in neural information processing systems, 36:11809–11822, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:55.913418Z"},"links":{"citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:5633860dd38ec27d61246ed79d8c6d6b8303c5976ebfba17a97b27f97355f333","observation_id":"95e5ed7f-22b3-4919-bbdc-19ac14b174d8","resolution":{"observed_at":"2026-08-07T15:09:55.913418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:58.612281Z","title":"Introducing openai o3 and o4-mini.OpenAI Blog, 2025","venue":null,"work_id":"af97d2b6-857f-41f3-8535-bfafbf88c6b8","year":2025},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:55.990614Z"},"links":{"citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:db3f7665894a0a6826477b93ff8697a6a2e39fc8cfb8739e34467fd037e576b4","observation_id":"f8eedf22-3a99-45bf-8183-efc9e4022c63","resolution":{"observed_at":"2026-08-07T15:09:58.678509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:56.047246Z","title":"Qwq-32b: Embracing the power of reinforcement learning, March 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:56.047246Z"},"links":{"citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:21052260d018b11a5f5df2971d569f1cc3fe57873e15e095c8c385ff0f2d6a4c","observation_id":"91ec9f65-4299-4d48-995d-13cef4560e11","resolution":{"observed_at":"2026-08-07T15:09:56.047246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:58.465558Z","title":"Grok 3 beta — the age of reasoning agents.xAI Blog, 2025","venue":null,"work_id":"8931d628-4aa6-4d03-a2e8-af99ad0d76c3","year":2025},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:56.122255Z"},"links":{"citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:91c4c009d461f08a1166ddd78e86de428ffe03b0c62a8715cb31a7463c038217","observation_id":"fef25670-483a-49d5-8d98-06f2cf72795a","resolution":{"observed_at":"2026-08-07T15:09:58.514382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:58.292455Z","title":"Helpsteer2-preference: Complementing ratings with prefer- ences","venue":null,"work_id":"24cc61ef-3ccd-41b6-8026-18636197b649","year":2025},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:56.198046Z"},"links":{"citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:bfcd2c271e8ee0d2af91907ac14278ef644ae1adfcbb19843bf0f3c6ab977b9d","observation_id":"1f226cff-6000-4620-a171-35e03b575a8b","resolution":{"observed_at":"2026-08-07T15:09:58.371923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T15:09:56.275062Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:56.275062Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:8f9c2f396efe4b81e8e10b0435bd22a8054a3ee638c220a8b7263af05acc093a","observation_id":"491e81c0-9044-40e1-ae49-84b255cc435f","resolution":{"observed_at":"2026-08-07T15:09:56.275062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-08-09T23:04:15.431743Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-07T15:09:56.314481Z","title":"High- dimensional continuous control using generalized advantage estimation.arXiv preprint arXiv:1506.02438, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:56.314481Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:bea50a6e7d11b5a8d32ae7c94ebf91ade7c9e041a9dbab4bfafcaff427704675","observation_id":"f9970fc8-6749-4400-8c26-6721eeff6864","resolution":{"observed_at":"2026-08-07T15:09:56.314481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04378","last_updated":"2025-05-30T16:42:57Z","snapshot_observed_at":"2026-08-07T17:24:57.547445Z","submitted_at":"2025-03-06T12:30:24Z","title":"HelpSteer3: Human-Annotated Feedback and Edit Data to Empower Inference-Time Scaling in Open-Ended General-Domain Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04378","snapshot_observed_at":"2026-08-07T15:09:56.386550Z","title":"Dedicated feedback and edit models empower inference- time scaling for open-ended general-domain tasks.arXiv preprint arXiv:2503.04378, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:56.386550Z"},"links":{"cited_paper":"/paper/2503.04378","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:30d8d7c5b9b78a0dce24dc31472f0bd84ba8e215e788cfe8d78c5e6e18f28586","observation_id":"2c5bc38d-4ee2-48c6-b992-dabbb58dff82","resolution":{"observed_at":"2026-08-07T15:09:56.386550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-07T15:09:56.474821Z","title":"Rewardbench: Evaluating reward models for language modeling.arXiv preprint arXiv:2403.13787, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:56.474821Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:50d49065cb30e0cdd691a6dc9c7019adee0ab62d52082acbca9ecb261b9ad61d","observation_id":"c77ff6d2-21a3-4b1c-b875-fabd16585d9a","resolution":{"observed_at":"2026-08-07T15:09:56.474821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:09:58.176163Z","title":"Length-controlled alpacaeval: A simple debiasing of automatic evaluators","venue":null,"work_id":"a7774a56-cc44-418b-86e6-0fcae4268244","year":2024},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:56.552982Z"},"links":{"citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:a89bf36d58d66a256dca8152f3a0862196fb858a809427b0363a9238321aee61","observation_id":"ff40040a-91c2-4b89-acc5-7b8adba6ef66","resolution":{"observed_at":"2026-08-07T15:09:58.236959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11143","last_updated":"2025-10-09T12:22:46Z","snapshot_observed_at":"2026-07-31T12:28:37.704994Z","submitted_at":"2024-05-20T01:04:40Z","title":"OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11143","snapshot_observed_at":"2026-08-07T15:09:56.640514Z","title":"Openrlhf: An easy-to-use, scalable and high-performance rlhf framework.arXiv preprint arXiv:2405.11143, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:56.640514Z"},"links":{"cited_paper":"/paper/2405.11143","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:fc9fe01dc77d62c262a42765c9071365d454dff2ef38d3263a58b88d94fd13e8","observation_id":"f22dc59e-be31-420c-83ff-cf2f8ae7d59d","resolution":{"observed_at":"2026-08-07T15:09:56.640514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-07T15:09:56.727030Z","title":"Hybridflow: A flexible and efficient rlhf framework.arXiv preprint arXiv: 2409.19256, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:56.727030Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:f2f4341b4edc529db357704c6ff9df6f522a6adcd8f6994cd09cf847382fffd7","observation_id":"855b4e30-ca65-46b9-8145-2edb3eeeaab0","resolution":{"observed_at":"2026-08-07T15:09:56.727030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T15:09:56.803561Z","title":"Adam: A method for stochastic optimization.arXiv preprint arXiv:1412.6980, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:56.803561Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:8033ea382a9b1769384db6ed7f07f88b02048febf25eaf9ca3c25afbc6b65793","observation_id":"3f293609-f5a0-4863-ace7-1a3fb58bb197","resolution":{"observed_at":"2026-08-07T15:09:56.803561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T15:09:56.857674Z","title":"Decoupled weight decay regularization.arXiv preprint arXiv:1711.05101, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:56.857674Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:818805e427422d595805ad131fb20227f1a91cab2418466c1d3fe1eefc2b5ba1","observation_id":"6a916405-9325-47ba-adc5-217306390a62","resolution":{"observed_at":"2026-08-07T15:09:56.857674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T02:46:23.365149Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 7 inbound Pith citation observations for arXiv:2505.16265."}