{"as_of":"2026-08-09T19:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b56737e3d6e79107626b2d19027d217342663ec964506a1afc55fc75e0850302","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":15,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":15,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":15,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:21:22.161333Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.21295","last_updated":"2025-03-27T09:23:08Z","snapshot_observed_at":"2026-08-07T16:33:25.868671Z","submitted_at":"2025-03-27T09:23:08Z","title":"R-PRM: Reasoning-Driven Process Reward Modeling","version":1},"cited_work":{"arxiv_id":"2503.21295","doi":"10.48550/arxiv.2503.21295","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.21295","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-prm: Reasoning-driven pro- cess reward modeling.arXiv preprint arXiv:2503.21295","venue":"ArXiv.org","work_id":"46479788-3f50-424f-aa2f-04533830e1ba","year":2025},"citing_paper":{"arxiv_id":"2502.17419","last_updated":"2025-06-25T02:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-24T18:50:52Z","title":"From System 1 to System 2: A Survey of Reasoning Large Language Models","version":6},"reference_index":166,"source":"pdf_text","source_observed_at":"2026-05-13T01:36:23.845366Z"},"links":{"cited_paper":"/paper/2503.21295","citing_paper":"/paper/2502.17419"},"observation_digest":"sha256:ea69f2a8fc639f593cbbd08d14e81ab05719a3094a8ffe5809aaae24b1460d21","observation_id":"4bcda4fe-1756-49ff-af56-4157e78c42d3","resolution":{"observed_at":"2026-05-13T01:36:24.184410Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21295","last_updated":"2025-03-27T09:23:08Z","snapshot_observed_at":"2026-08-07T16:33:25.868671Z","submitted_at":"2025-03-27T09:23:08Z","title":"R-PRM: Reasoning-Driven Process Reward Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21295","snapshot_observed_at":"2026-08-07T14:21:22.161333Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19250","last_updated":"2025-05-25T17:58:50Z","snapshot_observed_at":"2026-08-08T11:21:53.639135Z","submitted_at":"2025-05-25T17:58:50Z","title":"PATS: Process-Level Adaptive Thinking Mode Switching","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T14:21:22.161333Z"},"links":{"cited_paper":"/paper/2503.21295","citing_paper":"/paper/2505.19250"},"observation_digest":"sha256:cd061e11475d6d51ba245c08cc7e38bb76fa17d4853f953720cbca4cfb4115ea","observation_id":"41e25044-f111-4b51-9009-c90103c76094","resolution":{"observed_at":"2026-08-07T14:21:22.161333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21295","last_updated":"2025-03-27T09:23:08Z","snapshot_observed_at":"2026-08-07T16:33:25.868671Z","submitted_at":"2025-03-27T09:23:08Z","title":"R-PRM: Reasoning-Driven Process Reward Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21295","snapshot_observed_at":"2026-08-07T14:14:19.876368Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-07T14:05:32.700876Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:19.876368Z"},"links":{"cited_paper":"/paper/2503.21295","citing_paper":"/paper/2505.19706"},"observation_digest":"sha256:3a0f7a8070028f23baaf272ac7ffbe0302abf5adeaf6556f8fdb4762273eeb41","observation_id":"a86bc2bd-c4a8-4c07-8e90-39319c29e13c","resolution":{"observed_at":"2026-08-07T14:14:19.876368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21295","last_updated":"2025-03-27T09:23:08Z","snapshot_observed_at":"2026-08-07T16:33:25.868671Z","submitted_at":"2025-03-27T09:23:08Z","title":"R-PRM: Reasoning-Driven Process Reward Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21295","snapshot_observed_at":"2026-08-06T00:59:53.063654Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.04088","last_updated":"2025-08-07T03:52:48Z","snapshot_observed_at":"2026-08-08T12:10:28.774282Z","submitted_at":"2025-08-06T05:10:29Z","title":"GM-PRM: A Generative Multimodal Process Reward Model for Multimodal Mathematical Reasoning","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T00:59:53.063654Z"},"links":{"cited_paper":"/paper/2503.21295","citing_paper":"/paper/2508.04088"},"observation_digest":"sha256:a0f6a6dbba2bd051020a2c5518eb702d3c929a177109e1ffc94a6f1f6bbe6bc9","observation_id":"5faa7b4d-a619-40c7-960d-67388866537f","resolution":{"observed_at":"2026-08-06T00:59:53.063654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21295","last_updated":"2025-03-27T09:23:08Z","snapshot_observed_at":"2026-08-07T16:33:25.868671Z","submitted_at":"2025-03-27T09:23:08Z","title":"R-PRM: Reasoning-Driven Process Reward Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21295","snapshot_observed_at":"2026-08-05T23:29:17.085079Z","title":"R-prm: Reasoning-driven process reward modeling.arXiv preprint arXiv:2503.21295, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05383","last_updated":"2025-08-07T13:31:21Z","snapshot_observed_at":"2026-08-08T12:45:30.983934Z","submitted_at":"2025-08-07T13:31:21Z","title":"StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T23:29:17.085079Z"},"links":{"cited_paper":"/paper/2503.21295","citing_paper":"/paper/2508.05383"},"observation_digest":"sha256:f1d42a62abb57e9dfda4ff89b1d24186727f5f3f4ad7f8a1cd50b43bdd2b2652","observation_id":"718a23d0-7989-4f4c-9022-a75a6ae2d9d8","resolution":{"observed_at":"2026-08-05T23:29:17.085079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21295","last_updated":"2025-03-27T09:23:08Z","snapshot_observed_at":"2026-08-07T16:33:25.868671Z","submitted_at":"2025-03-27T09:23:08Z","title":"R-PRM: Reasoning-Driven Process Reward Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21295","snapshot_observed_at":"2026-08-05T23:25:50.437799Z","title":"R-prm: Reasoning-driven process reward modeling.arXiv preprint arXiv:2503.21295, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05388","last_updated":"2025-08-07T13:38:49Z","snapshot_observed_at":"2026-08-06T12:42:41.700036Z","submitted_at":"2025-08-07T13:38:49Z","title":"An Explainable Machine Learning Framework for Railway Predictive Maintenance using Data Streams from the Metro Operator of Portugal","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T23:25:50.437799Z"},"links":{"cited_paper":"/paper/2503.21295","citing_paper":"/paper/2508.05388"},"observation_digest":"sha256:9fad3da38cefd0d6548cad295c05070296b7f2c0571ad47c4f0511ff7e4b577c","observation_id":"d56a3dea-70eb-4900-b1f1-aac1f265c022","resolution":{"observed_at":"2026-08-05T23:25:50.437799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21295","last_updated":"2025-03-27T09:23:08Z","snapshot_observed_at":"2026-08-07T16:33:25.868671Z","submitted_at":"2025-03-27T09:23:08Z","title":"R-PRM: Reasoning-Driven Process Reward Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21295","snapshot_observed_at":"2026-08-05T22:58:50.079618Z","title":"arXiv:2503.21295","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06124","last_updated":"2025-08-08T08:43:24Z","snapshot_observed_at":"2026-08-08T14:46:37.801934Z","submitted_at":"2025-08-08T08:43:24Z","title":"AURA: Affordance-Understanding and Risk-aware Alignment Technique for Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:50.079618Z"},"links":{"cited_paper":"/paper/2503.21295","citing_paper":"/paper/2508.06124"},"observation_digest":"sha256:a6133c35a1d790e54b582ba918d44da2697642b0a4737939506728a25b103516","observation_id":"f55eaf23-b8f5-4587-8d6a-d6dca882a93c","resolution":{"observed_at":"2026-08-05T22:58:50.079618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21295","last_updated":"2025-03-27T09:23:08Z","snapshot_observed_at":"2026-08-07T16:33:25.868671Z","submitted_at":"2025-03-27T09:23:08Z","title":"R-PRM: Reasoning-Driven Process Reward Modeling","version":1},"cited_work":{"arxiv_id":"2503.21295","doi":"10.48550/arxiv.2503.21295","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.21295","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-prm: Reasoning-driven pro- cess reward modeling.arXiv preprint arXiv:2503.21295","venue":"ArXiv.org","work_id":"46479788-3f50-424f-aa2f-04533830e1ba","year":2025},"citing_paper":{"arxiv_id":"2510.14703","last_updated":"2026-04-28T18:17:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-16T14:06:03Z","title":"ToolPRM: Fine-Grained Inference Scaling of Structured Outputs for Function Calling","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-18T06:30:39.858246Z"},"links":{"cited_paper":"/paper/2503.21295","citing_paper":"/paper/2510.14703"},"observation_digest":"sha256:7e7d70f9eb79efe921474a662e9926430341595b92570dc6f40c3955ce054732","observation_id":"a393c6a9-5bd3-4a51-8cf1-56aecfb7a3fa","resolution":{"observed_at":"2026-05-18T06:30:59.606855Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21295","last_updated":"2025-03-27T09:23:08Z","snapshot_observed_at":"2026-08-07T16:33:25.868671Z","submitted_at":"2025-03-27T09:23:08Z","title":"R-PRM: Reasoning-Driven Process Reward Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21295","snapshot_observed_at":"2026-08-03T20:43:42.331901Z","title":"R-PRM: reasoning- driven process reward modeling.CoRR, abs/2503.21295, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18760","last_updated":"2026-05-29T09:54:53Z","snapshot_observed_at":"2026-08-07T08:32:25.045481Z","submitted_at":"2025-11-24T04:50:18Z","title":"HERMES: Towards Efficient and Verifiable Mathematical Reasoning in LLMs","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T20:43:42.331901Z"},"links":{"cited_paper":"/paper/2503.21295","citing_paper":"/paper/2511.18760"},"observation_digest":"sha256:746938011ae86222ec47291ee6ac95d386d0aee00291191c96eb68ff8cd314ed","observation_id":"2a30bd6c-6d1a-4085-ae26-802f37b13c27","resolution":{"observed_at":"2026-08-03T20:43:42.331901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21295","last_updated":"2025-03-27T09:23:08Z","snapshot_observed_at":"2026-08-07T16:33:25.868671Z","submitted_at":"2025-03-27T09:23:08Z","title":"R-PRM: Reasoning-Driven Process Reward Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21295","snapshot_observed_at":"2026-08-03T03:04:44.303909Z","title":"R-prm: Reasoning- driven process reward modeling.arXiv preprint arXiv:2503.21295,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.09305","last_updated":"2026-06-28T18:13:37Z","snapshot_observed_at":"2026-08-08T13:06:41.126177Z","submitted_at":"2026-02-10T00:45:24Z","title":"Reward Modeling for Reinforcement Learning-Based LLM Reasoning: Design, Challenges, and Evaluation","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:44.303909Z"},"links":{"cited_paper":"/paper/2503.21295","citing_paper":"/paper/2602.09305"},"observation_digest":"sha256:4e83a1bea0b7d0f1ae839eb09d61d333c312c27cc0dddf18305713f322962d98","observation_id":"4fd6eea1-b460-4f99-8258-c69097cc812c","resolution":{"observed_at":"2026-08-03T03:04:44.303909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21295","last_updated":"2025-03-27T09:23:08Z","snapshot_observed_at":"2026-08-07T16:33:25.868671Z","submitted_at":"2025-03-27T09:23:08Z","title":"R-PRM: Reasoning-Driven Process Reward Modeling","version":1},"cited_work":{"arxiv_id":"2503.21295","doi":"10.48550/arxiv.2503.21295","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.21295","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-prm: Reasoning-driven pro- cess reward modeling.arXiv preprint arXiv:2503.21295","venue":"ArXiv.org","work_id":"46479788-3f50-424f-aa2f-04533830e1ba","year":2025},"citing_paper":{"arxiv_id":"2604.15725","last_updated":"2026-04-17T05:56:46Z","snapshot_observed_at":"2026-07-06T23:03:12.000381Z","submitted_at":"2026-04-17T05:56:46Z","title":"Reasoning-targeted Jailbreak Attacks on Large Reasoning Models via Semantic Triggers and Psychological Framing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T08:24:43.494005Z"},"links":{"cited_paper":"/paper/2503.21295","citing_paper":"/paper/2604.15725"},"observation_digest":"sha256:58ab7dbf3aeb927c930fd5258a7579ff37419ecd0863ed3b59cb3a121701b241","observation_id":"b4ee02a4-07ff-42d9-81b8-cb80e3007941","resolution":{"observed_at":"2026-05-10T09:08:26.234113Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21295","last_updated":"2025-03-27T09:23:08Z","snapshot_observed_at":"2026-08-07T16:33:25.868671Z","submitted_at":"2025-03-27T09:23:08Z","title":"R-PRM: Reasoning-Driven Process Reward Modeling","version":1},"cited_work":{"arxiv_id":"2503.21295","doi":"10.48550/arxiv.2503.21295","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.21295","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-prm: Reasoning-driven pro- cess reward modeling.arXiv preprint arXiv:2503.21295","venue":"ArXiv.org","work_id":"46479788-3f50-424f-aa2f-04533830e1ba","year":2025},"citing_paper":{"arxiv_id":"2604.19656","last_updated":"2026-04-21T16:45:29Z","snapshot_observed_at":"2026-07-06T23:06:16.972438Z","submitted_at":"2026-04-21T16:45:29Z","title":"Pause or Fabricate? Training Language Models for Grounded Reasoning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-10T03:01:58.366028Z"},"links":{"cited_paper":"/paper/2503.21295","citing_paper":"/paper/2604.19656"},"observation_digest":"sha256:57224cbb3e2c424d4bab677c12d3991f41b35d2ed98f7bc4fd3b5f321a88c86c","observation_id":"8576d876-f414-40ab-ae32-bc9bbf4c0dd7","resolution":{"observed_at":"2026-05-10T03:03:36.662326Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21295","last_updated":"2025-03-27T09:23:08Z","snapshot_observed_at":"2026-08-07T16:33:25.868671Z","submitted_at":"2025-03-27T09:23:08Z","title":"R-PRM: Reasoning-Driven Process Reward Modeling","version":1},"cited_work":{"arxiv_id":"2503.21295","doi":"10.48550/arxiv.2503.21295","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.21295","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-prm: Reasoning-driven pro- cess reward modeling.arXiv preprint arXiv:2503.21295","venue":"ArXiv.org","work_id":"46479788-3f50-424f-aa2f-04533830e1ba","year":2025},"citing_paper":{"arxiv_id":"2605.15951","last_updated":"2026-05-15T13:41:41Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T13:41:41Z","title":"From Failure to Feedback: Group Revision Unlocks Hard Cases in Object-Level Grounding","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-20T18:39:11.904941Z"},"links":{"cited_paper":"/paper/2503.21295","citing_paper":"/paper/2605.15951"},"observation_digest":"sha256:d0f6e49eb52ab1b8d971825ce095cdc7ab0a405842bb9641fb8bed80a5d24a9e","observation_id":"63e4b679-207e-4c0d-a4bd-32fea6b1e59b","resolution":{"observed_at":"2026-05-20T18:43:38.772927Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21295","last_updated":"2025-03-27T09:23:08Z","snapshot_observed_at":"2026-08-07T16:33:25.868671Z","submitted_at":"2025-03-27T09:23:08Z","title":"R-PRM: Reasoning-Driven Process Reward Modeling","version":1},"cited_work":{"arxiv_id":"2503.21295","doi":"10.48550/arxiv.2503.21295","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.21295","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-prm: Reasoning-driven pro- cess reward modeling.arXiv preprint arXiv:2503.21295","venue":"ArXiv.org","work_id":"46479788-3f50-424f-aa2f-04533830e1ba","year":2025},"citing_paper":{"arxiv_id":"2606.12578","last_updated":"2026-06-10T18:26:11Z","snapshot_observed_at":"2026-08-02T21:20:28.323048Z","submitted_at":"2026-06-10T18:26:11Z","title":"MARD: Mirror-Augmented Reasoning Distillation for Mechanism-Level Drug-Drug Interaction Prediction","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-27T09:44:38.871250Z"},"links":{"cited_paper":"/paper/2503.21295","citing_paper":"/paper/2606.12578"},"observation_digest":"sha256:9a970ca28147b36729df8a2a7fec28659ee363f86e1b6676a4feb30268309691","observation_id":"24989b75-f624-45b4-a5ac-7d75c5c20002","resolution":{"observed_at":"2026-07-03T10:58:03.356407Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21295","last_updated":"2025-03-27T09:23:08Z","snapshot_observed_at":"2026-08-07T16:33:25.868671Z","submitted_at":"2025-03-27T09:23:08Z","title":"R-PRM: Reasoning-Driven Process Reward Modeling","version":1},"cited_work":{"arxiv_id":"2503.21295","doi":"10.48550/arxiv.2503.21295","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.21295","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R-prm: Reasoning-driven pro- cess reward modeling.arXiv preprint arXiv:2503.21295","venue":"ArXiv.org","work_id":"46479788-3f50-424f-aa2f-04533830e1ba","year":2025},"citing_paper":{"arxiv_id":"2606.27369","last_updated":"2026-06-25T17:59:36Z","snapshot_observed_at":"2026-08-03T05:17:54.539513Z","submitted_at":"2026-06-25T17:59:36Z","title":"Reinforcement Learning without Ground-Truth Solutions can Improve LLMs","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-06-26T04:47:47.691913Z"},"links":{"cited_paper":"/paper/2503.21295","citing_paper":"/paper/2606.27369"},"observation_digest":"sha256:861d7ee5e6c2f40cc18e131e06f98676ac5602cc05482941eee7d6cf2aad4e9b","observation_id":"8a8debba-b69b-46d0-8a60-8c98e2030c48","resolution":{"observed_at":"2026-07-04T13:59:51.863366Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2503.21295/citation-record","integrity":"/paper/2503.21295/integrity","json":"/paper/2503.21295/citation-record.json","paper":"/paper/2503.21295"},"outbound":[],"paper":{"arxiv_id":"2503.21295","last_updated":"2025-03-27T09:23:08Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T16:33:25.868671Z","submitted_at":"2025-03-27T09:23:08Z","title":"R-PRM: Reasoning-Driven Process Reward Modeling"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 15 inbound Pith citation observations for arXiv:2503.21295."}